Nvidia logo
英伟达
AI Infrastructure Software Engineer — CosmosLab

AI Infrastructure Software Engineer — CosmosLab

发布于 大约 8 小时前

普通员工/个人贡献者

上海市 / 北京市
高级经验
全职员工
仅现场办公
本科
平台工程
Cuda
Dpo
Fsdp
Grpo
Megatron
Ppo
Pytorch
Rl
分布式训练

AI 估算 · 40k–70k

NVIDIA作为AI芯片巨头,该岗位为高级基础设施工程师,涉及分布式训练和RL系统,技能稀缺,薪资高于市场平均水平。上海/北京/深圳一线城市,月薪4-7万合理。

职位详情

关于这个职位

作为AI基础设施软件工程师,你将加入NVIDIA的Cosmos Lab,参与物理AI世界基础模型的训练基础设施构建,涵盖预训练、SFT和RL后训练

你将设计和优化大规模分布式训练系统,提升吞吐量和可靠性,推动AI前沿技术落地
适合拥有深厚分布式系统经验、热爱挑战的工程师

最低要求

· 5年以上大型AI或分布式系统的软件基础设施开发经验

· 计算机科学或相关技术领域本科及以上学历(或同等经验)
· 具备从AI应用层到GPU/硬件层的跨栈调试和故障排查能力
· 有构建和扩展大规模分布式系统的成功经验,最好是分布式训练或推理
· 有AI训练和/或推理基础设施的实践经验——RL/后训练、训练框架或推理服务
· 精通Python(及脚本),并具备扎实的软件工程实践:测试、防御性编程、版本控制和CI
· 出色的沟通和协作能力
有求知欲、解决问题的能力和意愿

工作职责

· 创建并实现覆盖物理AI世界基础模型的预训练、SFT和RL后训练的训练基础设施,包括框架和跨集群控制平面,以高效协调工作负载

· 开发和改进预训练及SFT流水线——大规模数据加载、分布式训练和检查点——以实现高吞吐量和可扩展性
· 开发和改进推理与评估栈,包括推理引擎、推理/生成流水线(也支持RL rollout)和评估流水线,使用连续批处理和KV-cache管理等方法实现高吞吐和低延迟
· 构建和改进RL系统各角色(策略、rollout、奖励、仿真)之间的有效交互和数据流,同时研究系统级优化机会
· 集成和编排仿真及机器人环境作为RL环境——驱动大规模仿真↔rollout↔训练循环
· 构建和完善分布式训练后端——分片/并行、混合精度、激活检查点以及跨多GPU的内存/吞吐优化
· 提高训练和RL工作负载的效率、可扩展性和弹性——关注容错、快速/弹性重启以及在抢占和硬件故障下的吞吐优化
· 定义有意义、可操作的可靠性和效率指标,以跟踪和改进系统可靠性
· 从应用层到框架、GPU和网络/硬件层,对失败进行根因分析、分类和解决

优先资格

· 有构建RL/后训练基础设施的经验——PPO/GRPO/DPO流程、rollout引擎和异步RL

· 有构建大规模、生产级预训练/SFT基础设施的经验
· 有将仿真/机器人环境集成到训练或RL循环中的经验——包括向量化环境和sim-to-real工作流
· 对深度学习框架内部有深入理解——PyTorch(FSDP/DTensor)和Megatron或同等经验、分布式训练及相关优化技术
· 熟练掌握C/C++/CUDA,用于性能关键组件和自定义内核

AI 洞察

优缺点分析

优点

  • NVIDIA是全球AI计算领导者,平台影响力大,技术氛围顶尖
  • 工作内容涉及AI最前沿的物理AI和RL基础设施,技术含金量极高
  • 薪资福利竞争力强,提供职业发展所需的资源和导师支持
  • 技术栈深度要求高,需要持续学习,对工程师综合能力要求严苛
  • 多城市协作可能带来沟通成本,且办公地点需根据项目调整

缺点 / 挑战

  • 工作强度可能较高,需要应对大规模分布式系统的复杂性和故障频发
  • 适合热爱挑战、对AI基础设施有强烈兴趣,并具备深厚系统技能的资深工程师

角色解读

  • 在NVIDIA可深耕AI基础设施领域,成为分布式训练或RL系统的技术专家
  • 有机会接触物理AI、世界模型等前沿方向,参与定义下一代AI基础设施架构
  • 可向技术管理方向发展,领导大型基础设施团队,或转向更核心的AI平台研发
  • 设计并实现大规模AI训练基础设施,包括预训练、SFT和RL后训练的数据流和分布式训练框架
  • 开发高性能推理引擎和生成流水线,利用连续批处理和KV-cache优化提升吞吐与降低延迟
  • 集成仿真和机器人环境作为RL环境,构建仿真↔rollout↔训练的大规模闭环系统
  • 负责系统级容错、弹性重启和性能优化,从应用层到GPU硬件层进行故障排查和根因分析
  • 扎实的分布式系统设计能力,熟悉分布式训练框架(如PyTorch FSDP/DTensor、Megatron)和并行策略
  • 精通Python和C++/CUDA,具备性能优化和自定义内核开发能力
  • 深入了解RL/后训练流程(PPO/GRPO/DPO),熟悉推理服务和高并发场景
  • 优秀的跨层调试和问题排查能力,能快速定位从应用到硬件的故障

申请策略

  • 了解NVIDIA Cosmos Lab的业务方向和物理AI的愿景,在面试中展现兴趣和思考
  • 准备好针对大规模系统可靠性设计的案例,体现工程深度和系统性思维
  • 突出大规模分布式系统设计和落地经验,尤其是训练或推理集群的优化案例
  • 强调RL/后训练项目经历,比如PPO/GRPO流水线构建或推理引擎开发
  • 展示性能优化成果,如CUDA内核优化、吞吐提升数据,以及故障排查案例
  • 提前熟悉PyTorch FSDP/DTensor、Megatron等框架的内部机制
  • 补充RL系统知识,了解异步RL、仿真环境集成等前沿实践

面试指南

  • 采用S.T.A.R.方法:先说明情境,再讲任务和行动,突出结果和数据
  • 强调系统设计思路:从需求分析、架构选择、权衡到实施和迭代
  • 展示跨层调试能力:从应用层、框架层到硬件层的系统排查方法
  • 你如何设计一个大规模分布式训练系统来支持RL后训练?关键考虑哪些因素?
  • 描述一次你排查分布式训练故障的经历,涉及哪些层?如何根因定位?
  • 如何优化推理引擎的吞吐量和延迟?用过哪些技术?
  • 解释PPO或GRPO的工作原理,在训练基础设施中如何实现异步RL?
  • 复习分布式训练的核心概念(数据并行、张量并行、流水线并行、检查点)

职位点评

79
综合评分

全球AI巨头核心实验室,前沿技术栈,高薪但WLB不明确,发展空间极大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术前沿、渴望在AI基础设施领域深耕,并能适应高强度工作的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值90

薪资福利

85较高

NVIDIA提供极具竞争力的薪资和福利套餐,但JD未具体说明数字,整体待遇行业领先。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

95较高

该职位处于AI基础设施前沿,接触物理AI和RL训练系统,技术成长空间巨大,并有机会与顶尖团队合作。

技术前沿前沿/新兴技术
技术栈PyTorch、Megatron、CUDA、分布式训练、RL、PPO、GRPO、DPO、FSDP、DTensor
业务类型ambiguous

工作生活

40较低

JD未提及远程或弹性工作,要求现场办公,且涉及大规模系统运维,工作强度可能较高,WLB不确定性大。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

90较高

工作直接推动物理AI和世界模型的发展,对AI未来有深远影响,使命感和意义感强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号make a lasting impact on the world
创新程度开拓性创新(行业首创)
Watch Jobs