
英伟达
AI Infrastructure Software Engineer — CosmosLab
AI Infrastructure Software Engineer — CosmosLab
发布于 大约 8 小时前普通员工/个人贡献者
上海市 / 北京市
高级经验
全职员工
仅现场办公
本科
平台工程
Cuda
Dpo
Fsdp
Grpo
Megatron
Ppo
Pytorch
Rl
分布式训练
AI 估算 · 40k–70k
NVIDIA作为AI芯片巨头,该岗位为高级基础设施工程师,涉及分布式训练和RL系统,技能稀缺,薪资高于市场平均水平。上海/北京/深圳一线城市,月薪4-7万合理。
职位详情
关于这个职位
作为AI基础设施软件工程师,你将加入NVIDIA的Cosmos Lab,参与物理AI世界基础模型的训练基础设施构建,涵盖预训练、SFT和RL后训练
你将设计和优化大规模分布式训练系统,提升吞吐量和可靠性,推动AI前沿技术落地
适合拥有深厚分布式系统经验、热爱挑战的工程师
最低要求
· 5年以上大型AI或分布式系统的软件基础设施开发经验
· 计算机科学或相关技术领域本科及以上学历(或同等经验)
· 具备从AI应用层到GPU/硬件层的跨栈调试和故障排查能力
· 有构建和扩展大规模分布式系统的成功经验,最好是分布式训练或推理
· 有AI训练和/或推理基础设施的实践经验——RL/后训练、训练框架或推理服务
· 精通Python(及脚本),并具备扎实的软件工程实践:测试、防御性编程、版本控制和CI
· 出色的沟通和协作能力
有求知欲、解决问题的能力和意愿
工作职责
· 创建并实现覆盖物理AI世界基础模型的预训练、SFT和RL后训练的训练基础设施,包括框架和跨集群控制平面,以高效协调工作负载
· 开发和改进预训练及SFT流水线——大规模数据加载、分布式训练和检查点——以实现高吞吐量和可扩展性
· 开发和改进推理与评估栈,包括推理引擎、推理/生成流水线(也支持RL rollout)和评估流水线,使用连续批处理和KV-cache管理等方法实现高吞吐和低延迟
· 构建和改进RL系统各角色(策略、rollout、奖励、仿真)之间的有效交互和数据流,同时研究系统级优化机会
· 集成和编排仿真及机器人环境作为RL环境——驱动大规模仿真↔rollout↔训练循环
· 构建和完善分布式训练后端——分片/并行、混合精度、激活检查点以及跨多GPU的内存/吞吐优化
· 提高训练和RL工作负载的效率、可扩展性和弹性——关注容错、快速/弹性重启以及在抢占和硬件故障下的吞吐优化
· 定义有意义、可操作的可靠性和效率指标,以跟踪和改进系统可靠性
· 从应用层到框架、GPU和网络/硬件层,对失败进行根因分析、分类和解决
优先资格
· 有构建RL/后训练基础设施的经验——PPO/GRPO/DPO流程、rollout引擎和异步RL
· 有构建大规模、生产级预训练/SFT基础设施的经验
· 有将仿真/机器人环境集成到训练或RL循环中的经验——包括向量化环境和sim-to-real工作流
· 对深度学习框架内部有深入理解——PyTorch(FSDP/DTensor)和Megatron或同等经验、分布式训练及相关优化技术
· 熟练掌握C/C++/CUDA,用于性能关键组件和自定义内核
AI 洞察
优缺点分析
优点
- NVIDIA是全球AI计算领导者,平台影响力大,技术氛围顶尖
- 工作内容涉及AI最前沿的物理AI和RL基础设施,技术含金量极高
- 薪资福利竞争力强,提供职业发展所需的资源和导师支持
- 技术栈深度要求高,需要持续学习,对工程师综合能力要求严苛
- 多城市协作可能带来沟通成本,且办公地点需根据项目调整
缺点 / 挑战
- 工作强度可能较高,需要应对大规模分布式系统的复杂性和故障频发
- 适合热爱挑战、对AI基础设施有强烈兴趣,并具备深厚系统技能的资深工程师
角色解读
- 在NVIDIA可深耕AI基础设施领域,成为分布式训练或RL系统的技术专家
- 有机会接触物理AI、世界模型等前沿方向,参与定义下一代AI基础设施架构
- 可向技术管理方向发展,领导大型基础设施团队,或转向更核心的AI平台研发
- 设计并实现大规模AI训练基础设施,包括预训练、SFT和RL后训练的数据流和分布式训练框架
- 开发高性能推理引擎和生成流水线,利用连续批处理和KV-cache优化提升吞吐与降低延迟
- 集成仿真和机器人环境作为RL环境,构建仿真↔rollout↔训练的大规模闭环系统
- 负责系统级容错、弹性重启和性能优化,从应用层到GPU硬件层进行故障排查和根因分析
- 扎实的分布式系统设计能力,熟悉分布式训练框架(如PyTorch FSDP/DTensor、Megatron)和并行策略
- 精通Python和C++/CUDA,具备性能优化和自定义内核开发能力
- 深入了解RL/后训练流程(PPO/GRPO/DPO),熟悉推理服务和高并发场景
- 优秀的跨层调试和问题排查能力,能快速定位从应用到硬件的故障
申请策略
- 了解NVIDIA Cosmos Lab的业务方向和物理AI的愿景,在面试中展现兴趣和思考
- 准备好针对大规模系统可靠性设计的案例,体现工程深度和系统性思维
- 突出大规模分布式系统设计和落地经验,尤其是训练或推理集群的优化案例
- 强调RL/后训练项目经历,比如PPO/GRPO流水线构建或推理引擎开发
- 展示性能优化成果,如CUDA内核优化、吞吐提升数据,以及故障排查案例
- 提前熟悉PyTorch FSDP/DTensor、Megatron等框架的内部机制
- 补充RL系统知识,了解异步RL、仿真环境集成等前沿实践
面试指南
- 采用S.T.A.R.方法:先说明情境,再讲任务和行动,突出结果和数据
- 强调系统设计思路:从需求分析、架构选择、权衡到实施和迭代
- 展示跨层调试能力:从应用层、框架层到硬件层的系统排查方法
- 你如何设计一个大规模分布式训练系统来支持RL后训练?关键考虑哪些因素?
- 描述一次你排查分布式训练故障的经历,涉及哪些层?如何根因定位?
- 如何优化推理引擎的吞吐量和延迟?用过哪些技术?
- 解释PPO或GRPO的工作原理,在训练基础设施中如何实现异步RL?
- 复习分布式训练的核心概念(数据并行、张量并行、流水线并行、检查点)
职位点评
79
综合评分
全球AI巨头核心实验室,前沿技术栈,高薪但WLB不明确,发展空间极大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术前沿、渴望在AI基础设施领域深耕,并能适应高强度工作的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值90
薪资福利
85较高
NVIDIA提供极具竞争力的薪资和福利套餐,但JD未具体说明数字,整体待遇行业领先。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
该职位处于AI基础设施前沿,接触物理AI和RL训练系统,技术成长空间巨大,并有机会与顶尖团队合作。
技术前沿前沿/新兴技术
技术栈PyTorch、Megatron、CUDA、分布式训练、RL、PPO、GRPO、DPO、FSDP、DTensor
业务类型ambiguous
工作生活
40较低
JD未提及远程或弹性工作,要求现场办公,且涉及大规模系统运维,工作强度可能较高,WLB不确定性大。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
90较高
工作直接推动物理AI和世界模型的发展,对AI未来有深远影响,使命感和意义感强。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号make a lasting impact on the world
创新程度开拓性创新(行业首创)
英伟达 的其他在招职位
Senior System Software Engineer, Modeling and Validation
英伟达 · 上海市AI 估算 · 30k-50kSenior Technical Program Manager, Deep Learning Software
英伟达 · 上海市AI 估算 · 45k-65kAI Developer — Interconnect Hardware Frontend
英伟达 · 上海市AI 估算 · 40k-60kSenior Infrastructure Automation Engineer - Silicon Co-Design Group
英伟达 · 上海市AI 估算 · 50k-80kSenior Design Verification Engineer - Interconnect IP
英伟达 · 上海市AI 估算 · 40k-70k
相似职位推荐
Watch Jobs