AgiBot logo
智元机器人
AI Infra训练工程师

AI Infra训练工程师

发布于 大约 17 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
3D并行
Deepspeed
Gpu集群
I/O优化
Megatron-Lm
Pytorch
Vla
分布式训练
性能调优

AI 估算 · 50k–80k

要求千卡级实战经验及分布式框架精通,市场稀缺,上海AI Infra岗位薪资竞争力强。

职位详情

关于这个职位

该职位主要负责在千卡级GPU集群上构建和优化大规模分布式训练系统,支持VLA等具身大模型的预训练与微调

你将解决训练中的计算、通信、I/O瓶颈,确保系统高效稳定运行,是AI基础设施的核心技术岗位

最低要求

千卡级训练实战经验:有千卡级GPU集群上的大模型训练实战经验,熟悉大规模训练中的常见问题与解决方案

分布式训练框架:精通PyTorch分布式训练机制(DDP/FSDP),熟悉DeepSpeed、Megatron-LM等大规模训练框架的原理与使用
并行策略:深入理解3D并行(Data Parallel / Tensor Parallel / Pipeline Parallel)的实现原理与适用场景,能够根据模型特点设计最优并行策略
性能分析与调优:熟练使用PyTorch Profiler、NVIDIA Nsight等工具进行性能分析,能够定位并解决计算、通信、I/O瓶颈

工作职责

大规模分布式训练系统:在千卡级 GPU 集群上构建稳定、高效的分布式训练系统,支持 VLA 等具身大模型的预训练与微调

训练效率优化:优化大规模训练中的计算效率、通信效率与 I/O 效率,消除训练瓶颈,提升集群整体利用率
训练数据加载流水线:构建从存储到 GPU 显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的 I/O Stall
训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行

优先资格

有LLM/VLM/VLA等大模型预训练的完整项目经验

有PyTorch/DeepSpeed/Megatron等框架的核心贡献经验
以第一作者在ICML、ICLR、NeurIPS、MLSys等顶级会议发表过相关研究成果
主导或参与过具有广泛影响力的AI Infra开源项目

AI 洞察

优缺点分析

优点

  • 接触前沿VLA大模型训练,技术含量高,积累稀缺的千卡级实战经验
  • 公司B轮阶段,成长空间大,有机会参与核心AI基础设施设计
  • 顶级会议和开源社区参与机会,有利于个人技术品牌建设
  • 大规模训练稳定性问题复杂,调试难度高,需较强的问题排查能力
  • 技术迭代快,需要持续学习新的分布式训练框架和优化方法
  • 适合有分布式训练经验、热爱底层系统优化、希望在AI Infra领域深耕的技术专家,能够接受高强度研发工作

缺点 / 挑战

  • 需要与算法、工程团队紧密协作,沟通成本较高

角色解读

  • 技术专家路线:深入分布式训练框架底层,成为系统性能优化专家
  • AI Infra架构师:主导大规模训练基础设施设计和演进
  • 结合具身智能方向,向VLA模型训练负责人或技术总监发展
  • 在千卡级GPU集群上构建分布式训练系统,支持VLA等具身大模型的预训练和微调
  • 优化训练效率,解决计算、通信、I/O瓶颈,提升集群利用率
  • 构建高吞吐数据加载流水线,消除I/O Stall问题
  • 保障大规模训练任务的稳定性,处理故障恢复和梯度异常
  • 精通PyTorch分布式训练(DDP/FSDP)和DeepSpeed、Megatron-LM框架
  • 深入理解3D并行策略(数据/张量/流水线并行),能根据模型设计最优方案
  • 熟练使用PyTorch Profiler、NVIDIA Nsight进行性能分析
  • 具备千卡级GPU集群实战经验,熟悉常见训练故障解决方案

申请策略

  • 展示对具身智能领域的热情,了解智元机器人的技术方向
  • 准备一个分布式训练系统设计案例,从集群规划到性能优化完整阐述
  • 突出千卡级训练项目规模、成果,说明你解决的具体问题(如训练效率提升百分比)
  • 详细描述使用的并行策略和性能优化手段,例如混合精度、梯度累积、通信压缩等
  • 强调开源贡献或顶会论文,尤其是PyTorch/DeepSpeed/Megatron相关
  • 列出具体故障案例及解决方案,体现稳定性保障能力
  • 深入研读DeepSpeed和Megatron-LM源码,理解ZeRO、序列并行等高级特性
  • 学习NVIDIA Nsight Systems/Compute高级用法,掌握GPU性能分析

面试指南

  • 使用STAR法则:描述场景、目标、行动、结果,突出量化成效
  • 从系统角度分析:先定位瓶颈(计算/通信/IO),再提出针对性优化方案,最后验证效果
  • 结合具体框架配置:如DeepSpeed的ZeRO stage选择、梯度累积步数、通信拓扑等
  • 请描述你在千卡集群上训练大模型时遇到的典型稳定性问题及解决思路
  • 解释3D并行中Data Parallel、Tensor Parallel、Pipeline Parallel的优缺点及适用场景
  • 如何优化训练数据加载流水线以避免I/O Stall?请举例说明
  • 你如何使用PyTorch Profiler或Nsight定位训练瓶颈?给出具体分析过程
  • 你对VLA模型训练有什么理解?你认为训练这类模型的主要挑战是什么?

职位点评

71
综合评分

前沿AI Infra研发岗,技术挑战大,成长空间高,但工作强度较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术深度和职业发展,愿意接受高强度工作的AI Infra工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值70

薪资福利

75中等

薪资未明确披露,但参考市场行情,AI Infra资深工程师在上海的薪资水平较高,且B轮公司可能提供期权,补偿性较好。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

90较高

职位涉及前沿VLA大模型训练,使用最新分布式技术,技术成长空间极大,但JD未明确提及晋升或培训机制。

技术前沿前沿/新兴技术
技术栈PyTorch、DeepSpeed、Megatron-LM、3D并行、GPU集群、VLA
业务类型profit_center

工作生活

40较低

工作地点仅上海,未提及远程或弹性工作,且职位描述涉及千卡集群稳定性保障,暗示可能高强度工作,WLB一般。

工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词

使命价值

70中等

具身智能属于高速增长赛道,VLA模型具有技术前沿性,但职位偏向工程实现,社会影响力中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs