
小米
VLA训练infra算法工程师 - XiaomiRobotics
VLA训练infra算法工程师 - XiaomiRobotics
发布于 大约 8 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Deepspeed
Flashattention
Fsdp
Megatron
Pytorch
Vla
分布式训练
机器人
AI 估算 · 35k–65k
北京AI训练infra岗位稀缺,技术难度高,小米平台加持,薪资高于市场平均。
职位详情
关于这个职位
该职位负责设计和实现VLA(视觉-语言-动作)模型的分布式训练基础设施,基于PyTorch生态进行大规模训练优化,包括混合精度、算子融合和数据pipeline搭建,是机器人AI领域的前沿技术岗
你将与顶尖工程师合作,推动机器人从感知到决策的智能化进程
最低要求
扎实的 Python / C++ 基础,熟悉 Linux 系统
深入理解 PyTorch 分布式训练, 熟悉至少一种分布式训练优化框架(FSDP / DeepSpeed / Megatron)
深入理解 GPU / CPU / 内存 / 网络 基本原理
有大规模训练经验
工作职责
基于 PyTorch 生态(FSDP / DeepSpeed / Megatron 等)设计并实现 VLA 模型的分布式训练方案(DP / TP / PP / MoE),构建稳定高效的训练框架
推动混合精度(BF16 / FP8)与算子融合(FlashAttention / Triton kernel)
构建高吞吐数据pipeline,设计数据格式与 shard 策略,实现高效的数据加载
支持大规模实验追踪、管理、指标可视化
优先资格
有 多模态 / VLA / 机器人 / 自动驾驶 大规模训练经验
熟悉 NCCL / RDMA / InfiniBand 调优
有自定义 CUDA / Triton kernel 经验
AI 洞察
优缺点分析
优点
- 处于VLA和机器人AI的爆发期,技术前沿且有大量落地场景,个人成长迅速
- 能接触最先进的分布式训练技术(MoE、FP8、自定义kernel等),技术积累含金量高
- 小米平台资源丰富,有大规模算力和数据支撑,适合打造高质量训练基础设施
- 薪资待遇优厚,且作为核心算法支撑岗位,在公司内重视程度高
- 技术门槛高,需要深度理解分布式系统、硬件原理和深度学习框架,学习曲线陡峭
- 工作强度可能较大,大规模训练问题排查和优化耗时耗力,需要较强的抗压能力
- 训练基础设施领域变化快,需要持续跟进最新技术,保持快速学习
- 适合对分布式训练和模型优化充满热情、喜欢攻克技术难题、追求长期技术成长的工程师
缺点 / 挑战
暂无明显挑战项
角色解读
- 从训练框架工程师向AI基础设施架构师发展,主导大规模训练平台的架构设计
- 深入VLA和机器人领域,成为模型训练与算法协同优化的复合型专家
- 有机会在小米Robotics团队中快速成长,参与前沿技术研究和落地,未来可向技术管理或首席工程师方向发展
- 设计和实现VLA模型的分布式训练框架,涵盖数据并行、张量并行、流水线并行和MoE等策略,确保训练高效稳定
- 优化混合精度训练(BF16/FP8)并融合算子,利用FlashAttention和自定义Triton kernel提升计算效率
- 构建高吞吐数据pipeline,设计合理的数据格式和分片策略,解决大规模数据加载瓶颈
- 搭建实验追踪和管理系统,支持大规模实验的指标可视化与结果分析
- 扎实的Python/C++编程能力,熟悉Linux环境,能高效开发和调试
- 深入理解PyTorch分布式训练机制,至少精通FSDP、DeepSpeed或Megatron中的一种
- 熟悉GPU/CPU/内存/网络体系结构,能识别和优化分布式训练中的性能瓶颈
- 具备大规模训练经验,了解NCCL、RDMA、InfiniBand等通信优化的优先
申请策略
- 在申请时展示你对VLA和机器人行业的理解,比如关注哪些模型和数据集,并说明你的训练方案如何适配
- 如果可能,准备一个能展示你训练优化成果的Portfolio(如GitHub、技术博客),比单纯罗列技能更有说服力
- 突出大规模训练项目的经历,明确说明你负责的分布式方案(如DP/TP/PP)和实际效果(如吞吐提升、成本降低)
- 展示对PyTorch底层机制的掌握,如自定义autograd.Function、通信原语、显存优化等
- 强调对GPU硬件特性的理解,比如CUDA内核优化、NCCL调优、混合精度训练经验
- 如果有VLA、多模态或机器人相关项目,务必放在显眼位置,这部分高度契合岗位需求
- 系统学习DeepSpeed/FSDP的源码,理解ZeRO、Offload等机制,并动手实践一个分布式训练示例
- 了解FlashAttention和Triton的编程模型,尝试编写简单算子并集成到训练流程
面试指南
- 使用STAR法则:情境-任务-行动-结果,具体说明你的贡献和量化收益
- 先阐述核心概念,再对比不同方案,最后给出你的判断依据,体现系统思维
- 遇到不熟悉的问题时,可以说明你的分析思路和可能解决路径,展示解决问题的能力
- 请详细描述你过去负责的一个大规模分布式训练项目,包括架构设计、遇到的瓶颈和解决方案
- FSDP和DeepSpeed ZeRO-3的区别是什么?各自适用什么场景?
- 在大规模训练中如何调试NCCL通信瓶颈?你使用过哪些工具和方法?
- 混合精度训练(如FP8)相比BF16有哪些挑战?如何保证训练稳定性?
- 如果让你为VLA模型设计一个训练pipeline,你会重点关注哪些方面?
职位点评
73
综合评分
前沿AI训练infra岗,技术成长极佳,薪资有竞争力,但工作强度大且WLB不明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术深度、渴望参与前沿AI基础设施建设的工程师,对工作生活平衡要求不高且乐于挑战高难度问题。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活45
使命价值70
薪资福利
75中等
JD未明确薪资福利,但小米作为上市巨头,薪酬水平通常具有竞争力,岗位性质为高技术难度岗位,大概率提供较高薪资和稳定保障。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
92较高
该职位位于机器人和VLA前沿,技术栈新且深度高,能极大提升个人在分布式训练和AI基础设施领域的专业能力。
技术前沿前沿/新兴技术
技术栈PyTorch、FSDP、DeepSpeed、Megatron、VLA、FlashAttention、Triton、CUDA、NCCL
业务类型ambiguous
工作生活
45较低
工作地点在北京,JD未提及远程或弹性工作,且高强度技术工作可能带来较大压力,生活方式平衡性难以保证。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
VLA和机器人领域具有较高的社会价值和行业前景,参与核心训练基础设施有助于推动机器人智能化,但JD未直接强调使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
小米 的其他在招职位
相似职位推荐
Watch Jobs