Xiaomi logo
小米
VLA训练infra算法工程师 - XiaomiRobotics

VLA训练infra算法工程师 - XiaomiRobotics

发布于 大约 8 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Deepspeed
Flashattention
Fsdp
Megatron
Pytorch
Vla
分布式训练
机器人

AI 估算 · 35k–65k

北京AI训练infra岗位稀缺,技术难度高,小米平台加持,薪资高于市场平均。

职位详情

关于这个职位

该职位负责设计和实现VLA(视觉-语言-动作)模型的分布式训练基础设施,基于PyTorch生态进行大规模训练优化,包括混合精度、算子融合和数据pipeline搭建,是机器人AI领域的前沿技术岗

你将与顶尖工程师合作,推动机器人从感知到决策的智能化进程

最低要求

扎实的 Python / C++ 基础,熟悉 Linux 系统

深入理解 PyTorch 分布式训练, 熟悉至少一种分布式训练优化框架(FSDP / DeepSpeed / Megatron)
深入理解 GPU / CPU / 内存 / 网络 基本原理
有大规模训练经验

工作职责

基于 PyTorch 生态(FSDP / DeepSpeed / Megatron 等)设计并实现 VLA 模型的分布式训练方案(DP / TP / PP / MoE),构建稳定高效的训练框架

推动混合精度(BF16 / FP8)与算子融合(FlashAttention / Triton kernel)
构建高吞吐数据pipeline,设计数据格式与 shard 策略,实现高效的数据加载
支持大规模实验追踪、管理、指标可视化

优先资格

有 多模态 / VLA / 机器人 / 自动驾驶 大规模训练经验

熟悉 NCCL / RDMA / InfiniBand 调优
有自定义 CUDA / Triton kernel 经验

AI 洞察

优缺点分析

优点

  • 处于VLA和机器人AI的爆发期,技术前沿且有大量落地场景,个人成长迅速
  • 能接触最先进的分布式训练技术(MoE、FP8、自定义kernel等),技术积累含金量高
  • 小米平台资源丰富,有大规模算力和数据支撑,适合打造高质量训练基础设施
  • 薪资待遇优厚,且作为核心算法支撑岗位,在公司内重视程度高
  • 技术门槛高,需要深度理解分布式系统、硬件原理和深度学习框架,学习曲线陡峭
  • 工作强度可能较大,大规模训练问题排查和优化耗时耗力,需要较强的抗压能力
  • 训练基础设施领域变化快,需要持续跟进最新技术,保持快速学习
  • 适合对分布式训练和模型优化充满热情、喜欢攻克技术难题、追求长期技术成长的工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从训练框架工程师向AI基础设施架构师发展,主导大规模训练平台的架构设计
  • 深入VLA和机器人领域,成为模型训练与算法协同优化的复合型专家
  • 有机会在小米Robotics团队中快速成长,参与前沿技术研究和落地,未来可向技术管理或首席工程师方向发展
  • 设计和实现VLA模型的分布式训练框架,涵盖数据并行、张量并行、流水线并行和MoE等策略,确保训练高效稳定
  • 优化混合精度训练(BF16/FP8)并融合算子,利用FlashAttention和自定义Triton kernel提升计算效率
  • 构建高吞吐数据pipeline,设计合理的数据格式和分片策略,解决大规模数据加载瓶颈
  • 搭建实验追踪和管理系统,支持大规模实验的指标可视化与结果分析
  • 扎实的Python/C++编程能力,熟悉Linux环境,能高效开发和调试
  • 深入理解PyTorch分布式训练机制,至少精通FSDP、DeepSpeed或Megatron中的一种
  • 熟悉GPU/CPU/内存/网络体系结构,能识别和优化分布式训练中的性能瓶颈
  • 具备大规模训练经验,了解NCCL、RDMA、InfiniBand等通信优化的优先

申请策略

  • 在申请时展示你对VLA和机器人行业的理解,比如关注哪些模型和数据集,并说明你的训练方案如何适配
  • 如果可能,准备一个能展示你训练优化成果的Portfolio(如GitHub、技术博客),比单纯罗列技能更有说服力
  • 突出大规模训练项目的经历,明确说明你负责的分布式方案(如DP/TP/PP)和实际效果(如吞吐提升、成本降低)
  • 展示对PyTorch底层机制的掌握,如自定义autograd.Function、通信原语、显存优化等
  • 强调对GPU硬件特性的理解,比如CUDA内核优化、NCCL调优、混合精度训练经验
  • 如果有VLA、多模态或机器人相关项目,务必放在显眼位置,这部分高度契合岗位需求
  • 系统学习DeepSpeed/FSDP的源码,理解ZeRO、Offload等机制,并动手实践一个分布式训练示例
  • 了解FlashAttention和Triton的编程模型,尝试编写简单算子并集成到训练流程

面试指南

  • 使用STAR法则:情境-任务-行动-结果,具体说明你的贡献和量化收益
  • 先阐述核心概念,再对比不同方案,最后给出你的判断依据,体现系统思维
  • 遇到不熟悉的问题时,可以说明你的分析思路和可能解决路径,展示解决问题的能力
  • 请详细描述你过去负责的一个大规模分布式训练项目,包括架构设计、遇到的瓶颈和解决方案
  • FSDP和DeepSpeed ZeRO-3的区别是什么?各自适用什么场景?
  • 在大规模训练中如何调试NCCL通信瓶颈?你使用过哪些工具和方法?
  • 混合精度训练(如FP8)相比BF16有哪些挑战?如何保证训练稳定性?
  • 如果让你为VLA模型设计一个训练pipeline,你会重点关注哪些方面?

职位点评

73
综合评分

前沿AI训练infra岗,技术成长极佳,薪资有竞争力,但工作强度大且WLB不明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术深度、渴望参与前沿AI基础设施建设的工程师,对工作生活平衡要求不高且乐于挑战高难度问题。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活45
使命价值70

薪资福利

75中等

JD未明确薪资福利,但小米作为上市巨头,薪酬水平通常具有竞争力,岗位性质为高技术难度岗位,大概率提供较高薪资和稳定保障。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

92较高

该职位位于机器人和VLA前沿,技术栈新且深度高,能极大提升个人在分布式训练和AI基础设施领域的专业能力。

技术前沿前沿/新兴技术
技术栈PyTorch、FSDP、DeepSpeed、Megatron、VLA、FlashAttention、Triton、CUDA、NCCL
业务类型ambiguous

工作生活

45较低

工作地点在北京,JD未提及远程或弹性工作,且高强度技术工作可能带来较大压力,生活方式平衡性难以保证。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

VLA和机器人领域具有较高的社会价值和行业前景,参与核心训练基础设施有助于推动机器人智能化,但JD未直接强调使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs