
小米
机器人VLA算法研究员 - XiaomiRobotics
机器人VLA算法研究员 - XiaomiRobotics
发布于 大约 14 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
硕士
具身智能
Diffusion
Moe
Pytorch
Vae
Vla
世界建模
具身智能
动作生成
多模态大模型
AI 估算 · 35k–65k
具身智能是AI前沿方向,人才稀缺,小米作为科技大厂提供有竞争力的薪酬,北京生活成本较高,薪资水平高于普通算法岗。
职位详情
关于这个职位
该职位聚焦具身智能前沿方向,负责研究和构建融合视觉、语言与动作的VLA大模型,涵盖数据引擎、训练pipeline、评测系统等核心环节
你将参与从模型设计、训练调优到实验分析的全流程,推动机器人智能决策与操作能力的持续突破
最低要求
硕士及以上学历,计算机、人工智能、机器人、自动化、数学等相关专业,具备扎实的机器学习、深度学习和概率建模基础
熟悉具身智能、多模态大模型、视频生成或动作生成等方向,理解主流方法原理与适用场景,如Transformer、Diffusion、VAE、VQ、MoE等
具备较强的算法研发能力,熟练使用PyTorch等深度学习框架,有从模型设计、训练调优到实验分析的完整研发经验
熟悉多模态数据建模,理解图像、视频、语言、动作轨迹等数据在训练与评测中的关键问题
具备优秀的问题分析与科研协作能力,对具身智能方向有强烈兴趣,能够快速学习并验证
工作职责
研究并构建融合世界建模和动作生成的 VLA 模型
结合机器人数据、视频数据、视觉语言数据等,构建可扩展的数据引擎和训练pipeline
开展大规模的 VLA 训练,建立真实可靠的评测系统,持续迭代模型能力提升
优先资格
(优先条件) 有跨模态建模或生成任务经验者优先
在机器人、具身智能、多模态、生成式AI等方向顶会/顶刊(如RSS、CoRL、ICRA、CVPR、ICCV、NeurIPS、ICLR等)发表论文,或有代表性开源项目/研究成果者优先
AI 洞察
优缺点分析
优点
- VLA是具身智能的核心方向,技术前沿,研究价值高,能积累稀缺的经验
- 小米拥有真实机器人场景和海量数据,能够将研究与产品落地结合
- 团队属于XiaomiRobotics,可以接触到从算法到系统的完整体系,成长迅速
- 薪酬竞争力强,且公司平台大,职业发展稳定
- 研究型岗位对科研能力和工程能力要求都很高,需要同时处理模型创新和训练工程问题
- 未明确工作强度,但大厂核心研发通常节奏较快,可能需要应对高强度加班
缺点 / 挑战
- 具身智能领域尚处于早期,技术路线不确定性较高,可能面临较大的科研压力
- 适合对机器人和AI研究有强烈热情,具备扎实算法基础,能够承受科研和工程双重挑战的求职者
角色解读
- 从算法研究员向技术专家或项目技术负责人方向发展,逐步主导VLA模型的架构设计和核心算法突破
- 可跨入具身智能、多模态大模型、自动驾驶等多个高景气领域,职业选择空间大
- 发表顶会论文和开源项目,提升行业影响力,有机会向顶尖研究团队或实验室发展
- 负责研究VLA(视觉-语言-动作)模型,融合世界建模与动作生成,实现机器人从感知到决策的智能化
- 构建和优化大规模数据引擎与训练pipeline,整合机器人、视频、视觉语言等多模态数据
- 开展大规模模型训练,设计并维护真实可靠的评测体系,持续迭代模型性能
- 扎实的机器学习、深度学习基础,掌握Transformer、Diffusion、VAE、MoE等主流生成式模型原理
- 熟悉PyTorch等深度学习框架,具备从模型设计、训练调优到实验分析的完整研发经验
- 了解多模态数据(图像、视频、语言、动作轨迹)的建模和评测方法
- 有较强的科研协作和问题分析能力,对具身智能有浓厚兴趣
申请策略
- 了解小米机器人团队的技术方向和产品布局,在面试中展现对具身智能的深刻理解和思考
- 可以准备一个独立的技术demo或复现实验,展示你的动手能力和研究深度
- 突出相关研究项目,尤其是VLA、多模态大模型、动作生成、世界模型等方向的工作
- 强调论文发表、开源项目或竞赛奖项,体现科研能力和影响力
- 清晰展示你从模型设计到训练调优的完整项目经历,使用具体数据说明效果提升
- 如果有机器人相关经验,务必重点描述,如机械臂控制、仿真环境等
- 提前学习VLA相关论文和技术,如RT-2、PaLM-E、Octo等,理解其架构和训练策略
- 熟悉PyTorch分布式训练框架(如DDP、FSDP),提升大规模训练实操能力
面试指南
- 使用STAR法则:情境-任务-行动-结果,清晰描述项目背景、你的角色、技术方案和量化结果
- 针对技术问题,先拆解问题核心,再给出可行方案,并比较不同方案的优劣,体现系统性思考
- 对于开放性问题,结合最新论文和行业动态,展示你的前瞻性和对技术趋势的把握
- 请介绍你在多模态大模型或VLA相关项目中的具体贡献和遇到的挑战
- 如何设计一个数据引擎,从机器人遥操作数据中提取有效的训练样本?
- 谈谈你对VLA模型中世界建模和动作生成融合的理解,以及可能的技术方案
- 在训练大规模模型时,如何解决训练不稳定、算力不足等问题?
- 你认为具身智能面临的最大技术瓶颈是什么?如何突破?
职位点评
72
综合评分
具身智能VLA算法研究员,技术前沿、成长空间大,但工作强度和作息不明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合以技术成长和职业发展为核心动力,对具身智能有强烈兴趣,并能适应高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值85
薪资福利
65中等
职位未披露薪资和具体福利,但小米作为上市大厂,薪酬体系规范,岗位属于高价值算法方向,整体待遇有竞争力。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
90较高
职位聚焦具身智能前沿方向,技术难度高,涉及VLA、世界模型等最新研究,能极大提升个人技术深度和行业影响力。
技术前沿前沿/新兴技术
技术栈VLA、具身智能、多模态大模型、世界模型、Transformer、Diffusion、VAE、MoE、PyTorch、动作生成
业务类型ambiguous
工作生活
50较低
工作地点为北京,JD未提及远程或弹性办公,也未说明具体办公环境,生活化信息较少,且大厂核心研发岗节奏可能较快。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
具身智能是推动机器人技术落地的关键领域,社会价值高,行业处于高速增长期,研究方向具有开创性。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
小米 的其他在招职位
相似职位推荐
Watch Jobs