Xiaomi logo
小米
具身世界模型数据工程师 - XiaomiRobotics

具身世界模型数据工程师 - XiaomiRobotics

发布于 大约 3 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
硕士
数据工程
具身智能
分布式处理
多模态
大模型
数据工程
数据清洗
数据管线
机器人
自动标注

AI 估算 · 30k–50k

小米北京硕研数据岗,具身智能风口,大模型相关,薪资高于普通数据工程师,属市场偏上水平。

职位详情

关于这个职位

作为小米机器人团队的数据工程师,你将负责构建具身大模型所需的多模态数据体系,涵盖图像、视频、文本和动作轨迹等数据

工作核心是设计大规模数据处理管线,优化数据质量以支撑模型训练与迭代
适合对前沿AI和机器人技术有热情、擅长工程化落地的数据工程师

最低要求

硕士及以上学历,计算机、人工智能、自动化、数据科学等相关专业

熟悉大模型训练数据全流程,理解预训练、SFT、强化学习等阶段的数据特点及组织方式
熟练掌握Python,熟悉分布式数据处理框架、数据清洗与标注工具,具备大规模数据管线开发经验
具备较强的工程落地与问题解决能力,能够独立推动数据流程自动化、标准化和平台化建设
理解图像、视频、文本、动作轨迹等多模态数据的处理逻辑

工作职责

负责具身大模型多模态数据体系建设,覆盖图像、视频、语言、图文交错、动作轨迹、机器人交互等数据类型,支撑模型训练、评测与迭代

设计并搭建大规模数据处理与生产管线,包括数据采集、清洗、标注、筛选、标准化、混合配比、质量评估与版本管理,保障数据全生命周期高效运转
面向预训练、持续训练、SFT、强化学习等不同阶段,制定适配的数据策略与处理方案,提升数据利用效率与训练效果
针对多模态具身大模型任务特点,解决跨模态对齐、时序一致性、动作标注、数据稀疏性与分布不均衡等问题,持续优化数据质量
联合数据平台、模型与机器人团队,建设自动化数据回放、质检、追溯与评测体系,形成可复用、可迭代的数据基础设施
跟踪多模态数据处理、自动标注与数据质量评估等方向的前沿技术,推动数据体系持续升级

优先资格

有多模态数据处理、具身数据、机器人数据或自动驾驶数据工程经验者优先

有跨模态对齐、时序数据处理、质量评估或自动化质检经验者优先

AI 洞察

优缺点分析

优点

  • 小米平台大,资源充足,能接触真实业务场景和规模化数据
  • 职责覆盖数据全生命周期,可系统性积累数据工程和AI落地经验
  • 多模态数据处理复杂,跨模态对齐和时序一致性对技术要求高
  • 数据体系从零搭建,需要较强的工程落地能力和跨团队协作能力
  • 适合对AI数据基建有热情、具备强工程能力和自驱力,希望在具身智能领域长期深耕的工程师

缺点 / 挑战

  • 身处具身智能和机器人前沿赛道,技术挑战大,成长空间广阔
  • 前沿领域迭代快,需持续学习新技术,工作压力较大

角色解读

  • 领域深耕:从数据工程师成长为具身智能数据专家,主导数据体系建设
  • 横向拓展:向大模型训练、模型评测或AI平台方向延伸,成为全栈AI工程师
  • 管理路径:带领数据团队,负责更大规模的数据基础设施与平台建设
  • 负责构建具身大模型训练所需的多模态数据体系,涵盖图像、视频、语言、动作轨迹等数据
  • 设计并搭建大规模数据处理管线,包括数据采集、清洗、标注、筛选、质量评估与版本管理
  • 针对预训练、SFT、强化学习等不同训练阶段制定数据策略,优化数据配比与利用效率
  • 与模型、机器人团队协作,建设自动化数据回放、质检和评测体系,解决跨模态对齐等问题
  • 熟练掌握Python,具备扎实的编程和工程实现能力
  • 熟悉分布式数据处理框架(如Spark、Flink)和主流数据清洗、标注工具
  • 理解大模型训练数据全流程,了解预训练、SFT、强化学习各阶段的数据特点
  • 具备多模态数据处理经验,了解图像、文本、视频、动作轨迹等数据格式与对齐方法

申请策略

  • 提前了解小米机器人部门的业务方向和已有技术布局
  • 在面试中展示对具身智能数据挑战的洞察和解决思路
  • 突出大规模数据处理管线的设计与落地项目,展示具体规模和成果
  • 强调Python和分布式框架的熟练度,可附GitHub或代码示例
  • 如有多模态、自动驾驶或机器人数据经验,务必重点描述
  • 体现对数据质量、自动化流程优化的思考和实践
  • 补充学习多模态对齐和时序数据处理的相关工具(如FFmpeg、视频理解库)
  • 熟悉主流大模型数据流水线(如WebDataset、Databricks)的架构

面试指南

  • 先讲清楚数据流向和关键环节,再具体说明技术选型和模块设计
  • 针对优化问题,给出量化指标和迭代思路,体现数据驱动思维
  • 强调跨团队协作和工程落地的实际效果,结合案例说明
  • 你如何设计一个覆盖多模态数据的数据采集和清洗流程?
  • 在训练大模型时,如何组织预训练、SFT和强化学习阶段的数据配比?
  • 如何处理跨模态数据的对齐和时序一致性问题?
  • 如果数据分布不均衡,你会采取哪些策略优化数据质量?
  • 请描述一个你负责过的数据管线项目,遇到的难点如何解决?

职位点评

69
综合评分

具身智能数据工程师,前沿技术栈,成长空间大,但工作强度和地点灵活性未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
追求技术成长和前沿探索,愿意接受高挑战和现场办公的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活45
使命价值75

薪资福利

65中等

薪资未明确,但职位位于高薪AI领域,小米平台和上市背景能提供较稳定的薪酬福利,但JD未提及具体福利,综合评分中等。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

职位处于具身智能前沿,涉及大模型数据全流程,技术栈新且复杂,成长空间大,能积累稀缺经验。

技术前沿前沿/新兴技术
技术栈多模态、具身大模型、预训练、SFT、强化学习、分布式数据处理、Python
成长机会跟踪前沿技术、推动数据体系持续升级
业务类型ambiguous

工作生活

45较低

仅提到工作地点北京,未提及弹性或远程,默认现场办公,且工作强度可能较高,生活方式自由度有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

具身智能和机器人是未来科技发展方向,具有较强的前沿意义,但社会直接影响力有限。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs