AgiBot logo
智元机器人
多模态大模型训练工程师(后训练 / 机器人交互方向)

多模态大模型训练工程师(后训练 / 机器人交互方向)

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Deepspeed
Dpo
Huggingface Transformers
Lora
Pytorch
Rlhf
Sft
多模态模型
机器人交互

AI 估算 · 30k–50k

大模型训练岗位稀缺,上海薪资水平高,3年以上经验市场价约30-50k/月。

职位详情

关于这个职位

该职位负责开源大模型在机器人场景下的后训练与适配,包括SFT、DPO、LoRA等训练实验,以及结构化输出训练

你将参与机器人交互数据构建,与端侧部署和评测工程师协作,持续优化模型
适合有3年以上大模型训练经验、对机器人交互感兴趣的技术专家

最低要求

本科及以上学历,计算机、人工智能、软件工程、自动化、机器人、电子信息等相关专业优先

年以上 LLM / MLLM / NLP / 多模态模型训练或相关算法经验
熟悉 PyTorch、HuggingFace Transformers、DeepSpeed、Accelerate、vLLM 等至少部分训练 / 推理框架
熟悉 SFT、LoRA / QLoRA、DPO、RLHF、蒸馏、指令微调等至少两类后训练方法
具备较强的数据意识,能围绕任务目标设计训练数据、偏好数据、teacher label 和评测 case
能独立完成训练实验设计、checkpoint 管理、指标对比、case 分析和复现实验
对机器人交互、多模态输入、结构化输出和端侧模型落地有兴趣

工作职责

负责开源大模型在机器人场景下的后训练与能力适配

负责 SFT、DPO、LoRA / QLoRA、蒸馏等训练实验,完成模型版本迭代与效果分析
负责结构化输出训练,使模型稳定输出可被运行时消费的字段,例如 speechactintentemotionstyleroutetool_callexpressiongesture
参与机器人交互数据构建,包括多轮对话、回应对象、主动交互、澄清确认、情绪表达、端云路由等数据
参与 preference data、teacher label、hard case 回流数据的构建与质量控制
与端侧部署工程师协作,支持端侧规格约束下的模型训练、蒸馏、结构化输出稳定性和量化敏感性验证
与评测工程师协作,根据 gold set、hard case、shadow eval 和版本回归结果持续优化模型
支持 Demo 的模型能力建设与版本冻结

优先资格

做过 Qwen、LLaMA、InternVL、MiniCPM、LLaVA、Qwen-Audio、Qwen-Omni 等开源模型微调

做过多模态模型训练,尤其是 audio / video / image / text 相关任务
做过结构化输出、tool calling、function calling、JSON schema 约束训练
做过 DPO / RLHF / reward model / preference data 构造
做过 Agent、router、planner、多轮对话、语音助手、智能座舱、数字人或机器人项目
做过 active speaker、addressed-to-robot、turn-taking、engagement、speaker attribution 等任务
做过模型蒸馏、端侧小模型训练、量化感知训练或压缩相关工作

AI 洞察

优缺点分析

优点

  • 公司处于B轮,发展潜力大,有机会接触从数据到部署的全流程
  • 薪资竞争力强,稀缺岗位议价空间大
  • 对跨领域知识要求高(NLP、CV、机器人、端侧部署),学习曲线陡峭
  • 机器人交互场景复杂,结构化输出和端侧约束带来调试难度

缺点 / 挑战

  • 参与前沿的机器人交互大模型训练,技术挑战大、成长快
  • 工作强度可能较高,需要紧跟大模型快速迭代节奏
  • 适合有3年以上大模型训练经验、乐于深耕机器人交互方向、喜欢挑战和解决实际问题的算法工程师

角色解读

  • 技术方向:可深入多模态大模型、端侧模型压缩、机器人感知决策等领域
  • 管理方向:表现优秀可晋升为技术负责人或团队Leader,带领算法团队
  • 行业前景:机器人+大模型是热门赛道,积累稀缺经验后具有极高市场竞争力
  • 负责开源大模型在机器人场景下的后训练,包括SFT、DPO、LoRA等实验,进行模型版本迭代与效果分析
  • 参与机器人交互数据构建,设计多轮对话、情绪表达等结构化数据,确保模型输出符合业务需求
  • 与端侧部署和评测工程师协作,优化模型在资源约束下的稳定性和量化性能
  • 扎实的LLM/MLLM训练经验,熟悉PyTorch、Transformers、DeepSpeed等框架
  • 精通后训练方法如SFT、LoRA、DPO、RLHF,能独立设计实验和数据分析
  • 对机器人交互和多模态技术有浓厚兴趣,了解结构化输出和端侧部署挑战

申请策略

  • 在投递时附上个人技术博客或GitHub项目(如开源模型微调代码),展示实践能力
  • 提前了解智元机器人的产品线和技术方向,在面试中体现对机器人交互的理解
  • 突出大模型后训练项目经验,尤其是SFT、DPO、LoRA等具体方法的成果(如指标提升、模型发布)
  • 强调多模态或多轮对话相关数据构建和结构化输出经验
  • 展示开源模型微调、端侧部署或模型蒸馏等加分项
  • 补充机器人交互或语音助手相关背景知识,了解turn-taking、engagement等概念
  • 练习使用DeepSpeed、vLLM等框架进行大规模训练实验

面试指南

  • 项目介绍采用STAR法则:情境-任务-行动-结果,突出技术细节和量化成果
  • 技术问题分步骤回答:问题分析→候选方案→选择理由→实验结果→迭代过程
  • 场景问题结合具体案例,体现对机器人交互领域特点的理解
  • 请详细介绍你做过的一个大模型后训练项目,包括数据构建、训练方法、效果评估
  • 你在SFT和DPO中遇到过什么挑战?如何解决过拟合或不稳定问题?
  • 如何设计结构化输出(如JSON schema)确保模型稳定输出指定字段?
  • 描述一个端侧模型压缩或量化的经验,如何平衡精度和性能?
  • 你认为机器人交互场景中大模型面临哪些独特挑战?如何优化?

职位点评

71
综合评分

前沿大模型训练岗位,技术成长快但WLB一般,适合技术导向的算法工程师。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和职业发展的求职者,能接受较高工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值80

薪资福利

70中等

薪资有竞争力但B轮公司稳定性一般,未提及明确福利。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

前沿的多模态大模型训练方向,技术成长空间大,但JD未明确提及培训或晋升路径。

技术前沿前沿/新兴技术
技术栈PyTorch、HuggingFace Transformers、DeepSpeed、LoRA、DPO、RLHF、多模态
业务类型profit_center

工作生活

40较低

仅现场办公,上海核心地段可能,但未提及WLB,大模型训练节奏紧张。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

机器人交互场景具有社会价值,行业高速增长,但JD未强调使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs