
智元机器人
多模态大模型训练工程师(后训练 / 机器人交互方向)
多模态大模型训练工程师(后训练 / 机器人交互方向)
发布于 大约 14 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Deepspeed
Dpo
Huggingface Transformers
Lora
Pytorch
Rlhf
Sft
多模态模型
机器人交互
AI 估算 · 30k–50k
大模型训练岗位稀缺,上海薪资水平高,3年以上经验市场价约30-50k/月。
职位详情
关于这个职位
该职位负责开源大模型在机器人场景下的后训练与适配,包括SFT、DPO、LoRA等训练实验,以及结构化输出训练
你将参与机器人交互数据构建,与端侧部署和评测工程师协作,持续优化模型
适合有3年以上大模型训练经验、对机器人交互感兴趣的技术专家
最低要求
本科及以上学历,计算机、人工智能、软件工程、自动化、机器人、电子信息等相关专业优先
年以上 LLM / MLLM / NLP / 多模态模型训练或相关算法经验
熟悉 PyTorch、HuggingFace Transformers、DeepSpeed、Accelerate、vLLM 等至少部分训练 / 推理框架
熟悉 SFT、LoRA / QLoRA、DPO、RLHF、蒸馏、指令微调等至少两类后训练方法
具备较强的数据意识,能围绕任务目标设计训练数据、偏好数据、teacher label 和评测 case
能独立完成训练实验设计、checkpoint 管理、指标对比、case 分析和复现实验
对机器人交互、多模态输入、结构化输出和端侧模型落地有兴趣
工作职责
负责开源大模型在机器人场景下的后训练与能力适配
负责 SFT、DPO、LoRA / QLoRA、蒸馏等训练实验,完成模型版本迭代与效果分析
负责结构化输出训练,使模型稳定输出可被运行时消费的字段,例如
speechact、intent、emotionstyle、route、tool_call、expression、gesture 等参与机器人交互数据构建,包括多轮对话、回应对象、主动交互、澄清确认、情绪表达、端云路由等数据
参与 preference data、teacher label、hard case 回流数据的构建与质量控制
与端侧部署工程师协作,支持端侧规格约束下的模型训练、蒸馏、结构化输出稳定性和量化敏感性验证
与评测工程师协作,根据 gold set、hard case、shadow eval 和版本回归结果持续优化模型
支持 Demo 的模型能力建设与版本冻结
优先资格
做过 Qwen、LLaMA、InternVL、MiniCPM、LLaVA、Qwen-Audio、Qwen-Omni 等开源模型微调
做过多模态模型训练,尤其是 audio / video / image / text 相关任务
做过结构化输出、tool calling、function calling、JSON schema 约束训练
做过 DPO / RLHF / reward model / preference data 构造
做过 Agent、router、planner、多轮对话、语音助手、智能座舱、数字人或机器人项目
做过 active speaker、addressed-to-robot、turn-taking、engagement、speaker attribution 等任务
做过模型蒸馏、端侧小模型训练、量化感知训练或压缩相关工作
AI 洞察
优缺点分析
优点
- 公司处于B轮,发展潜力大,有机会接触从数据到部署的全流程
- 薪资竞争力强,稀缺岗位议价空间大
- 对跨领域知识要求高(NLP、CV、机器人、端侧部署),学习曲线陡峭
- 机器人交互场景复杂,结构化输出和端侧约束带来调试难度
缺点 / 挑战
- 参与前沿的机器人交互大模型训练,技术挑战大、成长快
- 工作强度可能较高,需要紧跟大模型快速迭代节奏
- 适合有3年以上大模型训练经验、乐于深耕机器人交互方向、喜欢挑战和解决实际问题的算法工程师
角色解读
- 技术方向:可深入多模态大模型、端侧模型压缩、机器人感知决策等领域
- 管理方向:表现优秀可晋升为技术负责人或团队Leader,带领算法团队
- 行业前景:机器人+大模型是热门赛道,积累稀缺经验后具有极高市场竞争力
- 负责开源大模型在机器人场景下的后训练,包括SFT、DPO、LoRA等实验,进行模型版本迭代与效果分析
- 参与机器人交互数据构建,设计多轮对话、情绪表达等结构化数据,确保模型输出符合业务需求
- 与端侧部署和评测工程师协作,优化模型在资源约束下的稳定性和量化性能
- 扎实的LLM/MLLM训练经验,熟悉PyTorch、Transformers、DeepSpeed等框架
- 精通后训练方法如SFT、LoRA、DPO、RLHF,能独立设计实验和数据分析
- 对机器人交互和多模态技术有浓厚兴趣,了解结构化输出和端侧部署挑战
申请策略
- 在投递时附上个人技术博客或GitHub项目(如开源模型微调代码),展示实践能力
- 提前了解智元机器人的产品线和技术方向,在面试中体现对机器人交互的理解
- 突出大模型后训练项目经验,尤其是SFT、DPO、LoRA等具体方法的成果(如指标提升、模型发布)
- 强调多模态或多轮对话相关数据构建和结构化输出经验
- 展示开源模型微调、端侧部署或模型蒸馏等加分项
- 补充机器人交互或语音助手相关背景知识,了解turn-taking、engagement等概念
- 练习使用DeepSpeed、vLLM等框架进行大规模训练实验
面试指南
- 项目介绍采用STAR法则:情境-任务-行动-结果,突出技术细节和量化成果
- 技术问题分步骤回答:问题分析→候选方案→选择理由→实验结果→迭代过程
- 场景问题结合具体案例,体现对机器人交互领域特点的理解
- 请详细介绍你做过的一个大模型后训练项目,包括数据构建、训练方法、效果评估
- 你在SFT和DPO中遇到过什么挑战?如何解决过拟合或不稳定问题?
- 如何设计结构化输出(如JSON schema)确保模型稳定输出指定字段?
- 描述一个端侧模型压缩或量化的经验,如何平衡精度和性能?
- 你认为机器人交互场景中大模型面临哪些独特挑战?如何优化?
职位点评
71
综合评分
前沿大模型训练岗位,技术成长快但WLB一般,适合技术导向的算法工程师。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和职业发展的求职者,能接受较高工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值80
薪资福利
70中等
薪资有竞争力但B轮公司稳定性一般,未提及明确福利。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
前沿的多模态大模型训练方向,技术成长空间大,但JD未明确提及培训或晋升路径。
技术前沿前沿/新兴技术
技术栈PyTorch、HuggingFace Transformers、DeepSpeed、LoRA、DPO、RLHF、多模态
业务类型profit_center
工作生活
40较低
仅现场办公,上海核心地段可能,但未提及WLB,大模型训练节奏紧张。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
机器人交互场景具有社会价值,行业高速增长,但JD未强调使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs