
智元机器人
全模态大模型算法工程师
全模态大模型算法工程师
发布于 大约 14 小时前普通员工/个人贡献者
上海市 / 北京市
高级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Dpo
Grpo
Rlhf
Sft
全模态大模型
多模态对齐
强化学习
数据合成
机器人
AI 估算 · 40k–70k
大模型方向人才稀缺,B轮机器人公司薪资竞争力强,中高级算法工程师月薪在4-7万之间。
职位详情
关于这个职位
该职位专注于机器人场景的全模态大模型研发,涉及文本、图像、语音、视频等多模态数据处理与模型训练
你将负责数据方案设计、SFT微调、强化学习算法研究,并与团队协作推动模型迭代落地
适合对生成式AI和多模态交互有热情、具备扎实算法功底的研究型工程师
最低要求
计算机、人工智能、软件工程、自动化、电子、数学等相关专业本科、硕士、博士同学
出色的问题分析和解决能力,自主探索新解决方案的能力强
关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情
具备较强的新技术跟踪与研究能力,能够快速理解并复现业界前沿全模态大模型工作(如 Qwen-Omni、GPT-4o、Gemini 等)
具有 SFT、RLHF/RLVR(如 PPO、GRPO、GSPO、DPO 等)算法研究或工程落地经验,尤其是在多模态(图像/语音/视频)场景下的实践经验
工作职责
负责数据方案的整体设计,包括数据来源规划、清洗与合成策略、多模态数据配比实验与迭代,为模型能力提升提供高质量、可扩展的数据基座
主导全模态大模型的 SFT(监督微调)方案设计与落地,包括指令数据构造、多轮对话/工具调用/长上下文场景微调、跨模态对齐(图文/音文/视频文本等)效果评估与调优
投入全模态强化学习算法研究,覆盖 GRPO、GSPO、DPO 等主流 RL 后训练算法在全模态场景下的适配与创新,设计面向多模态生成与理解任务的 reward 建模、rollout 策略与训练稳定性优化方案
跟踪业界全模态大模型最新数据、算法与工程实践,持续输出实验结论与技术方案,与算法、工程、数据等团队协作,推动数据方案、训练算法、评测体系的闭环建设,保障模型迭代效率与效果可复现性
AI 洞察
优缺点分析
优点
- 前沿技术赛道:多模态大模型是AI核心方向,技术积累价值高,市场需求旺盛
- 机器人场景落地:智元机器人专注人形机器人,有机会将算法应用于实际物理世界
- B轮公司高成长性:参与早期核心算法建设,职业上升空间大,期权潜力可期
- 团队协作创新:与算法、工程、数据等多团队紧密合作,能快速提升综合能力
- 技术难度大:全模态大模型涉及多种模态对齐与生成,算法复杂,实验周期长
- 竞争激烈:大模型领域人才聚集,需要持续保持学习能力以跟进最新进展
- 适合对生成式AI和多模态技术有浓厚兴趣、具备独立研究能力且能承受快节奏的技术型人才
缺点 / 挑战
- 工作强度较高:B轮创业公司节奏快,可能需要应对紧迫的模型迭代进度
角色解读
- 技术深耕:成长为多模态大模型领域顶级算法专家,主导核心算法创新
- 技术管理:带领小团队负责模型训练或数据方向,逐步转向技术Leader
- 行业跨界:积累机器人+AI经验,可向具身智能、通用机器人算法方向发展
- 负责全模态大模型数据方案设计,包括数据来源、清洗、合成与配比实验,确保高质量可扩展的数据基座
- 主导SFT监督微调方案,涉及指令数据构造、多轮对话、跨模态对齐等,并进行效果评估与调优
- 投入强化学习后训练算法研究,例如GRPO、DPO等,设计reward建模与训练稳定性优化
- 跟踪业界最新大模型技术,与团队协作推动模型迭代与评测闭环
- 精通深度学习与自然语言处理,熟悉Transformer、多模态模型架构(如Qwen-Omni, GPT-4o)
- 熟练使用主流深度学习框架(PyTorch, TensorFlow),具备分布式训练经验
- 深入理解SFT、RLHF/RLVR系列算法(PPO, GRPO, DPO等),有相关实践
- 具备优秀的问题分析与解决能力,能独立探索新方案并快速实验验证
申请策略
- 表达对智元机器人产品方向的理解,展示将大模型与机器人结合的热情
- 准备一个简短的Tech Talk,概述你解决过的多模态或RL训练难题
- 突出多模态项目经验(如图文理解、语音合成等),尤其是SFT和强化学习实际落地案例
- 强调在数据方案设计或模型训练优化方面的成果,如提升模型性能的具体量化指标
- 展示对前沿模型(GPT-4o, Gemini等)的理解或复现经历,体现技术跟踪能力
- 补强强化学习算法(GRPO, DPO)的数学原理与代码实现,可阅读相关论文并复现
- 熟悉分布式训练框架(DeepSpeed, Megatron)和多模态数据处理工具
- 了解机器人交互场景,可学习人形机器人基础知识
面试指南
- STAR法则:描述项目背景、你的具体任务、采取的行动(数据方案、模型架构、训练细节)和最终结果(指标提升、业务影响)
- 技术对比:对于算法选择,比较不同方法的优缺点并给出选择理由
- 问题解决:描述遇到的技术挑战(如训练崩坏)和定位/修复过程
- 请介绍你参与过的多模态模型SFT项目,数据构造和训练策略是怎样的?
- 在强化学习训练中,如何处理多模态reward设计的不稳定性?
- 如果需要在全模态大模型中支持视频输入,你会如何设计数据管道和训练策略?
- 如何评估多模态模型的对齐效果,有哪些指标?
- 复习常见RLHF/DPO论文,准备好从数学原理到代码实现的完整理解
职位点评
67
综合评分
B轮机器人公司,前沿全模态大模型算法岗,技术天花板高但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和前沿探索的求职者,愿意接受高强度工作以换取快速职业发展。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活40
使命价值80
薪资福利
60中等
薪资具有竞争力(大模型方向溢价),但B轮公司稳定性一般,福利未明确。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
该职位处于AI前沿,技术栈先进(全模态、强化学习),能深度参与核心算法研发,成长空间极大。
技术前沿前沿/新兴技术
技术栈全模态大模型、SFT、RLHF、GRPO、DPO、多模态对齐、生成式AI
成长机会持续输出实验结论与技术方案、跟踪业界最新数据、算法与工程实践
业务类型profit_center
工作生活
40较低
仅现场办公,未提及弹性工作制,创业公司通常工作强度偏高。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
参与人形机器人智能化,具有显著的社会价值和技术意义,但行业尚在早期阶段。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号对推动人形机器人智能化有热情
创新程度开拓性创新(行业首创)
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs