AgiBot logo
智元机器人
全模态大模型算法工程师

全模态大模型算法工程师

发布于 大约 14 小时前

普通员工/个人贡献者

上海市 / 北京市
高级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Dpo
Grpo
Rlhf
Sft
全模态大模型
多模态对齐
强化学习
数据合成
机器人

AI 估算 · 40k–70k

大模型方向人才稀缺,B轮机器人公司薪资竞争力强,中高级算法工程师月薪在4-7万之间。

职位详情

关于这个职位

该职位专注于机器人场景的全模态大模型研发,涉及文本、图像、语音、视频等多模态数据处理与模型训练

你将负责数据方案设计、SFT微调、强化学习算法研究,并与团队协作推动模型迭代落地
适合对生成式AI和多模态交互有热情、具备扎实算法功底的研究型工程师

最低要求

计算机、人工智能、软件工程、自动化、电子、数学等相关专业本科、硕士、博士同学

出色的问题分析和解决能力,自主探索新解决方案的能力强
关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情
具备较强的新技术跟踪与研究能力,能够快速理解并复现业界前沿全模态大模型工作(如 Qwen-Omni、GPT-4o、Gemini 等)
具有 SFT、RLHF/RLVR(如 PPO、GRPO、GSPO、DPO 等)算法研究或工程落地经验,尤其是在多模态(图像/语音/视频)场景下的实践经验

工作职责

负责数据方案的整体设计,包括数据来源规划、清洗与合成策略、多模态数据配比实验与迭代,为模型能力提升提供高质量、可扩展的数据基座

主导全模态大模型的 SFT(监督微调)方案设计与落地,包括指令数据构造、多轮对话/工具调用/长上下文场景微调、跨模态对齐(图文/音文/视频文本等)效果评估与调优
投入全模态强化学习算法研究,覆盖 GRPO、GSPO、DPO 等主流 RL 后训练算法在全模态场景下的适配与创新,设计面向多模态生成与理解任务的 reward 建模、rollout 策略与训练稳定性优化方案
跟踪业界全模态大模型最新数据、算法与工程实践,持续输出实验结论与技术方案,与算法、工程、数据等团队协作,推动数据方案、训练算法、评测体系的闭环建设,保障模型迭代效率与效果可复现性

AI 洞察

优缺点分析

优点

  • 前沿技术赛道:多模态大模型是AI核心方向,技术积累价值高,市场需求旺盛
  • 机器人场景落地:智元机器人专注人形机器人,有机会将算法应用于实际物理世界
  • B轮公司高成长性:参与早期核心算法建设,职业上升空间大,期权潜力可期
  • 团队协作创新:与算法、工程、数据等多团队紧密合作,能快速提升综合能力
  • 技术难度大:全模态大模型涉及多种模态对齐与生成,算法复杂,实验周期长
  • 竞争激烈:大模型领域人才聚集,需要持续保持学习能力以跟进最新进展
  • 适合对生成式AI和多模态技术有浓厚兴趣、具备独立研究能力且能承受快节奏的技术型人才

缺点 / 挑战

  • 工作强度较高:B轮创业公司节奏快,可能需要应对紧迫的模型迭代进度

角色解读

  • 技术深耕:成长为多模态大模型领域顶级算法专家,主导核心算法创新
  • 技术管理:带领小团队负责模型训练或数据方向,逐步转向技术Leader
  • 行业跨界:积累机器人+AI经验,可向具身智能、通用机器人算法方向发展
  • 负责全模态大模型数据方案设计,包括数据来源、清洗、合成与配比实验,确保高质量可扩展的数据基座
  • 主导SFT监督微调方案,涉及指令数据构造、多轮对话、跨模态对齐等,并进行效果评估与调优
  • 投入强化学习后训练算法研究,例如GRPO、DPO等,设计reward建模与训练稳定性优化
  • 跟踪业界最新大模型技术,与团队协作推动模型迭代与评测闭环
  • 精通深度学习与自然语言处理,熟悉Transformer、多模态模型架构(如Qwen-Omni, GPT-4o)
  • 熟练使用主流深度学习框架(PyTorch, TensorFlow),具备分布式训练经验
  • 深入理解SFT、RLHF/RLVR系列算法(PPO, GRPO, DPO等),有相关实践
  • 具备优秀的问题分析与解决能力,能独立探索新方案并快速实验验证

申请策略

  • 表达对智元机器人产品方向的理解,展示将大模型与机器人结合的热情
  • 准备一个简短的Tech Talk,概述你解决过的多模态或RL训练难题
  • 突出多模态项目经验(如图文理解、语音合成等),尤其是SFT和强化学习实际落地案例
  • 强调在数据方案设计或模型训练优化方面的成果,如提升模型性能的具体量化指标
  • 展示对前沿模型(GPT-4o, Gemini等)的理解或复现经历,体现技术跟踪能力
  • 补强强化学习算法(GRPO, DPO)的数学原理与代码实现,可阅读相关论文并复现
  • 熟悉分布式训练框架(DeepSpeed, Megatron)和多模态数据处理工具
  • 了解机器人交互场景,可学习人形机器人基础知识

面试指南

  • STAR法则:描述项目背景、你的具体任务、采取的行动(数据方案、模型架构、训练细节)和最终结果(指标提升、业务影响)
  • 技术对比:对于算法选择,比较不同方法的优缺点并给出选择理由
  • 问题解决:描述遇到的技术挑战(如训练崩坏)和定位/修复过程
  • 请介绍你参与过的多模态模型SFT项目,数据构造和训练策略是怎样的?
  • 在强化学习训练中,如何处理多模态reward设计的不稳定性?
  • 如果需要在全模态大模型中支持视频输入,你会如何设计数据管道和训练策略?
  • 如何评估多模态模型的对齐效果,有哪些指标?
  • 复习常见RLHF/DPO论文,准备好从数学原理到代码实现的完整理解

职位点评

67
综合评分

B轮机器人公司,前沿全模态大模型算法岗,技术天花板高但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿探索的求职者,愿意接受高强度工作以换取快速职业发展。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活40
使命价值80

薪资福利

60中等

薪资具有竞争力(大模型方向溢价),但B轮公司稳定性一般,福利未明确。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

该职位处于AI前沿,技术栈先进(全模态、强化学习),能深度参与核心算法研发,成长空间极大。

技术前沿前沿/新兴技术
技术栈全模态大模型、SFT、RLHF、GRPO、DPO、多模态对齐、生成式AI
成长机会持续输出实验结论与技术方案、跟踪业界最新数据、算法与工程实践
业务类型profit_center

工作生活

40较低

仅现场办公,未提及弹性工作制,创业公司通常工作强度偏高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

参与人形机器人智能化,具有显著的社会价值和技术意义,但行业尚在早期阶段。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号对推动人形机器人智能化有热情
创新程度开拓性创新(行业首创)
Watch Jobs