
智元机器人
全模态大模型算法研究员
全模态大模型算法研究员
发布于 大约 1 小时前普通员工/个人贡献者
北京市 / 上海市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Dpo
Gpu集群
Grpo
Pytorch
Rlhf
Sft
全模态大模型
多模态
数据清洗
AI 估算 · 30k–60k
北京上海大模型算法岗位薪资较高,B轮公司有竞争力,技术难度大,市场稀缺,月薪3-6万合理。
职位详情
关于这个职位
该职位专注于机器人场景的全模态大模型研究与落地,涉及数据方案设计、监督微调(SFT)和强化学习算法(如GRPO、DPO)的全模态适配
你将与算法、工程、数据团队协作,推动大模型在文本、图像、语音等多模态下的训练与优化,直接提升人形机器人的智能化水平
最低要求
计算机、人工智能、软件工程、自动化、电子、数学等相关专业硕士及以上学历
出色的问题分析和解决能力,自主探索新解决方案的能力强;
关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情;
具备较强的新技术跟踪与研究能力,能够快速理解并复现业界前沿全模态大模型工作(如 Qwen-Omni、GPT-4o、Gemini 等)
具有 SFT、RLHF/RLVR(如 PPO、GRPO、GSPO、DPO 等)算法研究或工程落地经验,尤其是在多模态(图像/语音/视频)场景下的实践经验
工作职责
负责数据方案的整体设计,包括数据来源规划、清洗与合成策略、多模态数据配比实验与迭代,为模型能力提升提供高质量、可扩展的数据基座
主导全模态大模型的 SFT(监督微调)方案设计与落地,包括指令数据构造、多轮对话/工具调用/长上下文场景微调、跨模态对齐(图文/音文/视频文本等)效果评估与调优
投入全模态强化学习算法研究,覆盖 GRPO、GSPO、DPO 等主流 RL 后训练算法在全模态场景下的适配与创新,设计面向多模态生成与理解任务的 reward 建模、rollout 策略与训练稳定性优化方案
跟踪业界全模态大模型最新数据、算法与工程实践,持续输出实验结论与技术方案,与算法、工程、数据等团队协作,推动数据方案、训练算法、评测体系的闭环建设,保障模型迭代效率与效果可复现性
AI 洞察
优缺点分析
优点
- 置身于全模态大模型前沿领域,技术稀缺性和含金量高,职业竞争力强
- 机器人+大模型交叉赛道处于爆发期,行业前景广阔,项目落地价值大
- 公司为B轮融资的中大型企业,团队有活力,个人影响力容易体现
- 工作内容涵盖数据、训练、RL全链路,技能积累全面,成长空间大
- 多模态对齐和强化学习稳定性调优难度大,实验周期长,需要耐心和细致
- 适合对多模态大模型有浓厚兴趣、热爱技术钻研、具备较强独立研究能力且能承受快速学习节奏的算法工程师
缺点 / 挑战
- 全模态大模型训练对算力和数据要求极高,可能面临资源竞争和技术瓶颈
- 技术迭代极快,需要持续跟踪最新论文并快速复现,学习压力较大
角色解读
- 从算法研究员逐步成长为全模态大模型方向的专家,主导核心技术路线选择
- 可向技术管理方向发展,带领算法团队推动项目落地
- 横向扩展到机器人感知、决策等其他AI领域,积累跨领域经验
- 设计并优化多模态数据方案,包括数据采集、清洗、合成及配比实验,为模型训练提供高质量数据基座
- 主导全模态大模型的监督微调(SFT),构建指令数据,调整跨模态对齐效果,提升模型在多轮对话、工具调用等场景的表现
- 探索并实现全模态强化学习算法(如GRPO、DPO),设计reward模型和训练策略,优化模型在生成与理解任务上的稳定性
- 跟踪前沿技术(如Qwen-Omni、GPT-4o),与团队协作推动算法、数据、评测的闭环迭代,保证模型快速迭代与效果可复现
- 扎实的机器学习/深度学习基础,熟悉Transformer架构和主流大模型训练范式
- 精通SFT、RLHF/RLVR算法,具备多模态(图像、语音、视频)场景下的实践经验和调优能力
- 熟练使用Python及PyTorch等深度学习框架,具备大规模分布式训练经验
- 良好的问题分析和独立探索能力,能快速复现并改进业界前沿工作
申请策略
- 在求职信中表达对人形机器人智能化的热情,并阐述自己对该方向技术难点的理解
- 建议提前了解智元机器人的产品和技术路线,在面试中提出有建设性的想法
- 突出多模态大模型项目经验,尤其是数据方案设计、SFT调优或RL算法落地的具体成果
- 提及复现或改进业界前沿模型(如Qwen-Omni、GPT-4o)的经历,展现技术追踪能力
- 强调分布式训练、大规模数据处理等工程能力,以及发表的论文或开源贡献
- 系统学习GRPO、GSPO等最新强化学习算法,动手实现并对比不同策略的效果
- 补充多模态数据处理知识,如图文对齐、语音特征提取、视频理解等
- 练习使用PyTorch FSDP或DeepSpeed进行大模型分布式训练,提升工程实操能力
面试指南
- 结合项目经历,按照「背景-方案-效果-反思」的结构回答,突出个人贡献和难点突破
- 对比技术方案时,从理论原理、实践效果、适用场景三个维度分析
- 开放性问题需展示对业务(机器人)的理解,将技术选择与产品需求关联
- 请详细描述你参与过的全模态大模型项目,数据方案如何设计?SFT如何调优?
- 对比GRPO和DPO的异同,在全模态场景下你更倾向于哪种?为什么?
- 如何处理多模态数据中不同模态之间的对齐问题?举个具体例子
- 你在分布式训练中遇到过哪些问题?如何解决通信瓶颈或显存不足?
- 你对人形机器人需要具备什么样的多模态交互能力有什么看法?
职位点评
68
综合评分
前沿全模态大模型研究岗,技术成长极高,薪资中上,但工作强度可能较大,适合有热情的算法专家。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术快速成长和前沿挑战的求职者,愿意在机器人+大模型领域深耕,对工作和生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活40
使命价值75
薪资福利
65中等
该职位薪资在行业中处于较高水平(3-6万/月),但未明确提及福利,且B轮公司稳定性一般,补偿性动机满足程度中等偏上。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
90较高
全模态大模型是前沿技术方向,工作涵盖数据、SFT、RL全链路,技能成长空间极大,且公司强调前沿跟踪与实验,发展性动机得到很好满足。
技术前沿前沿/新兴技术
技术栈Transformer、SFT、RLHF、GRPO、DPO、多模态、Qwen-Omni、GPT-4o
成长机会跟踪业界前沿、持续输出实验结论
业务类型profit_center
工作生活
40较低
职位要求北京或上海现场办公,未提及弹性工时或远程,推测可能需要较强的工作投入,生活化动机满足程度较低。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
75中等
工作推动人形机器人智能化,具有较高的社会价值和创新意义,但未直接强调使命感,意义感动机满足程度较好。
行业发展高速增长赛道
社会影响中性/一般
使命信号推动人形机器人智能化
创新程度开拓性创新(行业首创)
智元机器人 的其他在招职位
相似职位推荐
LLM Agent算法实习生
网易 · 杭州市AI 估算 · 4k-6kADAS Algorithm Enginner – Plan & Control Evaluation 智驾归控评测算法工程师
奔驰 · 上海市AI 估算 · 35k-55kADAS Algorithm Engineer - Lateral Control 智驾横向控制算法工程师
奔驰 · 上海市AI 估算 · 25k-45kADAS Algorithm Engineer - Advanced Parking 高阶泊车算法工程师
奔驰 · 北京市AI 估算 · 25k-40k广告算法工程师
京东 · 海南省AI 估算 · 30k-55k
Watch Jobs