
智元机器人
优才-具身Agentic大模型算法工程师
优才-具身Agentic大模型算法工程师
发布于 大约 1 小时前普通员工/个人贡献者
北京市 / 上海市
其它
全职员工
仅现场办公
硕士
具身智能
Agentic Rl
Dpo
Ppo
Pytorch
Rlhf
Sft
具身智能
多模态
大语言模型
AI 估算 · 35k–70k
具身智能是前沿赛道,大模型算法工程师需求旺盛,高技能稀缺性带来较高薪资水平。
职位详情
关于这个职位
该职位负责具身智能场景下多模态Agentic大模型算法的研究与落地,包括多步任务规划、强化学习后训练、多模态记忆与推理优化
你将搭建Agent训练与评测管线,提升机器人在复杂物理环境中的自主决策与执行能力
适合对大模型与具身智能交叉领域有浓厚兴趣的技术人才
最低要求
学历与专业:硕士及以上学历,计算机、自动化、人工智能、机器人、电子信息等相关专业
编程与框架:熟练掌握Python编程语言,具备扎实的数据结构与算法基础,熟练使用PyTorch等深度学习框架
具有良好的工程落地能力,熟悉Agent部署相关技术者优先
大模型与Agent:深入理解Transformer架构,熟悉主流大语言模型与多模态大模型的原理,熟悉大模型训练推理算法
熟悉主流Agent框架与生态(如Claude, Codex, TRAE等),具备复杂工作流编排、多步工具调用链路及SFT/RLHF数据构建经验
强化学习与对齐:熟悉RLHF/RLAIF等对齐技术,有Agentic RL或大模型后训练落地经验,理解PPO、DPO等强化学习算法原理
工作职责
具身Agentic AI架构研究:负责具身场景下多模态Agentic AI算法的研究与落地,构建具备复杂任务规划、反思与执行能力的Multi-Agent智能体架构
设计并优化多步工具调用及动作执行链路,增强Agent在不确定物理环境下的多步推理、纠错与决策能力
具身Agentic后训练研究:主导SFT微调与Agentic后训练算法,搭建SFT/Agentic RL数据与评测管线,支持数据版本管理、质量校验及自动化评测
探索并落地Agentic RL算法,通过高效的数据、训练与评测闭环支撑算法快速迭代,提升具身大模型的能力上限与泛化性
多模态空间理解与记忆:提升模型在复杂物理环境中的场景语义理解能力,实现视觉、点云、语言等多模态输入的精准对齐与物理状态感知
设计并优化长上下文管理、多模态记忆算法(如场景记忆、长程任务记忆),解决具身任务中的多轮交互与记忆遗忘问题
Agent部署与Harness优化:构建Harness工程支持多步工具调用与状态管理的可观测性与容错机制,确保复杂任务流的稳定执行与系统安全性
搭建与优化Agent推理服务执行链路,通过模型加速、缓存策略与负载均衡设计,提升系统吞吐量并降低推理延迟
AI 洞察
优缺点分析
优点
- 站在具身智能和大模型交叉的最前沿,技术壁垒高,积累的经验极具行业竞争力
- 公司处于快速成长期,技术氛围浓厚,能接触从研究到落地的完整闭环
- 薪资水平在行业内具有竞争力,且该领域人才稀缺,职业发展空间大
- 工作强度可能较大,需要同时掌握算法研究、工程实现和模型训练,综合要求高
- 具身智能仍处于早期探索阶段,存在不确定性和技术难点,需要较强的抗压能力和持续学习意愿
- 适合对具身智能和大模型有强烈技术热情、具备扎实算法与工程能力、能适应快节奏和高强度研究环境的求职者
缺点 / 挑战
暂无明显挑战项
角色解读
- 从算法工程师向具身智能领域专家发展,成为多模态Agent与大模型结合的稀缺技术人才
- 可以转向技术管理岗位,带领团队主导Agent架构设计和训练管线搭建
- 在智元机器人这样专注具身智能的公司,有机会深度参与行业前沿项目,提升产品化落地能力
- 研究并落地具身智能场景下的多模态Agentic大模型,设计Multi-Agent架构,实现复杂任务的规划、反思与执行
- 搭建SFT和Agentic RL训练与评测管线,负责数据版本管理、质量校验和自动化评测,高效迭代模型能力
- 优化多模态空间理解与记忆机制,处理视觉、点云、语言等输入,解决长程任务中的记忆遗忘问题
- 构建Agent部署和Harness工程,确保多步工具调用链路的稳定性、可观测性和推理性能
- 扎实的Python编程能力和数据结构算法基础,熟练使用PyTorch等深度学习框架
- 深入理解Transformer架构和大模型训练推理原理,熟悉主流Agent框架和生态(如Claude, Codex, TRAE)
- 掌握RLHF/RLAIF、PPO、DPO等强化学习与对齐技术,有Agentic RL或后训练经验者优先
- 具备良好的工程落地能力,熟悉Agent部署、模型加速、缓存策略等推理优化技术
申请策略
- 关注智元机器人具身智能方向的产品和研发进展,在面试中展现对公司技术路线的理解
- 准备一个完整的项目案例,详细说明自己在算法设计、数据管线和部署优化中的具体贡献
- 突出大模型、多模态、Agent相关的研究或项目经历,特别是SFT、RLHF、Agentic RL训练实践
- 强调工程落地能力,如部署过Agent服务、优化过推理链路、搭建过数据评测管线等
- 展示对Transformer架构、强化学习算法的深入理解,包括论文复现或开源贡献
- 补强Agent框架和工具链,动手实践Claude、Codex或TRAE等主流Agent生态
- 系统学习RLHF和Agentic RL,通过小规模实验理解PPO、DPO的原理
- 提升多模态模型处理能力,熟悉点云、视觉-语言对齐等方向
面试指南
- 回答技术设计问题时,采用“目标-约束-方案”框架:明确任务目标,分析物理环境的不确定性和约束,再给出具体的架构或算法方案
- 对于项目经验类问题,使用STAR法则(情境-任务-行动-结果),突出个人的技术难点与解决过程
- 如何设计一个多模态Agent智能体架构来处理未知环境中的多步任务?
- 你如何搭建SFT和Agentic RL的数据与评测管线?请具体说明流程和难点
- 结合经验谈谈PPO和DPO在具身Agent后训练中的适用场景和优缺点
- 如何解决Agent在长程任务中的记忆遗忘问题?你有哪些多模态记忆算法的思路?
- 在部署Agent服务时,如何保证复杂任务链的稳定性并降低推理延迟?
- 深入复习Transformer、RLHF/PPO/DPO等核心原理,并能推导关键公式
职位点评
75
综合评分
前沿具身智能赛道,顶尖算法技术栈,薪资待定,工作强度不确定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、渴望快速成长、能接受不确定性挑战的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活60
使命价值85
薪资福利
70中等
薪资水平未在JD中披露,但结合岗位稀缺性和行业行情,预估具有较强竞争力;福利待遇不明。
薪资信号未披露(AI估算:35K-70K/月)
成长发展
88较高
岗位涉及前沿的具身Agentic大模型技术,能深度参与研究、训练与落地,成长空间极大。
技术前沿前沿/新兴技术
技术栈Python、PyTorch、Transformer、多模态、Agent、Agentic RL、RLHF、PPO、DPO
业务类型ambiguous
工作生活
60中等
职位要求现场办公,北京上海两地;JD未提及加班和远程工作,无法判断工作生活平衡,算法岗可能面临一定强度。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
具身智能是高速增长赛道,技术具有较强社会意义,工作内容处于行业创新前沿,能带来使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs