AgiBot logo
智元机器人
优才-具身Agentic大模型算法工程师

优才-具身Agentic大模型算法工程师

发布于 大约 1 小时前

普通员工/个人贡献者

北京市 / 上海市
其它
全职员工
仅现场办公
硕士
具身智能
Agentic Rl
Dpo
Ppo
Pytorch
Rlhf
Sft
具身智能
多模态
大语言模型

AI 估算 · 35k–70k

具身智能是前沿赛道,大模型算法工程师需求旺盛,高技能稀缺性带来较高薪资水平。

职位详情

关于这个职位

该职位负责具身智能场景下多模态Agentic大模型算法的研究与落地,包括多步任务规划、强化学习后训练、多模态记忆与推理优化

你将搭建Agent训练与评测管线,提升机器人在复杂物理环境中的自主决策与执行能力
适合对大模型与具身智能交叉领域有浓厚兴趣的技术人才

最低要求

学历与专业:硕士及以上学历,计算机、自动化、人工智能、机器人、电子信息等相关专业

编程与框架:熟练掌握Python编程语言,具备扎实的数据结构与算法基础,熟练使用PyTorch等深度学习框架
具有良好的工程落地能力,熟悉Agent部署相关技术者优先
大模型与Agent:深入理解Transformer架构,熟悉主流大语言模型与多模态大模型的原理,熟悉大模型训练推理算法
熟悉主流Agent框架与生态(如Claude, Codex, TRAE等),具备复杂工作流编排、多步工具调用链路及SFT/RLHF数据构建经验
强化学习与对齐:熟悉RLHF/RLAIF等对齐技术,有Agentic RL或大模型后训练落地经验,理解PPO、DPO等强化学习算法原理

工作职责

具身Agentic AI架构研究:负责具身场景下多模态Agentic AI算法的研究与落地,构建具备复杂任务规划、反思与执行能力的Multi-Agent智能体架构

设计并优化多步工具调用及动作执行链路,增强Agent在不确定物理环境下的多步推理、纠错与决策能力
具身Agentic后训练研究:主导SFT微调与Agentic后训练算法,搭建SFT/Agentic RL数据与评测管线,支持数据版本管理、质量校验及自动化评测
探索并落地Agentic RL算法,通过高效的数据、训练与评测闭环支撑算法快速迭代,提升具身大模型的能力上限与泛化性
多模态空间理解与记忆:提升模型在复杂物理环境中的场景语义理解能力,实现视觉、点云、语言等多模态输入的精准对齐与物理状态感知
设计并优化长上下文管理、多模态记忆算法(如场景记忆、长程任务记忆),解决具身任务中的多轮交互与记忆遗忘问题
Agent部署与Harness优化:构建Harness工程支持多步工具调用与状态管理的可观测性与容错机制,确保复杂任务流的稳定执行与系统安全性
搭建与优化Agent推理服务执行链路,通过模型加速、缓存策略与负载均衡设计,提升系统吞吐量并降低推理延迟

AI 洞察

优缺点分析

优点

  • 站在具身智能和大模型交叉的最前沿,技术壁垒高,积累的经验极具行业竞争力
  • 公司处于快速成长期,技术氛围浓厚,能接触从研究到落地的完整闭环
  • 薪资水平在行业内具有竞争力,且该领域人才稀缺,职业发展空间大
  • 工作强度可能较大,需要同时掌握算法研究、工程实现和模型训练,综合要求高
  • 具身智能仍处于早期探索阶段,存在不确定性和技术难点,需要较强的抗压能力和持续学习意愿
  • 适合对具身智能和大模型有强烈技术热情、具备扎实算法与工程能力、能适应快节奏和高强度研究环境的求职者

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从算法工程师向具身智能领域专家发展,成为多模态Agent与大模型结合的稀缺技术人才
  • 可以转向技术管理岗位,带领团队主导Agent架构设计和训练管线搭建
  • 在智元机器人这样专注具身智能的公司,有机会深度参与行业前沿项目,提升产品化落地能力
  • 研究并落地具身智能场景下的多模态Agentic大模型,设计Multi-Agent架构,实现复杂任务的规划、反思与执行
  • 搭建SFT和Agentic RL训练与评测管线,负责数据版本管理、质量校验和自动化评测,高效迭代模型能力
  • 优化多模态空间理解与记忆机制,处理视觉、点云、语言等输入,解决长程任务中的记忆遗忘问题
  • 构建Agent部署和Harness工程,确保多步工具调用链路的稳定性、可观测性和推理性能
  • 扎实的Python编程能力和数据结构算法基础,熟练使用PyTorch等深度学习框架
  • 深入理解Transformer架构和大模型训练推理原理,熟悉主流Agent框架和生态(如Claude, Codex, TRAE)
  • 掌握RLHF/RLAIF、PPO、DPO等强化学习与对齐技术,有Agentic RL或后训练经验者优先
  • 具备良好的工程落地能力,熟悉Agent部署、模型加速、缓存策略等推理优化技术

申请策略

  • 关注智元机器人具身智能方向的产品和研发进展,在面试中展现对公司技术路线的理解
  • 准备一个完整的项目案例,详细说明自己在算法设计、数据管线和部署优化中的具体贡献
  • 突出大模型、多模态、Agent相关的研究或项目经历,特别是SFT、RLHF、Agentic RL训练实践
  • 强调工程落地能力,如部署过Agent服务、优化过推理链路、搭建过数据评测管线等
  • 展示对Transformer架构、强化学习算法的深入理解,包括论文复现或开源贡献
  • 补强Agent框架和工具链,动手实践Claude、Codex或TRAE等主流Agent生态
  • 系统学习RLHF和Agentic RL,通过小规模实验理解PPO、DPO的原理
  • 提升多模态模型处理能力,熟悉点云、视觉-语言对齐等方向

面试指南

  • 回答技术设计问题时,采用“目标-约束-方案”框架:明确任务目标,分析物理环境的不确定性和约束,再给出具体的架构或算法方案
  • 对于项目经验类问题,使用STAR法则(情境-任务-行动-结果),突出个人的技术难点与解决过程
  • 如何设计一个多模态Agent智能体架构来处理未知环境中的多步任务?
  • 你如何搭建SFT和Agentic RL的数据与评测管线?请具体说明流程和难点
  • 结合经验谈谈PPO和DPO在具身Agent后训练中的适用场景和优缺点
  • 如何解决Agent在长程任务中的记忆遗忘问题?你有哪些多模态记忆算法的思路?
  • 在部署Agent服务时,如何保证复杂任务链的稳定性并降低推理延迟?
  • 深入复习Transformer、RLHF/PPO/DPO等核心原理,并能推导关键公式

职位点评

75
综合评分

前沿具身智能赛道,顶尖算法技术栈,薪资待定,工作强度不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿、渴望快速成长、能接受不确定性挑战的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活60
使命价值85

薪资福利

70中等

薪资水平未在JD中披露,但结合岗位稀缺性和行业行情,预估具有较强竞争力;福利待遇不明。

薪资信号未披露(AI估算:35K-70K/月)

成长发展

88较高

岗位涉及前沿的具身Agentic大模型技术,能深度参与研究、训练与落地,成长空间极大。

技术前沿前沿/新兴技术
技术栈Python、PyTorch、Transformer、多模态、Agent、Agentic RL、RLHF、PPO、DPO
业务类型ambiguous

工作生活

60中等

职位要求现场办公,北京上海两地;JD未提及加班和远程工作,无法判断工作生活平衡,算法岗可能面临一定强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

具身智能是高速增长赛道,技术具有较强社会意义,工作内容处于行业创新前沿,能带来使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
Watch Jobs