AgiBot logo
智元机器人
Humanoid Whole-Body Policy Learning算法实习生

Humanoid Whole-Body Policy Learning算法实习生

发布于 大约 20 小时前

实习/见习

上海市
初级经验
实习生
仅现场办公
硕士
研究与开发 (研发)
Loco-Manipulation
Pytorch
Reinforcement Learning
Sim-To-Real
Whole-Body Control

AI 估算 · 8k–15k

机器人算法实习薪资较高,上海B轮公司通常给实习生400-600元/天,月薪折算约8000-15000元,且可能有转正机会。

职位详情

关于这个职位

这是一份人形机器人全身控制算法的实习岗位,你将深度参与构建从仿真训练到真机部署的全流程

工作包括训练RL策略、设计奖励函数、进行大规模消融实验,并亲手将算法部署到真实机器人上
适合对具身智能和运动控制有强烈兴趣、动手能力强的同学

最低要求

CS / Robotics / 控制 / 自动化等相关专业在读硕士或博士

扎实的 Python / PyTorch 工程能力,对机器人运动控制和具身操作(embodied manipulation)有清晰的理解
完整的 RL 训练项目经验:至少独立完成过一段在仿真中训练 RL policy 的工作(从环境搭建、reward 设计到调参收敛全流程),humanoid / legged 方向优先
熟悉人形机器人条件动作生成的相关方法,如text2motion,audio2motion等
对人形机器人自主全身控制方向有持续的热情与投入
实习周期不少于 6 个月,每周到岗不少于 4 天(表现优秀者优先转校招)

工作职责

参与构建 task-conditioned 全身控制 pipeline,深度参与 motion retargeting、policy 训练、reward / curriculum 设计、大规模 ablation 实验等关键环节

复现并改进领域最新代表性工作(如 whole-body tracking、loco-manipulation、humanoid RL 等方向),在团队自有数据集与真实任务场景下验证、对比与迭代算法表现
参与真机数据采集、sim-to-real 部署与真机调试,搭建可视化分析工具,定位 sim-real gap 并推动闭环优化

优先资格

熟悉 Isaac Lab / Isaac Gym / MuJoCo 等仿真平台,有 humanoid 或 legged robot 的实操经验

有真机调试或 sim-to-real 部署的实战经历
接触过 motion retargeting(GMR / PHC / PHUMA 等)、动作编辑或人体动捕数据处理
熟悉 SMPL / AMASS 等人体动作数据集
在相关方向有学术投稿或发表(CoRL / RSS / ICRA / ICLR / NeurIPS 等优先)
具备 C++ 工程能力,能参与 policy 的端侧部署与实时推理优化

AI 洞察

优缺点分析

优点

  • 接触最前沿的人形机器人全身控制技术,技术含量高,成长快
  • 公司处于机器人行业风口,B 轮融资后资源充足,有机会参与真实产品落地
  • 团队学术氛围浓,鼓励复现论文和发表,有利于积累研究成果
  • 实习周期要求 6 个月且每周到岗 4 天,时间投入较大,需平衡学业
  • 人形机器人控制难度极高,sim-to-real 调试过程可能耗时且充满不确定性
  • 适合对机器人运动控制有强烈热情、具备一定强化学习基础、愿意长期投入并动手实践的研究生

缺点 / 挑战

  • 对强化学习和机器人基础要求较高,入门门槛不低

角色解读

  • 实习表现优秀可转正为正式算法工程师,继续深入人形机器人控制方向
  • 未来可发展为机器人运动控制专家或具身智能算法研究员,参与前沿学术研究
  • 积累 sim-to-real 部署经验后,可转向机器人系统集成或产品化落地岗位
  • 构建人形机器人的全身控制流水线,包括动作重定向、策略训练和奖励函数设计
  • 复现并改进最新的全身控制算法,在真实任务场景中进行验证和对比
  • 参与真机数据采集和 sim-to-real 部署,调试并缩小仿真与现实的差距
  • 扎实的 Python 和 PyTorch 编程能力,能独立实现强化学习策略
  • 深入理解机器人运动控制和具身操作,有完整的 RL 训练项目经验
  • 熟悉至少一种物理仿真平台(如 Isaac Lab、MuJoCo),有 humanoid 或 legged 机器人经验优先

申请策略

  • 在申请邮件中表达你对人形机器人的热情,并附上一个你做过的 RL 演示视频或项目链接
  • 了解智元机器人的技术路线和产品方向,在面试中展现你对公司技术的认同
  • 突出你的 RL 项目经验,详细描述从环境搭建到策略收敛的完整过程
  • 强调你使用过的仿真平台(如 Isaac Gym、MuJoCo)和真机调试经历
  • 如果有相关学术论文或开源项目,务必列出并说明你的贡献
  • 提前熟悉人形机器人常用数据集(如 AMASS、SMPL)和 motion retargeting 工具
  • 复习强化学习核心算法(PPO、SAC 等)和 reward engineering 技巧

面试指南

  • 对于项目描述题,采用 STAR 法则(情境、任务、行动、结果),重点突出你的挑战和解决方法
  • 对于技术概念题,先给出定义,然后结合实际经验说明,最后补充相关论文或工具
  • 对于调试问题,按照“假设-验证-迭代”的框架,从 reward、curriculum、物理参数等角度逐步分析
  • 请描述你过去完成的一个 RL 项目,重点说明 reward 设计和调参过程
  • 你如何理解 sim-to-real 中的 domain randomization?请举例说明
  • 解释一下 whole-body control 和 loco-manipulation 的区别和联系
  • 你用过哪些运动重定向方法?比较一下 GMR 和 PHC 的优缺点
  • 如果训练的人形机器人总是摔倒,你会如何调试?

职位点评

64
综合评分

前沿人形机器人算法实习,技术天花板高,但工作强度大,适合热血技术理想派。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
最看重技能成长和技术前沿,愿意投入大量时间精力换取快速进步的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活30
使命价值80

薪资福利

65中等

实习岗位薪资在行业中上水平,但属于B轮公司,稳定性不如大厂,福利未在JD中明确提及。整体补偿性一般。

薪资信号面议 (8K-15K/月)

成长发展

90较高

该岗位处于人形机器人最前沿,技术栈新,团队鼓励复现论文和发表,成长空间极大。

技术前沿前沿/新兴技术
技术栈Reinforcement Learning、Humanoid Robot、Whole-Body Control、Sim-to-Real、Isaac Lab、MuJoCo、PyTorch
成长机会表现优秀者优先转校招
业务类型profit_center

工作生活

30较低

要求每周至少到岗4天,实习6个月,且工作内容涉及大量调试和实验,WLB压力较大。

工作模式仅现场办公
办公地点科技园/产业园
加班情况JD含高强度暗示词

使命价值

80较高

人形机器人是具身智能的重要方向,对技术进步和社会生产力提升有积极意义,但直接的社会影响力尚不明确。

行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
Watch Jobs