AgiBot logo
智元机器人
强化学习工程师(真机操作方向)

强化学习工程师(真机操作方向)

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
其它
全职员工
仅现场办公
硕士
机器学习工程
Jax
Ppo
Pytorch
Rl
Ros
Sac
Sim2Real
分布式训练
强化学习

AI 估算 · 28k–50k

上海强化学习方向人才稀缺,具身智能赛道热度高,硕士学历要求,薪资高于普通算法岗。

职位详情

关于这个职位

该职位负责真机强化学习算法的设计与落地,构建从仿真到真机部署的完整RL流程,解决Sim2Real迁移中的核心挑战

你将接触前沿的机器人操作任务,参与分布式训练基础设施搭建,与团队共同推动具身智能技术在实际产品中落地

最低要求

硕士及以上,计算机 / 机器人 / 自动化等相关专业

具备真机强化学习的完整项目经验,熟悉从仿真训练到真机策略部署的全流程,了解 Sim2Real 迁移的关键技术(域随机化、阻抗控制、自动重置等)
精通主流 RL 算法(SAC / PPO / TD3 / DrQ 等),有高样本效率训练的实际调优经验
熟练使用 PyTorch 或 JAX,具备分布式训练或并行仿真环境的搭建经验
良好的工程能力,熟悉 Linux 开发环境、ROS 通信、GPU 训练调度

工作职责

负责真机强化学习算法的设计与落地,构建从仿真训练到真机部署的完整 RL pipeline,解决 Sim2Real 迁移中的核心挑战

研发高效的 RL 训练方案,提升样本效率,使复杂灵巧操作任务能在有限训练时间内收敛到高成功率
搭建人机协作训练体系,探索人类遥操作干预、奖励信号设计、渐进式自主等策略,降低真机训练成本
构建分布式 RL 训练基础设施,对接多仿真器后端与真机环境,支持多算法并行实验与大规模数据采集
跟踪真机 RL 与机器人操作领域前沿进展(如 SERL 等代表性工作),快速验证并落地到产品

优先资格

有 SERL / HIL-SERL / RLinf等真机 RL 框架的使用或二次开发经验

接触过灵巧手、双臂协同等接触丰富的操作任务
CoRL / RSS / ICRA / NeurIPS 等顶会 RL 或机器人方向论文

AI 洞察

优缺点分析

优点

  • 公司是B轮融资的机器人公司,业务发展迅速,有机会参与核心产品研发
  • 工作内容涵盖算法、工程、系统搭建,技能积累全面,未来职业选择面广
  • 可以接触SERL等先进框架,紧跟业界最新进展,保持技术竞争力
  • 真机操作任务难度大,Sim2Real迁移问题复杂,需要较强的问题解决能力和耐心
  • 分布式训练基础设施搭建涉及大量工程实践,需要投入较多时间进行调试和优化
  • 行业竞争激烈,可能需要持续学习前沿技术,工作强度可能较大

缺点 / 挑战

  • 处于具身智能和强化学习的前沿赛道,技术挑战大,个人成长空间广阔
  • 适合对强化学习和机器人操作有浓厚兴趣,喜欢挑战复杂技术难题,愿意在快速迭代环境中成长的工程师

角色解读

  • 在具身智能领域深耕,从算法工程师成长为领域专家,参与核心算法决策
  • 可向技术管理方向发展,带领团队负责真机RL系统的整体架构与落地
  • 有发表顶会论文机会,提升个人学术影响力,未来可转型研究岗或创业
  • 负责真机强化学习算法的设计与落地,构建从仿真训练到真机部署的完整RL pipeline,解决Sim2Real迁移的核心挑战
  • 研发高效训练方案,提升样本效率,使灵巧操作任务能在有限时间内收敛到高成功率
  • 搭建人机协作训练体系,探索人类遥操作干预、奖励信号设计等策略,降低真机训练成本
  • 构建分布式RL训练基础设施,对接多仿真器与真机环境,支持多算法并行实验与数据采集
  • 精通主流RL算法(SAC/PPO/TD3/DrQ等),有高样本效率训练的实际调优经验
  • 熟练使用PyTorch或JAX,具备分布式训练或并行仿真环境的搭建经验
  • 熟悉Linux开发环境、ROS通信、GPU训练调度,具备扎实的工程能力
  • 了解Sim2Real迁移的关键技术,如域随机化、阻抗控制、自动重置等

申请策略

  • 提前了解智元机器人的产品方向和具身智能领域的最新进展,准备相关的思考
  • 可以准备一个你解决过的仿真到真机迁移的案例,展示问题解决思路
  • 重点突出真实机器人操作项目经验,尤其是从仿真到真机部署的完整案例
  • 详细描述你在RL算法调优、样本效率提升方面的具体成果,量化改进指标
  • 展示分布式训练基础设施的搭建经验,包括框架使用、仿真器对接等
  • 如有顶会论文或开源贡献,务必突出展示
  • 如果对Sim2Real不熟悉,可提前学习域随机化、自动重置等常用技术
  • 深入理解SAC/PPO等算法的实现细节,并练习用PyTorch实现

面试指南

  • 采用STAR法则(Situation-Task-Action-Result)回答项目经历,突出技术难点和个人贡献
  • 对于算法设计问题,先明确目标和约束,再提出方案并分析权衡,最后给出预期效果
  • 对于工程问题,强调模块化设计和可扩展性,多考虑实际部署中的鲁棒性问题
  • 请介绍一个你完成的真机强化学习项目,重点说明Sim2Real迁移你采用了哪些策略
  • 如何提升强化学习的样本效率?你有哪些实际调参经验?
  • 设计一个双臂协同或灵巧手操作任务的RL训练方案,包括奖励设计、仿真环境搭建等
  • 你对SERL或HIL-SERL了解多少?如果让你使用,你会怎么部署?
  • 在分布式训练中,如何处理仿真环境和真机环境的数据同步?

职位点评

65
综合评分

前沿具身智能算法岗,技术成长快,但工作生活平衡可能受影响。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术前沿和快速成长,愿意接受挑战并在高强度工作中实现自我价值的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展90
工作生活45
使命价值70

薪资福利

55较低

薪资未在JD中明确披露,但公司处于热门赛道且B轮融资,预计实际薪资有竞争力,但福利信息缺失,因此补偿性动机满足程度中等偏下。

薪资信号未披露(AI估算:28K-50K/月)

成长发展

90较高

该职位处于强化学习与机器人操作的交叉前沿,需要掌握从算法到工程的完整技能树,且公司关注最新研究进展,能提供极强的技术成长空间。

技术前沿前沿/新兴技术
技术栈RL、Sim2Real、PyTorch、JAX、SAC、PPO、ROS、分布式训练
业务类型ambiguous

工作生活

45较低

工作地点在上海,但JD未说明工作模式与加班情况,真机实验可能涉及现场调试,难以保证工作生活平衡,因此生活化动机满足程度较低。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

具身智能行业前景广阔,机器人技术有较大社会价值,但JD未明确强调使命感,更多聚焦技术实现,因此意义感动机有较好满足但非核心。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs