AgiBot logo
智元机器人
强化学习后训练算法工程师/专家-Genie业务部

强化学习后训练算法工程师/专家-Genie业务部

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Ppo
Pytorch
Sac
Td3
Verl
Vla
具身智能
强化学习
灵巧手

AI 估算 · 35k–70k

上海AI机器人领域,高级算法岗位薪资竞争力强,技能要求前沿,B轮公司薪资处于市场高位,预计月薪3.5-7万

职位详情

关于这个职位

该职位专注于强化学习后训练算法研发,面向真机操作场景,设计高效的RL训练方案,提升机器人的任务成功率与鲁棒性

你将构建VLA模型的RL后训练体系,探索具身智能中的scaling law,并与团队协作推进从训练到部署的完整闭环
适合对强化学习与机器人交叉领域有深入研究和实践经验的工程师

最低要求

硕士及以上学历,计算机/机器人/自动化/AI 等相关专业

具备扎实的深度学习、强化学习知识基础,熟悉 PPO/SAC/TD3 等主流算法,理解 online/offline RL 的差异与适用场景
对前沿 RL 算法有研究与实践经验,如 flow-matching/diffusion/离散 Action Token 的强化学习等

工作职责

负责真机强化学习算法研发,面向在线/离线场景设计高样本效率、稳定可靠的 RL 训练方案,持续提升任务成功率、稳定性与鲁棒性

构建 VLA 模型的 RL 后训练体系,探索具身领域的数据配方与 scaling law,沉淀可复用的训练范式与评测结论
探索灵巧手/双臂等接触丰富(contact-rich)操作任务的策略学习方法,融合触觉、力觉与视觉信息,提升抓取、调整、重抓(regrasp)与精细操作能力
面向复杂与长时序任务,构建训练—评测—迭代闭环,解决真机 RL 中的 reward 设计、自动 reset、安全探索等关键问题
与数据/系统/硬件团队协作,推进模型训练、验证、部署与迭代落地
跟踪 RL 与具身智能前沿进展,撰写技术文档和学术论文

优先资格

有真机闭环训练部署测试经验者、分布式真机强化学习经验者优先

熟悉主流 VLA 路线(π 系列等),有 VLA 后训练/复现/改进经验者优先
有灵巧手/接触操作任务经验,熟悉触觉/力觉建模、in-hand manipulation 等方向者优先
熟练使用 PyTorch、 RLINF、VeRL 等框架者优先
顶会论文或同等研究/工程成果优先(NeurIPS/ICLR/CoRL/RSS/ICRA/IROS 等)

AI 洞察

优缺点分析

优点

  • 接触真实的机器人操作任务,积累宝贵的真机RL经验
  • 公司处于B轮融资阶段,创业氛围浓厚,个人影响力容易体现
  • 真机强化学习调试难度高,需要解决reward设计、安全探索等实际问题
  • 技术栈更新快,需要持续学习前沿算法和框架
  • 适合对强化学习和机器人领域有强烈兴趣,具备扎实算法基础和动手能力,愿意深入解决真实世界问题的工程师

缺点 / 挑战

  • 处于具身智能和机器人前沿赛道,技术挑战性强,发展空间大
  • 工作强度可能较高,涉及多团队协作和迭代闭环

角色解读

  • 在具身智能领域深耕,成为强化学习后训练方向的专家,主导核心技术突破
  • 向技术负责人发展,带领团队构建完整的RL训练与评测体系
  • 积累学术成果,发表顶会论文,成为行业内的知名研究者
  • 设计并实现面向真机操作的强化学习训练方案,包括reward设计、自动reset和安全探索等
  • 构建VLA模型的RL后训练体系,探索数据配方和scaling law,提升模型泛化能力
  • 研究灵巧手、双臂等接触丰富任务的策略学习,融合多模态感知信息
  • 扎实的深度学习和强化学习基础,熟悉PPO、SAC、TD3等主流算法
  • 对前沿RL算法有研究经验,如flow-matching、diffusion、离散Action Token
  • 熟悉PyTorch、RLINF、VeRL等框架,具备真机闭环训练部署经验者优先

申请策略

  • 在求职信中强调对具身智能的热情和具体技术贡献
  • 了解公司Genie业务部的技术方向和产品,展示对业务的理解
  • 突出强化学习相关项目经验,尤其是真机/仿真环境下的RL训练成果
  • 展示对VLA模型或灵巧手操作等前沿方向的实践经验
  • 列出顶会论文或同等研究成果,体现学术能力
  • 提前熟悉RLINF、VeRL等分布式RL框架,了解其用法和原理
  • 复习PPO、SAC等算法的数学推导,以及online/offline RL的差异

面试指南

  • 使用STAR法则(情境、任务、行动、结果)回答项目经验问题
  • 对于算法原理问题,先介绍核心概念,再结合个人理解举例说明
  • 请详细解释PPO算法的核心思想和实现细节
  • 如何设计一个稳定可靠的真机强化学习训练流程?
  • 分享一个你处理过的复杂RL项目,包括遇到的挑战和解决方案
  • VLA模型的后训练与标准RL有何不同?如何设计数据配方?
  • 复习强化学习经典论文和最新进展,特别是PPO、SAC、diffusion等
  • 准备一个完整的真机RL项目案例,从问题定义到最终部署的流程

职位点评

71
综合评分

前沿AI机器人领域,技术导向强,薪资高但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和前沿探索,对薪资和股权有期待,能接受较高工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值70

薪资福利

75中等

薪资处于行业高位,B轮融资公司提供股权激励潜力,但未明确提及福利细节。

薪资信号未披露(AI估算:35K-70K/月)

成长发展

90较高

技术栈前沿,涵盖RL、VLA、灵巧手等多方向,成长空间大,鼓励学术产出。

技术前沿前沿/新兴技术
技术栈强化学习、PPO、SAC、TD3、VLA、触觉感知、PyTorch、RLINF、VeRL
成长机会撰写技术文档和学术论文
业务类型ambiguous

工作生活

40较低

仅现场办公,未提及弹性工作或WLB,工作强度可能较高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

具身智能是高速增长赛道,技术对社会有潜在积极影响,但偏技术研发,直接社会意义有限。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs