AgiBot logo
智元机器人
具身智能算法实习生(后训练 Infra 方向)

具身智能算法实习生(后训练 Infra 方向)

发布于 大约 14 小时前

实习/见习

上海市
初级经验
实习生
仅现场办公
本科
研究与开发 (研发)
Grpc
Ppo
Pytorch
Rpc
Sac
Zmq
分布式系统
强化学习

AI 估算 · 4k–8k

具身智能方向热门,实习薪资有竞争力,但实习岗位通常薪资不高,参考上海实习市场水平。

职位详情

关于这个职位

该岗位是具身智能算法实习生,专注于后训练基础设施方向,你将参与强化学习训练框架的设计与迭代,构建支持真机学习的规模化训练系统

工作涉及分布式系统开发、算法适配验证,以及前沿技术的工程化落地,适合对机器人AI和系统架构有浓厚兴趣的在校生

最低要求

计算机、AI、机器人等相关专业硕士在读或优秀本科生

熟悉 Python,熟练使用 PyTorch,有深度学习项目经验
对强化学习(PPO/SAC/DAgger 等)有基础理解或强烈兴趣
具备良好的工程意识与代码规范,愿意深入理解底层原理
实习 3 个月以上优先,能长期实习更佳

工作职责

参与具身智能后训练框架的设计与迭代,构建支撑真机强化学习的规模化训练能力

理解强化学习、模仿学习等后训练算法(PPO/SAC/DAgger 等),参与基于算法特性的训练架构设计与实现
参与云端多机多卡训练 + 边缘多机多本体 rollout 的分布式异步训练系统开发
参与多种后训练算法的框架侧适配与验证
参与云边通信模块开发(权重同步、数据回传、时延隐藏)
跟进后训练领域前沿进展,参与新算法的复现与工程化验证

优先资格

有分布式系统或通信框架(RPC / gRPC / ZMQ 等)使用经验

有真机强化学习或仿真器(RoboSuite / ManiSkill / Isaac 等)使用经验
有论文复现或相关研究经验

AI 洞察

优缺点分析

优点

  • 接触前沿的具身智能和强化学习技术,参与真实机器人训练系统开发,技术含量高
  • 公司为 B 轮中大型企业,资金充足,团队氛围技术导向,能获得快速成长
  • 实习内容涵盖算法与系统,有助于培养全面的工程能力和算法理解
  • 需要同时掌握算法和分布式系统知识,学习曲线较陡峭
  • 实习期可能需要适应高强度研发节奏,对自我驱动力要求高
  • 作为实习生,可能面临较长的产出周期,需要耐心和主动沟通
  • 适合对机器人 AI 和系统架构有强烈兴趣,具备一定深度学习基础,愿意在强化学习领域深耕的硕士或优秀本科生

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从实习转正后,可向具身智能算法研究员方向发展,专注于算法创新与系统优化
  • 也可转向机器人系统工程师,负责训练系统架构设计与部署
  • 积累的强化学习和分布式系统经验可迁移至其他 AI 领域(如自动驾驶、游戏 AI)
  • 设计和迭代具身智能后训练框架,构建支持真机强化学习的规模化训练系统
  • 参与分布式异步训练系统的开发,涉及云端多机多卡训练与边缘端多本体 rollout
  • 适配和验证多种后训练算法(如 PPO、SAC、DAgger),并参与新算法的复现与工程化
  • 开发云边通信模块,处理权重同步、数据回传和时延隐藏等关键问题
  • 扎实的 Python 编程能力和 PyTorch 深度学习框架经验
  • 对强化学习算法(PPO、SAC、DAgger 等)有基础理解或强烈学习意愿
  • 良好的工程意识和代码规范,愿意深入底层原理
  • 加分项:分布式系统或通信框架(RPC/gRPC/ZMQ)经验,以及仿真器(RoboSuite/Isaac)使用经验

申请策略

  • 在求职信中表达对具身智能和强化学习的热情,并说明愿意长期实习(3个月以上)
  • 准备一个展示自己代码能力和算法理解的 Mini 项目(如实现一个简单的 PPO 训练流程)
  • 突出强化学习或机器人相关项目经验,特别是使用 PyTorch 的实践
  • 体现分布式系统或通信框架的使用经验,如多机训练、RPC 调用等
  • 展示代码规范意识,例如 GitHub 仓库、开源贡献或高质量代码示例
  • 如果有论文复现或仿真器使用经验,务必提及
  • 复习强化学习算法原理(PPO、SAC、DAgger),并通过代码实现加深理解
  • 学习分布式训练相关知识,如 PyTorch Distributed、RPC 通信、异步训练架构

面试指南

  • 对于算法问题:先给出定义和直觉,然后逐步展开细节(如损失函数、更新方式),最后结合实际经验说明
  • 对于系统设计问题:从需求出发,划分模块(训练、rollout、通信、存储),讨论权衡(同步/异步、中心化/去中心化)
  • 对于经验问题:使用 STAR 方法(情境、任务、行动、结果)结构化回答,强调你的贡献和学到的教训
  • 请解释 PPO 算法的核心思想和关键超参数的影响
  • 如何设计一个分布式强化学习训练系统?需要考虑哪些通信和同步问题?
  • 描述一次你使用 PyTorch 进行深度学习项目的经历,遇到的最大挑战是什么?
  • 了解哪些分布式通信框架?gRPC 和 ZMQ 有什么区别?
  • 如果要在真机上部署强化学习策略,你会考虑哪些关键因素?

职位点评

65
综合评分

前沿具身智能实习,技术成长空间大,但需要现场办公且强度可能较高。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合追求技术成长和前沿领域探索的求职者,尤其是那些愿意投入时间学习强化学习和分布式系统的学生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活40
使命价值75

薪资福利

60中等

实习薪资处于市场中等水平,但作为 B 轮公司,福利可能较好,不过 JD 未明确提及具体福利,补偿性动机满足一般。

薪资信号未披露(AI估算:4K-8K/月)

成长发展

90较高

岗位涉及前沿的具身智能和强化学习技术,且有分布式系统开发内容,技术成长空间大,发展性动机得到很好满足。

技术前沿前沿/新兴技术
技术栈强化学习、PPO、SAC、DAgger、分布式系统、RPC、gRPC、ZMQ、仿真器
业务类型ambiguous

工作生活

40较低

职位要求仅现场办公,且未提及弹性工作或 WLB,作为实习可能有一定强度,生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

具身智能是 AI 领域的重要方向,有潜力推动机器人技术发展,具有一定社会价值,意义感动机较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs