
智元机器人
具身智能算法实习生(后训练 Infra 方向)
具身智能算法实习生(后训练 Infra 方向)
发布于 大约 14 小时前实习/见习
上海市
初级经验
实习生
仅现场办公
本科
研究与开发 (研发)
Grpc
Ppo
Pytorch
Rpc
Sac
Zmq
分布式系统
强化学习
AI 估算 · 4k–8k
具身智能方向热门,实习薪资有竞争力,但实习岗位通常薪资不高,参考上海实习市场水平。
职位详情
关于这个职位
该岗位是具身智能算法实习生,专注于后训练基础设施方向,你将参与强化学习训练框架的设计与迭代,构建支持真机学习的规模化训练系统
工作涉及分布式系统开发、算法适配验证,以及前沿技术的工程化落地,适合对机器人AI和系统架构有浓厚兴趣的在校生
最低要求
计算机、AI、机器人等相关专业硕士在读或优秀本科生
熟悉 Python,熟练使用 PyTorch,有深度学习项目经验
对强化学习(PPO/SAC/DAgger 等)有基础理解或强烈兴趣
具备良好的工程意识与代码规范,愿意深入理解底层原理
实习 3 个月以上优先,能长期实习更佳
工作职责
参与具身智能后训练框架的设计与迭代,构建支撑真机强化学习的规模化训练能力
理解强化学习、模仿学习等后训练算法(PPO/SAC/DAgger 等),参与基于算法特性的训练架构设计与实现
参与云端多机多卡训练 + 边缘多机多本体 rollout 的分布式异步训练系统开发
参与多种后训练算法的框架侧适配与验证
参与云边通信模块开发(权重同步、数据回传、时延隐藏)
跟进后训练领域前沿进展,参与新算法的复现与工程化验证
优先资格
有分布式系统或通信框架(RPC / gRPC / ZMQ 等)使用经验
有真机强化学习或仿真器(RoboSuite / ManiSkill / Isaac 等)使用经验
有论文复现或相关研究经验
AI 洞察
优缺点分析
优点
- 接触前沿的具身智能和强化学习技术,参与真实机器人训练系统开发,技术含量高
- 公司为 B 轮中大型企业,资金充足,团队氛围技术导向,能获得快速成长
- 实习内容涵盖算法与系统,有助于培养全面的工程能力和算法理解
- 需要同时掌握算法和分布式系统知识,学习曲线较陡峭
- 实习期可能需要适应高强度研发节奏,对自我驱动力要求高
- 作为实习生,可能面临较长的产出周期,需要耐心和主动沟通
- 适合对机器人 AI 和系统架构有强烈兴趣,具备一定深度学习基础,愿意在强化学习领域深耕的硕士或优秀本科生
缺点 / 挑战
暂无明显挑战项
角色解读
- 从实习转正后,可向具身智能算法研究员方向发展,专注于算法创新与系统优化
- 也可转向机器人系统工程师,负责训练系统架构设计与部署
- 积累的强化学习和分布式系统经验可迁移至其他 AI 领域(如自动驾驶、游戏 AI)
- 设计和迭代具身智能后训练框架,构建支持真机强化学习的规模化训练系统
- 参与分布式异步训练系统的开发,涉及云端多机多卡训练与边缘端多本体 rollout
- 适配和验证多种后训练算法(如 PPO、SAC、DAgger),并参与新算法的复现与工程化
- 开发云边通信模块,处理权重同步、数据回传和时延隐藏等关键问题
- 扎实的 Python 编程能力和 PyTorch 深度学习框架经验
- 对强化学习算法(PPO、SAC、DAgger 等)有基础理解或强烈学习意愿
- 良好的工程意识和代码规范,愿意深入底层原理
- 加分项:分布式系统或通信框架(RPC/gRPC/ZMQ)经验,以及仿真器(RoboSuite/Isaac)使用经验
申请策略
- 在求职信中表达对具身智能和强化学习的热情,并说明愿意长期实习(3个月以上)
- 准备一个展示自己代码能力和算法理解的 Mini 项目(如实现一个简单的 PPO 训练流程)
- 突出强化学习或机器人相关项目经验,特别是使用 PyTorch 的实践
- 体现分布式系统或通信框架的使用经验,如多机训练、RPC 调用等
- 展示代码规范意识,例如 GitHub 仓库、开源贡献或高质量代码示例
- 如果有论文复现或仿真器使用经验,务必提及
- 复习强化学习算法原理(PPO、SAC、DAgger),并通过代码实现加深理解
- 学习分布式训练相关知识,如 PyTorch Distributed、RPC 通信、异步训练架构
面试指南
- 对于算法问题:先给出定义和直觉,然后逐步展开细节(如损失函数、更新方式),最后结合实际经验说明
- 对于系统设计问题:从需求出发,划分模块(训练、rollout、通信、存储),讨论权衡(同步/异步、中心化/去中心化)
- 对于经验问题:使用 STAR 方法(情境、任务、行动、结果)结构化回答,强调你的贡献和学到的教训
- 请解释 PPO 算法的核心思想和关键超参数的影响
- 如何设计一个分布式强化学习训练系统?需要考虑哪些通信和同步问题?
- 描述一次你使用 PyTorch 进行深度学习项目的经历,遇到的最大挑战是什么?
- 了解哪些分布式通信框架?gRPC 和 ZMQ 有什么区别?
- 如果要在真机上部署强化学习策略,你会考虑哪些关键因素?
职位点评
65
综合评分
前沿具身智能实习,技术成长空间大,但需要现场办公且强度可能较高。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
该职位最适合追求技术成长和前沿领域探索的求职者,尤其是那些愿意投入时间学习强化学习和分布式系统的学生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活40
使命价值75
薪资福利
60中等
实习薪资处于市场中等水平,但作为 B 轮公司,福利可能较好,不过 JD 未明确提及具体福利,补偿性动机满足一般。
薪资信号未披露(AI估算:4K-8K/月)
成长发展
90较高
岗位涉及前沿的具身智能和强化学习技术,且有分布式系统开发内容,技术成长空间大,发展性动机得到很好满足。
技术前沿前沿/新兴技术
技术栈强化学习、PPO、SAC、DAgger、分布式系统、RPC、gRPC、ZMQ、仿真器
业务类型ambiguous
工作生活
40较低
职位要求仅现场办公,且未提及弹性工作或 WLB,作为实习可能有一定强度,生活化动机满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
具身智能是 AI 领域的重要方向,有潜力推动机器人技术发展,具有一定社会价值,意义感动机较强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs