JD logo
京东
具身智能算法工程师

具身智能算法工程师

发布于 大约 9 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Offline Rl
Ppo
Pytorch
Rlhf
Sac
仿真到现实迁移
强化学习
机器人学

AI 估算 · 25k–45k

北京资深算法工程师,京东研究院前沿岗位,薪酬处于市场中上水平;强化学习技能稀缺,提升薪资预期。

职位详情

关于这个职位

该职位是京东探索研究院的具身智能算法工程师,专注于将强化学习应用于机器人控制和具身决策

你将研究PPO、SAC等算法,探索RL与模仿学习、VLA模型的结合,并在仿真和真实环境中落地灵巧操作等任务
适合有强化学习背景、热爱机器人领域的研发人才

最低要求

计算机、人工智能、机器人、自动化、控制等相关专业背景

熟悉强化学习基本算法,如 PPO、SAC、TD3、DQN、Offline RL、RLHF/RLAIF 等
具备 Python/PyTorch 编程能力,有良好的实验设计和工程实现能力
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信

工作职责

研究面向机器人控制与具身决策的强化学习算法,包括离线 RL、在线 RL、多任务 RL 等

探索强化学习与模仿学习、VLA 模型、世界模型、奖励模型和人类反馈的结合方式
构建高效的 RL 训练系统,支持仿真环境、真机环境和混合数据环境中的策略优化
研究复杂操作任务中的奖励设计、探索策略和泛化能力提升
推动强化学习算法在灵巧操作、移动操作等真实任务中的验证和落地
跟踪国际前沿进展,形成可复现、可扩展、可规模化的 RL 技术栈

优先资格

熟悉机器人控制、仿真训练、策略学习或大模型后训练者优先

有 Isaac Gym、MuJoCo、Genesis、ManiSkill、RoboSuite、Gymnasium 等仿真平台经验者优先
在强化学习、机器人学习、控制等方向发表高水平论文或有落地经验者优先

AI 洞察

优缺点分析

优点

  • 京东研究院平台资源丰富,团队有IEEE Fellow,学术氛围浓厚
  • 聚焦具身智能和强化学习前沿方向,技术成长空间大
  • 算法落地场景明确(灵巧操作、移动操作),能积累实际工程经验
  • 与多所顶尖高校合作,可参与产学研项目
  • 强化学习训练对计算资源要求高,可能需要处理复杂的环境搭建和调参
  • 仿真到真机迁移存在不确定性,算法落地周期较长
  • 岗位对综合能力要求高,需同时掌握算法、工程和机器人知识

缺点 / 挑战

  • 适合对强化学习和机器人控制有浓厚热情、愿意接受技术挑战、追求前沿算法落地的研发工程师

角色解读

  • 技术深耕:成为强化学习/具身智能领域专家,主导核心算法研发
  • 技术管理:晋升为团队技术负责人或研究主管,带领团队攻克难题
  • 产学研结合:依托京东研究院的学术资源,发表高水平论文并推动产业应用
  • 研究并实现强化学习算法(如PPO、SAC)用于机器人控制与决策
  • 探索RL与模仿学习、VLA模型、世界模型的结合,提升机器人智能
  • 构建高效训练系统,支持仿真和真机环境,推动算法在灵巧操作等任务落地
  • 跟踪国际前沿,形成可复用、可扩展的RL技术栈
  • 扎实的强化学习理论基础,熟悉主流算法(PPO、SAC、Offline RL等)
  • 熟练使用Python和PyTorch,具备工程实现和实验设计能力
  • 了解机器人仿真平台(如Isaac Gym、MuJoCo)优先
  • 有机器人控制、策略学习或大模型后训练经验者更佳

申请策略

  • 关注京东探索研究院的研究方向,在求职信中体现对具身智能的理解
  • 准备一个端到端的RL项目案例,从环境搭建到算法实现,展示完整能力
  • 突出强化学习相关项目经验,包括算法实现、实验结果和性能提升
  • 强调机器人或仿真平台使用经历,如Isaac Gym、MuJoCo等
  • 展示论文发表或竞赛获奖成果,体现学术能力
  • 体现PyTorch编程能力和工程化思维,如训练系统搭建、数据流水线优化
  • 补充机器人学基础知识,如运动学、控制理论
  • 熟悉主流RL算法代码库,如Stable-Baselines3、rlkit等

面试指南

  • 对于算法原理问题:先给出核心思想,然后分步推导关键公式,最后结合实际经验说明注意事项
  • 对于项目经验问题:用STAR法则描述项目背景、任务、行动和结果,突出遇到的挑战和解决方案
  • 对于开放性问题:先阐述自己的观点,再结合所学知识和业界趋势,最后总结自己的看法
  • 请详细解释PPO算法的原理和实现细节
  • 你在RL项目中如何设计奖励函数?遇到过哪些困难?
  • 如何解决仿真到现实迁移中的Sim2Real gap?
  • 请描述一个你使用PyTorch实现的RL训练系统架构
  • 你如何看待RL在具身智能中的未来发展方向?

职位点评

70
综合评分

京东研究院前沿算法岗,技术成长空间大,但工作强度较高且未明确WLB。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿研究,对工作生活平衡要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值75

薪资福利

70中等

京东作为上市巨头,薪资福利有竞争力,但JD未明确薪酬范围,且作为研发岗位存在加班可能,补偿性动机满足程度中等。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

岗位聚焦强化学列和具身智能前沿技术,研究院学术资源丰富,成长空间大,发展性动机满足程度高。

技术前沿前沿/新兴技术
技术栈强化学习、PPO、SAC、Offline RL、RLHF、VLA、世界模型、仿真到现实迁移
成长机会前沿科技探索、国际前沿、高水平论文
业务类型ambiguous

工作生活

40较低

京东通常要求现场办公,且JD未提及弹性工作或WLB,推测工作强度较大,生活化动机满足程度较低。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

75中等

具身智能是AI应用的重要方向,京东研究院有产业落地场景,但JD未强调社会使命感,意义感动机中等偏上。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs