JD logo
京东
算法开发岗

算法开发岗

发布于 大约 15 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Vla模型
具身智能
强化学习
机器人控制
模仿学习
离线Rl
在线Rl
多任务Rl

AI 估算 · 30k–60k

京东核心研究院算法岗,要求前沿强化学习与机器人技能,薪资具备大厂竞争力,估算30k-60k/月。

职位详情

关于这个职位

该职位专注于机器人控制的强化学习算法研发,涉及离线/在线RL、多任务RL及仿真迁移

你将构建端到端训练系统,探索RL与模仿学习、VLA模型的融合,推动智能体在真实任务中的决策与泛化
适合有强化学习背景、热爱具身智能领域的研究型人才

最低要求

具备强化学习算法研发能力,熟悉离线RL、在线RL及多任务RL,能设计并实现面向机器人控制的策略生成

拥有机器人仿真与策略迁移经验,能基于Isaac Gym、MuJoCo等平台构建仿真环境,并推动策略从仿真到真机的高效迁移
具备技术融合创新能力,能探索强化学习与模仿学习、VLA模型及人类反馈的结合机制,提升智能体在复杂场景的泛化与决策能力
具备技术本质洞察力,能从复杂机器人控制问题中识别核心挑战,精准定位算法设计与奖励建模的关键瓶颈
致力于在具身智能领域实现技术突破,长期投入于推动强化学习在真实机器人任务中的价值创造
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信

工作职责

研究适用于机器人控制的强化学习算法体系,覆盖离线RL、在线RL及多任务RL,支撑复杂操作策略生成

构建端到端的强化学习训练系统,整合仿真与真机环境,实现策略高效优化与迁移
探索强化学习与模仿学习、VLA模型及人类反馈的融合机制,提升智能体在真实任务中的泛化与决策能力
设计面向灵巧操作与移动操作的奖励机制与探索策略,优化算法在复杂场景中的表现
跟踪国际前沿技术进展,形成可复现、可扩展的算法实践与知识积累

AI 洞察

优缺点分析

优点

  • 京东探索研究院资源丰富,平台大,数据与算力支持充足
  • 聚焦具身智能前沿方向,技术成长空间大,可与国际顶尖团队交流
  • 算法岗薪资有竞争力,福利待遇完善(五险一金、年终奖等)
  • 研发氛围浓厚,鼓励创新和长期投入
  • 强化学习+机器人控制难度高,从仿真到真机迁移存在不确定性
  • 工作涉及跨领域融合,对综合能力要求高,可能加班赶项目
  • 适合有强化学习背景、对机器人控制有浓厚兴趣、愿意长期投入具身智能领域的研究型或工程型人才

缺点 / 挑战

  • 需要持续跟踪国际前沿,技术更新快,学习压力大

角色解读

  • 技术方向:深耕强化学习与机器人控制,成为具身智能领域专家
  • 项目方向:主导复杂机器人操作任务落地,从算法研究到产品化
  • 管理方向:带领算法团队,规划技术路线,推动前沿探索
  • 研究并设计适用于机器人控制的强化学习算法,包括离线RL、在线RL及多任务RL
  • 构建端到端的训练系统,整合仿真与真机环境,实现策略从仿真到真机的迁移
  • 探索强化学习与模仿学习、VLA模型及人类反馈的融合,提升智能体泛化能力
  • 设计奖励机制与探索策略,优化算法在复杂操作场景中的表现
  • 扎实的强化学习理论基础,熟悉主流RL算法(如PPO、SAC、DQN等)
  • 具备机器人仿真经验,熟练使用Isaac Gym、MuJoCo等平台
  • 编程能力强,Python/C++,至少一种深度学习框架(PyTorch/TensorFlow)
  • 对具身智能领域有热情,具备技术融合与创新思维

申请策略

  • 京东价值观强调客户为先、创新、担当,准备面试时可以结合团队项目体现这些特质
  • 关注京东探索研究院的公开技术博客或论文,了解团队研究方向,展现兴趣与匹配度
  • 重点突出强化学习项目经历,尤其是机器人相关成果,如仿真训练、策略迁移
  • 展示发表的论文或开源贡献,特别是RL或机器人领域的顶级会议/期刊
  • 体现编程能力和仿真平台使用经验(Isaac Gym、MuJoCo等)
  • 强调团队合作与创新能力,可举例说明如何解决复杂问题
  • 补充或深化强化学习算法原理,特别是离线RL、多任务RL等
  • 熟悉主流机器人仿真平台,搭建过仿真环境或迁移实验会加分

面试指南

  • 项目介绍:使用STAR法则(情境、任务、行动、结果),突出算法设计、仿真环境搭建和实验效果
  • 技术问题:先给出定义或基本原理,再结合具体场景分析,最后总结优缺点或经验
  • 开放性问题:展示学习热情和思考深度,可提出自己的见解或未来探索方向
  • 请介绍一个你使用强化学习解决机器人控制问题的项目
  • 离线RL和在线RL的区别是什么?在机器人应用中各有什么优缺点?
  • 如何设计奖励函数来解决稀疏奖励问题?请举例说明
  • 如何将仿真中训练的策略高效迁移到真机?有哪些挑战?
  • 你对VLA模型了解多少?请谈谈它们与RL结合的可能方向

职位点评

81
综合评分

京东探索研究院算法岗,前沿技术栈、高成长、大厂平台,但WLB一般且位于亦庄。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最看重技术成长和前沿探索的求职者,尤其是希望深入强化学习与机器人领域的研发人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活60
使命价值75

薪资福利

85较高

京东作为上市大厂,薪资福利有竞争力,但JD未提及具体薪资和福利细节,因此评分略减。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

95较高

该职位聚焦强化学习与机器人前沿技术,团队环境鼓励创新,成长空间极大。

技术前沿前沿/新兴技术
技术栈强化学习、离线RL、在线RL、多任务RL、Isaac Gym、MuJoCo、模仿学习、VLA模型、具身智能
成长机会跟踪国际前沿技术进展
业务类型ambiguous

工作生活

60中等

北京现场办公,地点在京东总部(亦庄),通勤可能较长;未提及WLB,互联网大厂加班文化普遍。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

75中等

具身智能赛道高速增长,京东平台有助于技术落地,但JD未明确社会价值导向。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs