JD logo
京东
算法工程师

算法工程师

发布于 大约 4 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Agent Rl
Cv
Dpo
Grpo
Llama Factory
Machine Learning
Nlp
Ppo
Qwen

AI 估算 · 25k–45k

大模型方向薪资较高,京东平台有竞争力,技术难度大,预估中上水平

职位详情

关于这个职位

这个职位是京东科技的大模型算法工程师,主要负责利用后训练技术(如SFT、RLVR、Agent RL)优化对话效果,并设计搭建Agent架构

你将深入跟进LLM前沿研究,结合业务场景寻找最佳解决方案
适合对NLP、大模型训练和强化学习有深入理解的技术人才

最低要求

硕士及以上学历,计算机相关专业

具有优秀的编程基础,熟练使用Python/C++等至少一种编程语言
熟悉NLP、CV、ML等相关的技术,深入理解大模型相关技术栈(如Reward Model、GRPO/PPO/DPO、SFT/RFT等)
熟练掌握Llama Factory、Verl等常见开源模型调优训练框架,熟悉LLM等常见推理加速框架,熟悉Qwen、DeepSeek等开源大模型原理与实现
优秀的分析和解决问题的能力,对解决具有挑战性的问题充满激情,良好的沟通和团队合作能力

工作职责

深入理解业务需求,利用SFT、RLVR、Agent RL等多种后训练技术,优化对话效果,提升业务效果天花板

结合对大模型系统框架及模型能力边界的理解,设计并搭建Agent架构,包括React、Plan-Act、Generate-Verifier、Multi-Agent等,探索Agent Test-Time-Scaling技术
密切跟进LLM领域最新研究成果,积极参与新业务的探索研究,结合对业务场景的充分理解,寻找最佳解决方案

AI 洞察

优缺点分析

优点

  • 前沿技术栈:直接接触大模型后训练、Agent等最热门AI方向,技术积累价值高
  • 大平台机会:京东科技服务众多大型客户,业务场景丰富,项目影响力大
  • 团队实力:与优秀同事共事,可快速提升自身技术水平
  • 薪资竞争力:大模型人才稀缺,京东提供有吸引力的薪酬福利
  • 技术迭代快:LLM领域日新月异,需要持续学习,保持知识更新
  • 适合热爱技术、具备NLP/ML背景、渴望在大模型前沿领域深耕的求职者
  • 也适合有强化学习经验、喜欢解决复杂算法问题的人

缺点 / 挑战

  • 工作强度:作为核心研发岗位,项目关键期可能需要加班应对挑战
  • 竞争压力:大模型方向人才聚集,需不断提升自身才能脱颖而出

角色解读

  • 技术深度发展:成为大模型算法专家,主导核心模型的研发与优化
  • 技术广度拓展:向Agent系统架构、多模态等方向延伸,成为全栈AI人才
  • 管理路径:带领团队攻克技术难题,逐步转型为技术Leader
  • 使用SFT、RLVR、Agent RL等技术优化大模型对话效果,提升业务指标
  • 设计并实现Agent架构,包括React、Multi-Agent等,探索Test-Time Scaling方法
  • 跟踪LLM前沿研究,将新技术应用于实际业务场景
  • 扎实的编程能力,精通Python/C++,能够快速实现算法原型
  • 深入理解大模型训练技术栈,如Reward Model、GRPO/PPO/DPO、SFT等
  • 熟练掌握Llama Factory、Verl等训练框架,熟悉推理加速和开源模型原理
  • 优秀的分析和解决问题能力,对挑战性问题充满热情

申请策略

  • 提前了解京东科技的业务方向(供应链金融、企业服务等),思考技术如何落地
  • 在面试中准备一个完整的大模型优化案例,展示从问题定位到方案实施的全过程
  • 突出大模型相关项目经验,如使用SFT/RLHF优化对话模型的成果
  • 强调对开源模型(Qwen、DeepSeek等)的深入理解或修改经验
  • 展示熟练使用的训练框架(如Llama Factory、Verl)和推理加速工具
  • 列举顶会论文发表或开源贡献,体现技术深度
  • 补充Agent相关技术,如React、Multi-Agent协调、工具调用等
  • 深入学习强化学习理论,特别是GRPO、PPO等算法细节

面试指南

  • 对于技术对比类问题,先阐述基本概念,再对比异同,最后结合具体业务场景说明选择理由
  • 对于设计类问题,先明确目标,再提出可行方案,并考虑不同方案的 trade-off
  • 对于开放性问题,先梳理思路,再分步骤回答,展示逻辑性和系统性
  • 请解释SFT和RLHF的区别,以及它们分别适用于什么场景?
  • 设计一个Agent系统来解决复杂任务,你会如何选择架构?
  • 如何评估大模型在对话任务中的表现?有哪些关键指标?
  • GRPO和PPO在训练大模型时有什么优缺点?
  • 当你需要提升模型在特定领域的效果时,你会采用哪些技术?

职位点评

75
综合评分

前沿大模型算法岗,技术成长快,薪资优厚,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长、渴望在大模型前沿深耕的求职者,对WLB要求不高则更佳。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值70

薪资福利

80较高

职位薪资未明确披露,但结合大模型人才稀缺性和京东平台,预估薪资具有竞争力,福利体系完善。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

技术栈处于AI前沿,深度参与大模型后训练和Agent构建,成长空间巨大,但JD未明确提及晋升通道。

技术前沿前沿/新兴技术
技术栈大模型、SFT、RLVR、Agent RL、Llama Factory、Verl、GRPO、PPO、DPO、Qwen、DeepSeek
业务类型ambiguous

工作生活

50较低

仅现场办公,工作地点在科技园/产业园,JD未提及弹性工作或WLB相关信息,可能面临较高工作强度。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

京东科技以产业数智化为使命,服务大量企业,具有社会价值;但仍属于技术实现层面,直接社会影响力有限。

行业发展高速增长赛道
社会影响中性/一般
使命信号以科技引领产业数智化升级,推动世界更加高效和美好
创新程度积极采用新技术
Watch Jobs