JD logo
京东
大模型算法工程师(AI Infra方向)

大模型算法工程师(AI Infra方向)

发布于 大约 17 小时前

普通员工/个人贡献者

广东省
高级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Megatron
Vllm
分布式训练
后训练
大语言模型
强化学习
数据质量管理
预训练
高性能计算

AI 估算 · 30k–60k

京东大厂,大模型方向技术壁垒高,市场稀缺,薪资竞争力强,通常16薪。

职位详情

关于这个职位

这是一个在京东探索研究院的大模型算法工程师(AI Infra方向)职位,主要负责优化万卡集群的训练与推理架构,设计大语言模型和视觉模型的全流程训练方案,构建高质量数据生产与评估体系,以及研究强化学习在模型对齐中的应用

职位要求深厚的技术积累和创新能力,适合有志于大模型前沿技术落地的高端人才

最低要求

任职要求:

具备大模型全流程训练经验,涵盖预训练、中训练与后训练的技术落地,熟悉高质量数据构建与迭代流程
拥有高性能计算架构优化能力,能够基于Megatron、vLLM等框架优化万卡集群的训练与推理性能,解决分布式环境下的性能瓶颈
具备技术问题定位与改进能力,能够从训练故障或性能衰减中识别底层架构缺陷与数据质量问题,并提出可验证的优化方案
拥有算法与架构创新意识,能够探索新型数据配比策略、自动化质检及强化学习对齐方法,推动模型能力持续突破
具备开阔的技术视野与决策魄力,敢于在复杂技术路径中做出果断决策,同时尊重并吸纳不同技术观点以达成最优解
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信

工作职责

优化万卡集群训练与推理架构,基于高性能计算框架提升大规模分布式环境下的性能

设计并执行大语言与视觉模型的全流程训练方案,覆盖预训练至后训练技术落地
构建高质量训练数据的生产与评估体系,制定数据筛选、配比优化及自动化质检标准
研究强化学习在模型推理与对齐中的应用,设计奖励模型与算法以提升指令遵循与安全性
总结技术实践并输出开源项目与技术报告,推动团队专业影响力提升

AI 洞察

优缺点分析

优点

  • 京东集团平台资源丰富,探索研究院专注前沿,技术影响力大
  • 大模型是当前AI最热门赛道,技术积累价值高,职业前景广阔
  • 有机会参与从训练到推理的全流程,接触万卡集群等高端基础设施
  • 薪资待遇具有竞争力,通常包含丰厚年终和股票激励
  • 技术门槛极高,需要精通高性能计算和分布式系统,学习曲线陡峭
  • 工作强度可能较大,需应对大规模集群训练中的各种突发问题
  • 竞争激烈,需要不断跟进前沿论文和开源项目,保持技术领先
  • 这个职位适合具有扎实分布式系统和大模型训练经验,热衷于技术攻坚,希望在AI Infra领域成为专家的技术型人才

缺点 / 挑战

暂无明显挑战项

角色解读

  • 技术专家:在AI Infra或大模型训练领域深耕,成为顶尖架构师
  • 团队负责人:带领团队攻克分布式训练和数据工程难题
  • 跨领域发展:向AI芯片、云计算等底层基础设施方向拓展
  • 优化万卡级集群的训练与推理架构,使用Megatron、vLLM等框架解决分布式性能瓶颈
  • 设计并执行大语言模型和视觉模型的全流程训练,包括预训练、中训练和后训练
  • 构建和评估高质量训练数据体系,制定数据筛选、配比和自动化质检标准
  • 研究强化学习在模型对齐中的应用,设计奖励模型提升指令遵循与安全性
  • 精通Megatron、vLLM等高性能计算框架,具备大规模分布式训练优化经验
  • 深入理解大模型全流程训练(预训练/后训练)及数据处理方法
  • 掌握强化学习(RLHF/RL)在模型对齐中的实践
  • 具备问题定位与架构创新意识,能从故障或性能衰减中识别系统缺陷

申请策略

  • 研究京东探索研究院的公开技术博客和开源项目,面试时展示对其技术方向的理解
  • 准备一个从训练到部署的完整案例,说明遇到的问题和解决方案
  • 突出大模型全流程训练经历,包括具体集群规模、框架优化和数据工程成果
  • 量化展示性能优化成果,如训练吞吐提升、成本降低等数据
  • 强调开源项目贡献和技术报告,体现技术影响力
  • 如有强化学习或RLHF实践经验,务必详细描述
  • 系统学习Megatron-LM或DeepSpeed源码,深入理解分布式通信和显存优化
  • 补充数据工程知识,包括数据筛选、去重和配比策略

面试指南

  • 使用STAR法则:Situation(场景)、Task(任务)、Action(行动)、Result(结果),结合具体技术细节
  • 从现象到根因:先描述问题现象,然后分析可能的底层原因,最后给出验证方案
  • 对比方案:比较不同方案的优劣,展示技术决策的思考过程
  • 如何优化大模型在万卡集群上的训练效率?请举例说明你解决过的具体瓶颈
  • 请描述数据质量对大模型训练的影响,以及你如何设计数据筛选流程?
  • 解释Megatron中的张量并行和流水线并行原理,如何选择配置?
  • RLHF在模型对齐中有哪些挑战?请谈谈你的实践经验
  • 如果一个训练任务出现loss异常振荡,你会如何排查和定位问题?

职位点评

68
综合评分

京东大模型核心岗,前沿技术栈,薪资竞争力强,但工作强度大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿创新的发展型人才,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值60

薪资福利

70中等

京东作为上市大厂,薪资福利具有竞争力,但JD未明确列出具体福利,补偿性动机中等偏上。

薪资信号偏高 (30K-60K/月)

成长发展

90较高

该职位处于大模型前沿技术领域,涉及高性能计算、分布式系统和强化学习,技能成长空间极大,且鼓励开源贡献,发展性动机高度满足。

技术前沿前沿/新兴技术
技术栈Megatron、vLLM、分布式训练、大语言模型、强化学习
业务类型ambiguous

工作生活

40较低

仅现场办公,未提及弹性工作或远程,工作强度可能较高,生活化动机满足度较低。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

京东探索研究院有一定社会影响力,但职位偏技术实现,使命感驱动一般,行业前景好但意义感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
Watch Jobs