
京东
多模态算法工程师
多模态算法工程师
发布于 大约 9 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Deepspeed
Dpo
Llava
Megatron
Ppo
Pytorch
Qwen
Rag
Rlhf
AI 估算 · 28k–48k
京东大厂,多模态算法前沿方向,硕士3年经验,北京薪资水平较高,综合市场行情估算。
职位详情
关于这个职位
作为京东科技的多模态算法工程师,你将专注于多模态大模型(VLM)的后训练与强化学习优化,构建企业级RAG系统和智能Agent
岗位涉及前沿的RLHF/DPO技术,需要扎实的算法与工程能力,适合希望在AI大模型领域深耕的技术人才
最低要求
学历与经验背景: 计算机、人工智能、数学等相关专业,硕士及以上学历
具备 3 年左右 AI 算法工作经验,且至少包含 2 年以上的大语言模型(LLM)或多模态大模型(VLM)的一线训练与调优经验
强化学习(RL)核心背景: 拥有扎实的强化学习理论基础,有丰富的 RLHF、DPO、PPO 或其他 LLM 强化对齐算法的实际落地经验
技术栈与框架底座: 熟练掌握 Python 与 PyTorch
深入理解前沿的大模型基座(如 Qwen, Llama3, DeepSeek 等)及多模态架构(如 LLaVA, Qwen-VL 等)
熟悉 DeepSpeed、Megatron 等分布式训练框架,对显存优化(如 ZeRO 系列)有实际操作经验
工程能力与落地导向: 代码基本功扎实,具备优秀的工程实现能力
能够熟练使用 Docker 容器化技术进行算法环境的构建与跨平台部署
优先条件(大流量/高并发): 有亿级用户量产品的大模型落地经验者优先
有具身智能(Embodied AI)、自动驾驶大模型、或复杂系统开源框架贡献经验者优先
工作职责
多模态大模型(VLM)后训练与强化学习攻坚: 主导多模态大模型的 SFT 与对齐工作
重点负责构建和优化 RLHF/DPO/PPO 等强化学习训练链路,深入攻克 Reward Model 训练、强化学习训练不稳定性等难题,极致优化模型在复杂图文理解、逻辑推理及指令遵循上的表现
企业级 RAG 系统架构与优化: 负责构建工业级的大规模检索增强生成(RAG)系统
针对高并发、复杂业务场景,优化多模态文档解析、百亿级向量检索、Rerank 排序模型微调,以及 Long Context 模型的显存与注意力机制优化
Agent 智能体及具身/复杂任务规划: 设计并主导开发基于大模型的复杂 Agent 架构(如多智能体协作、记忆机制管理)
提升模型在使用复杂工具(Tool Use)、长逻辑链规划(Planning)及任务分解方面的自洽能力,并推动其在实际业务或智能系统中的规模化落地
高质量数据流与自动化评测体系构建: 从零到一设计 SFT/RL 训练数据的自动化构建、挖掘与清洗 Pipeline
建立贴合业务真实场景的自动化评测集(Benchmark)与 Bad Case 归因体系,驱动模型快速迭代
优先资格
有亿级用户量产品的大模型落地经验者优先
有具身智能(Embodied AI)、自动驾驶大模型、或复杂系统开源框架贡献经验者优先
AI 洞察
优缺点分析
优点
- 技术前沿:接触多模态大模型、强化学习、RAG等最新AI技术
- 平台优势:京东拥有海量业务场景和数据,算法落地机会丰富
- 团队氛围:与一流算法工程师共事,成长空间大
- 工作强度:大厂研发节奏快,项目周期紧,可能需要加班
- 适合对多模态大模型和强化学习有浓厚兴趣,具备扎实算法功底和工程能力,能接受高强度工作的技术人才
缺点 / 挑战
- 技术难度:强化学习训练不稳定,Reward Model构建具有挑战性
- 竞争压力:内部人才密度高,需要持续学习和产出
角色解读
- 技术纵深:从多模态算法工程师成长为领域专家,主导核心模型研发
- 管理路径:可晋升为技术Leader,带领团队攻克复杂AI问题
- 跨领域扩展:积累RAG、Agent、具身智能等多方向经验,成为AI全栈人才
- 主导多模态大模型的后训练与强化学习优化,包括SFT、RLHF/DPO/PPO等对齐算法
- 构建企业级RAG系统,优化多模态文档解析、百亿级向量检索及排序模型
- 设计基于大模型的Agent架构,提升工具使用和任务规划能力
- 开发自动化数据流水线和评测体系,驱动模型快速迭代
- 扎实的强化学习理论基础,有RLHF/DPO/PPO实际落地经验
- 熟练掌握Python和PyTorch,熟悉大模型基座(Qwen、Llama等)和多模态架构
- 具备分布式训练框架(DeepSpeed、Megatron)使用经验,熟悉显存优化
- 优秀的工程能力,包括Docker容器化部署和代码质量意识
申请策略
- 提前了解京东科技的业务方向(如供应链、零售),思考大模型如何赋能
- 准备一个端到端的项目展示,从数据构建、训练到部署
- 突出大模型(LLM/VLM)训练和调优的实际项目经验,量化效果指标
- 强调RLHF/DPO/PPO等强化学习算法的落地案例,说明具体贡献
- 展示分布式训练、显存优化等工程能力,最好有GitHub开源贡献记录
- 提及RAG或Agent相关项目,体现综合能力
- 补充强化学习理论基础,阅读相关论文并动手复现经典算法
- 熟悉DeepSpeed、Megatron等框架,尝试优化训练脚本
面试指南
- 结构化回答:先概述问题背景,再分点说明解决方案,最后总结效果和收获
- 结合JD中提到的技术栈:回答时多提及PyTorch、DeepSpeed、Qwen等工具
- 强调落地导向:提及实际业务效果,如提升推理准确率、降低延迟等
- 请详细说明你参与的大模型RLHF项目,如何设计Reward Model?
- 如何处理多模态大模型训练中显存不足的问题?
- 在RAG系统中,如何优化百亿级向量检索的召回率和延迟?
- 请设计一个Agent架构,使其能够完成复杂任务规划(比如旅游行程安排)
- 复习强化学习算法(PPO、DPO)的数学原理和实现细节
职位点评
74
综合评分
京东多模态算法工程师:前沿技术栈、高成长性,但工作强度和灵活性一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿挑战的求职者,对薪资和福利有较高期望但能接受较强的研发强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值60
薪资福利
80较高
京东作为上市大厂,薪资福利具有竞争力,但JD未明确薪资范围,需面议。通常技术岗位待遇优厚,且五险一金齐全。
薪资信号面议 (28K-48K/月)
成长发展
90较高
多模态大模型和RLHF属于前沿技术,岗位涉及大量高难度算法工程,成长空间极大。JD中虽未明确提及培训或晋升,但京东内部有技术晋升体系。
技术前沿前沿/新兴技术
技术栈RLHF、DPO、PPO、多模态大模型、RAG、Agent、DeepSpeed、Megatron
业务类型ambiguous
工作生活
50较低
工作地点在北京,仅现场办公,未提及弹性工作或远程。京东作为互联网大厂,可能有一定加班压力。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
60中等
京东科技业务服务于零售和供应链,具有一定社会价值,但岗位本身偏向技术研发,使命感一般。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
京东 的其他在招职位
相似职位推荐
Watch Jobs