DiDi logo
滴滴出行
大模型推理引擎研发资深工程师

大模型推理引擎研发资深工程师

发布于 大约 16 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Flashattention
Gpu
Npu
Pagedattention
Tensorrt-Llm
Vllm
分布式推理
量化

AI 估算 · 40k–70k

大模型推理方向热门,资深岗位稀缺,北京一线互联网薪资水平高,技术复杂度高。

职位详情

关于这个职位

这是滴滴出行基础产品事业部的大模型推理引擎研发岗位,核心是设计并优化千亿参数模型的分布式推理系统

你将参与高性能算子开发、模型量化与编译优化,攻克分布式推理中的技术难题,并引入vLLM、TensorRT-LLM等前沿框架
适合热衷底层性能优化、敢于挑战复杂系统问题的资深工程师

最低要求

计算机、数学、电子工程、通信等相关专业本科及以上学历

熟练掌握C++/Python,具备大型项目代码架构设计能力
熟悉Transformer架构及大模型推理相关技术(如FlashAttention、PagedAttention、Continuous Batching)
有实际大模型部署及调优经验,熟悉量化(INT8/FP8)等优化手段

工作职责

参与大模型推理引擎的架构设计与核心模块开发,支撑千亿参数模型的高效分布式推理

研发面向GPU/NPU等异构计算平台的高性能算子,提升硬件利用效率
参与模型低精度量化,图优化,编译优化等性能优化工作
攻克分布式推理中的动态负载均衡、通信优化、显存管理等核心技术难题
跟踪学术界与工业界前沿技术(如vLLM、TGI、TensorRT-LLM等),推进框架迭代

优先资格

有GPU/NPU 算子优化经验,有并行计算相关背景者优先

AI 洞察

优缺点分析

优点

  • 大模型推理是当前最热门的技术方向之一,职业前景广阔
  • 可接触vLLM、TensorRT-LLM等业界最前沿的推理框架,技术深度和广度兼备
  • 滴滴作为大型互联网公司,拥有大规模GPU集群和实际业务场景,平台资源优质
  • 薪资水平在行业内具有竞争力
  • 技术复杂度高,涉及分布式系统、异构计算、量化编译等多领域知识,学习成本较大
  • 工作强度可能较大,尤其在模型上线和性能调优的关键时期
  • 推理引擎迭代快,需要持续跟进学术界与工业界最新技术,保持学习节奏
  • 适合对底层系统性能优化有浓厚兴趣、具备扎实编程功底和并行计算背景,愿意在大模型基础设施领域深耕的技术人员

缺点 / 挑战

暂无明显挑战项

角色解读

  • 技术专家路线:深耕推理引擎性能优化,成为分布式系统或异构计算领域的专家
  • 架构师路线:从单一模块负责人成长为整体推理平台架构师,主导技术选型与架构演进
  • 管理路线:可向技术管理岗位发展,带领团队推进大模型基础设施的迭代
  • 负责大模型推理引擎的架构设计与核心模块开发,支撑千亿参数模型的高效分布式推理
  • 研发面向GPU/NPU等异构平台的高性能算子,提升硬件利用效率
  • 参与模型低精度量化、图优化、编译优化等性能优化工作
  • 攻克分布式推理中的动态负载均衡、通信优化、显存管理等技术难题
  • 熟练掌握C++/Python,具备大型项目代码架构设计能力
  • 熟悉Transformer架构及大模型推理技术,如FlashAttention、PagedAttention、Continuous Batching
  • 有实际大模型部署和调优经验,熟悉INT8/FP8等量化优化手段
  • 有GPU/NPU算子优化经验或并行计算背景更佳

申请策略

  • 关注滴滴基础产品事业部的技术博客,了解团队技术方向与风格
  • 面试时展示对大模型推理性能瓶颈的独立思考,如如何优化显存占用或通信开销
  • 突出在大模型部署和推理优化方面的实际项目经验,包括优化前后的性能对比数据
  • 展示C++/Python高并发、高性能代码的编写能力,可附上GitHub或技术博客链接
  • 强调对Transformer架构、Attention机制及其优化的理解,如FlashAttention、PagedAttention等
  • 如有GPU/NPU算子开发或并行计算项目(如CUDA、OpenCL)经历,务必重点描述
  • 系统学习CUDA编程和GPU架构,加深对指令级优化、内存布局的理解
  • 阅读并分析vLLM、TensorRT-LLM等主流推理引擎源码,理解其关键设计

面试指南

  • 针对性能优化问题,采用「背景-方案-量化结果」的STAR框架,强调性能提升的数据
  • 对于原理性问题,从机制、优点、局限性三个层次回答,必要时画图说明
  • 对于设计类问题,先明确需求约束,再对比多种方案,最后给出权衡并说明理由
  • 请介绍一下你参与过的大模型推理性能优化案例,具体做了哪些工作?遇到了什么难点?如何解决?
  • 解释一下PagedAttention的原理,它如何解决显存碎片问题?
  • 在多卡分布式推理中,如何优化通信瓶颈?你了解哪些通信拓扑或策略?
  • C++中如何设计一个高性能的内存池?请给出关键代码思路
  • 如何对一个大模型进行INT8量化?你如何评估量化后的精度损失?

职位点评

73
综合评分

大厂大模型推理核心岗位,技术前沿、薪资高、成长快,但工作地点在北京且WLB未明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合以技术成长和前沿探索为核心动机,对薪资有较高期望,且能接受北京现场办公和一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活45
使命价值75

薪资福利

80较高

该职位薪资水平预期较高,虽然JD未披露具体数字,但滴滴作为上市公司,资深技术岗薪酬有竞争力,且大模型方向人才稀缺。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

85较高

大模型推理方向技术前沿,涉及大量优化和系统设计,个人成长空间大,且团队鼓励跟踪前沿技术。

技术前沿前沿/新兴技术
技术栈C++、Python、GPU、NPU、CUDA、vLLM、TensorRT-LLM、FlashAttention、PagedAttention、量化
成长机会跟踪学术界与工业界前沿技术、推进框架迭代
业务类型ambiguous

工作生活

45较低

北京现场办公,JD未提及弹性工作,互联网大厂普遍节奏较快,WLB不确定性高。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

大模型对社会生产力有显著推动作用,但作为基础设施研发,直接社会价值感可能不强烈,更多在于技术贡献。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs