
滴滴出行
大模型推理引擎研发资深工程师
大模型推理引擎研发资深工程师
发布于 大约 16 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Flashattention
Gpu
Npu
Pagedattention
Tensorrt-Llm
Vllm
分布式推理
量化
AI 估算 · 40k–70k
大模型推理方向热门,资深岗位稀缺,北京一线互联网薪资水平高,技术复杂度高。
职位详情
关于这个职位
这是滴滴出行基础产品事业部的大模型推理引擎研发岗位,核心是设计并优化千亿参数模型的分布式推理系统
你将参与高性能算子开发、模型量化与编译优化,攻克分布式推理中的技术难题,并引入vLLM、TensorRT-LLM等前沿框架
适合热衷底层性能优化、敢于挑战复杂系统问题的资深工程师
最低要求
计算机、数学、电子工程、通信等相关专业本科及以上学历
熟练掌握C++/Python,具备大型项目代码架构设计能力
熟悉Transformer架构及大模型推理相关技术(如FlashAttention、PagedAttention、Continuous Batching)
有实际大模型部署及调优经验,熟悉量化(INT8/FP8)等优化手段
工作职责
参与大模型推理引擎的架构设计与核心模块开发,支撑千亿参数模型的高效分布式推理
研发面向GPU/NPU等异构计算平台的高性能算子,提升硬件利用效率
参与模型低精度量化,图优化,编译优化等性能优化工作
攻克分布式推理中的动态负载均衡、通信优化、显存管理等核心技术难题
跟踪学术界与工业界前沿技术(如vLLM、TGI、TensorRT-LLM等),推进框架迭代
优先资格
有GPU/NPU 算子优化经验,有并行计算相关背景者优先
AI 洞察
优缺点分析
优点
- 大模型推理是当前最热门的技术方向之一,职业前景广阔
- 可接触vLLM、TensorRT-LLM等业界最前沿的推理框架,技术深度和广度兼备
- 滴滴作为大型互联网公司,拥有大规模GPU集群和实际业务场景,平台资源优质
- 薪资水平在行业内具有竞争力
- 技术复杂度高,涉及分布式系统、异构计算、量化编译等多领域知识,学习成本较大
- 工作强度可能较大,尤其在模型上线和性能调优的关键时期
- 推理引擎迭代快,需要持续跟进学术界与工业界最新技术,保持学习节奏
- 适合对底层系统性能优化有浓厚兴趣、具备扎实编程功底和并行计算背景,愿意在大模型基础设施领域深耕的技术人员
缺点 / 挑战
暂无明显挑战项
角色解读
- 技术专家路线:深耕推理引擎性能优化,成为分布式系统或异构计算领域的专家
- 架构师路线:从单一模块负责人成长为整体推理平台架构师,主导技术选型与架构演进
- 管理路线:可向技术管理岗位发展,带领团队推进大模型基础设施的迭代
- 负责大模型推理引擎的架构设计与核心模块开发,支撑千亿参数模型的高效分布式推理
- 研发面向GPU/NPU等异构平台的高性能算子,提升硬件利用效率
- 参与模型低精度量化、图优化、编译优化等性能优化工作
- 攻克分布式推理中的动态负载均衡、通信优化、显存管理等技术难题
- 熟练掌握C++/Python,具备大型项目代码架构设计能力
- 熟悉Transformer架构及大模型推理技术,如FlashAttention、PagedAttention、Continuous Batching
- 有实际大模型部署和调优经验,熟悉INT8/FP8等量化优化手段
- 有GPU/NPU算子优化经验或并行计算背景更佳
申请策略
- 关注滴滴基础产品事业部的技术博客,了解团队技术方向与风格
- 面试时展示对大模型推理性能瓶颈的独立思考,如如何优化显存占用或通信开销
- 突出在大模型部署和推理优化方面的实际项目经验,包括优化前后的性能对比数据
- 展示C++/Python高并发、高性能代码的编写能力,可附上GitHub或技术博客链接
- 强调对Transformer架构、Attention机制及其优化的理解,如FlashAttention、PagedAttention等
- 如有GPU/NPU算子开发或并行计算项目(如CUDA、OpenCL)经历,务必重点描述
- 系统学习CUDA编程和GPU架构,加深对指令级优化、内存布局的理解
- 阅读并分析vLLM、TensorRT-LLM等主流推理引擎源码,理解其关键设计
面试指南
- 针对性能优化问题,采用「背景-方案-量化结果」的STAR框架,强调性能提升的数据
- 对于原理性问题,从机制、优点、局限性三个层次回答,必要时画图说明
- 对于设计类问题,先明确需求约束,再对比多种方案,最后给出权衡并说明理由
- 请介绍一下你参与过的大模型推理性能优化案例,具体做了哪些工作?遇到了什么难点?如何解决?
- 解释一下PagedAttention的原理,它如何解决显存碎片问题?
- 在多卡分布式推理中,如何优化通信瓶颈?你了解哪些通信拓扑或策略?
- C++中如何设计一个高性能的内存池?请给出关键代码思路
- 如何对一个大模型进行INT8量化?你如何评估量化后的精度损失?
职位点评
73
综合评分
大厂大模型推理核心岗位,技术前沿、薪资高、成长快,但工作地点在北京且WLB未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合以技术成长和前沿探索为核心动机,对薪资有较高期望,且能接受北京现场办公和一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活45
使命价值75
薪资福利
80较高
该职位薪资水平预期较高,虽然JD未披露具体数字,但滴滴作为上市公司,资深技术岗薪酬有竞争力,且大模型方向人才稀缺。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
85较高
大模型推理方向技术前沿,涉及大量优化和系统设计,个人成长空间大,且团队鼓励跟踪前沿技术。
技术前沿前沿/新兴技术
技术栈C++、Python、GPU、NPU、CUDA、vLLM、TensorRT-LLM、FlashAttention、PagedAttention、量化
成长机会跟踪学术界与工业界前沿技术、推进框架迭代
业务类型ambiguous
工作生活
45较低
北京现场办公,JD未提及弹性工作,互联网大厂普遍节奏较快,WLB不确定性高。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
大模型对社会生产力有显著推动作用,但作为基础设施研发,直接社会价值感可能不强烈,更多在于技术贡献。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Watch Jobs