Amap logo
高德地图
高德-大模型推理引擎工程师/专家-北京

高德-大模型推理引擎工程师/专家-北京

发布于 大约 15 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Asr
Cuda
Kv Cache
Onnx Runtime
Tensorrt
Tts
流式推理
深度学习
量化

AI 估算 · 30k–60k

北京AI大厂核心岗,技能稀缺,薪资竞争力强,年终奖丰厚

职位详情

关于这个职位

负责高德地图全双工实时语音交互场景下推理引擎的架构设计与落地,包括语音前端处理、ASR、TTS等全链路语音模型推理服务建设,并进行极致性能优化(算子优化、量化、分布式推理等),保障低延迟高并发服务SLA

同时预研大语言模型推理加速技术,支撑多模态交互场景
适合对深度学习推理优化有深厚经验的工程师

最低要求

本科及以上学历,计算机科学与技术、电子工程、自动化、通信工程等相关专业,3年及以上深度学习推理引擎/推理优化相关工作经验,优秀者可放宽年限与学历要求

精通C/C++编程语言,熟悉Python,具备扎实的算法与数据结构基础,良好的工程化编码素养与代码规范意识
精通CUDA编程,熟悉GPU架构与性能优化方法,有丰富的深度学习算子开发、优化经验
熟悉至少一种主流推理框架(TensorRT/ONNX Runtime/TVM/LibTorch等),并有深度二次开发或商业化落地经验
熟悉深度学习基本原理,掌握Transformer、Conformer、RNNT、Seq2Seq等主流模型结构,了解语音大模型(ASR/TTS/端到端语音模型)的推理特性与性能瓶颈,有相关模型的推理优化落地经验
熟悉流式推理、在线服务开发,掌握多线程、异步编程、内存管理等技术,有高并发、低延迟在线推理服务的设计与落地经验
具备良好的问题分析与解决能力,有较强的技术自驱力,能独立开展技术攻关与项目落地

工作职责

负责全双工实时语音交互场景下,上下行语音链路的推理引擎整体架构设计与落地,覆盖语音前端处理(降噪、AEC、VAD)、ASR、TTS、音色转换、情感合成等全链路语音模型的推理服务建设,支持打断、优先级调度、并行处理等全双工核心交互特性

针对语音大模型的流式推理特性,开展极致性能优化,包括但不限于算子定制与优化、低精度量化(INT8/FP8/INT4)、模型压缩、内存/显存复用、编译优化、流式pipeline并行调度、分布式推理优化等,持续压缩端到端推理延迟,提升服务并发能力与资源利用率
负责推理引擎的工程化落地、工具链建设与线上稳定性保障,搭建从训练模型到推理部署的全流程自动化工具链,实现模型转换、量化、编译、部署的标准化落地
对接算法团队的模型迭代,快速支撑新模型的上线
搭建性能监控与告警体系,解决线上高并发、低延迟场景下的技术问题,保障服务SLA
预研并落地大语言模型的推理加速技术,包括分布式推理、KV Cache优化、投机解码、动态批处理等,打通语音-语言大模型的端到端推理链路,支撑多模态交互场景的技术需求
跟踪业界前沿的推理引擎、深度学习编译、模型优化技术,结合业务场景开展技术预研与落地,持续迭代推理引擎的技术竞争力

AI 洞察

优缺点分析

优点

  • 核心AI业务,技术前沿,可积累推理优化、大模型部署等稀缺经验
  • 高德(阿里集团)大平台,资源充足,技术影响力强
  • 薪资水平处于市场高位,年终奖和福利完善
  • 工作强度较大,涉及线上服务稳定性保障,可能需要on-call
  • 技术栈更新快,需要持续学习前沿的推理加速技术
  • 面试门槛高,对C++、CUDA、推理框架要求极深

缺点 / 挑战

  • 适合对深度学习推理优化有深厚兴趣、乐于挑战性能极限、具备强工程落地能力的资深工程师

角色解读

  • 技术深度上,可从推理优化专家向系统架构师或AI Infra负责人发展
  • 业务广度上,可拓展至多模态大模型、端侧推理等前沿方向
  • 管理路径上,可逐步带领团队,成为技术Leader或总监
  • 设计并落地全双工语音交互推理引擎架构,涵盖降噪、ASR、TTS等全链路模型推理服务
  • 针对流式语音大模型进行极致性能优化,包括算子定制、低精度量化、分布式推理等
  • 搭建从训练到部署的自动化工具链,保障线上服务的高并发、低延迟稳定性
  • 预研大语言模型推理加速技术(如KV Cache优化、投机解码),打通多模态交互链路
  • 精通C/C++和Python,具备扎实的算法与数据结构基础
  • 精通CUDA编程和GPU性能优化,有深度学习算子开发经验
  • 熟悉TensorRT、ONNX Runtime等推理框架,并有深度二次开发经验
  • 掌握Transformer、Conformer等模型结构,了解语音大模型推理瓶颈

申请策略

  • 了解高德语音交互场景(如车载导航、步行语音助手),可在面试中体现业务理解
  • 关注阿里集团内部推理引擎相关开源项目(如BladeDISC),展示技术热情
  • 突出CUDA算子开发和推理框架二次优化的项目经历,提供具体性能提升数据
  • 强调语音模型(ASR/TTS)或大语言模型推理优化的实际落地案例
  • 展示高并发、低延迟在线服务的设计与稳定性保障经验
  • 若缺乏语音模型背景,可快速学习Conformer、RNNT等结构及推理特性
  • 补充KV Cache优化、投机解码等大模型推理加速技术的理论知识

面试指南

  • 用STAR法则:背景-任务-行动-结果,量化性能提升指标
  • 从系统设计角度:架构模块、关键设计取舍、错误处理、监控告警
  • 结合理论与工程:先解释原理,再讲实际落地中的权衡与优化
  • 请描述一次你优化CUDA算子的经历,遇到了哪些性能瓶颈?如何解决的?
  • 如何设计一个低延迟的流式语音推理服务?考虑打断、优先级调度
  • 解释Transformer模型的KV Cache优化原理,以及如何实现动态批处理?
  • TensorRT和ONNX Runtime在语音模型推理上的优缺点?你如何选择?
  • 如何保障线上推理服务的SLA?遇到显存不足怎么办?

职位点评

76
综合评分

北京AI大厂核心推理优化岗,前沿技术栈,薪资优厚,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和薪资回报、能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活40
使命价值80

薪资福利

85较高

薪资水平高(北京AI大厂),福利完善(五险一金、年终奖等),补偿性动机满足度高。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

90较高

技术前沿(大模型推理优化、量化、分布式),成长空间大,发展性动机极强。

技术前沿前沿/新兴技术
技术栈CUDA、TensorRT、Transformer、量化、KV Cache、分布式推理
业务类型profit_center

工作生活

40较低

北京现场办公,JD未提WLB,可能面临高强度加班,生活化动机满足度低。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

80较高

AI大模型赋能交通出行,社会价值较高,行业高速增长,意义感动机较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs