JD logo
京东
语音引擎工程师(ASR工程)

语音引擎工程师(ASR工程)

发布于 大约 8 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
NLP工程
Asr
Cuda
Onnx Runtime
Tensorrt
Tensorrt-Llm
Vllm
模型量化

AI 估算 · 30k–60k

高级语音AI工程师在北京市场稀缺,技术栈针对大模型推理,薪资竞争力强,参考大厂P7级别。

职位详情

关于这个职位

该职位负责京东科技的语音识别(ASR)模型推理服务开发,涉及从轻量级模型到百亿参数大模型的部署与优化

你将使用C++/Python和TensorRT等工具进行高性能推理优化,并参与构建云原生AI推理网关
适合对语音技术和模型加速有深入兴趣的工程师

最低要求

计算机、通信、自动化等相关专业本科及以上学历,具有扎实的编程功底,良好的设计能力和编程基础、对设计模式有一定的了解

精通C++和Python,具备扎实的数据结构与算法功底,熟练掌握Linux环境下的多线程/多进程编程、网络编程(gRPC/HTTP/TCP/WebSocket),熟悉Docker与K8s等容器化编排技术
熟练使用ONNX Runtime、TensorRT进行模型转换、算子支持与加速,vLLM、TensorRT-LLM等大模型分布式推理框架,掌握流式和非流式语音识别的工程化实现
具备CUDA/Triton C++算子开发及性能调优经验,能针对特定硬件(如Nvidia A10/A100/H20)进行指令级优化
精通KV Cache管理,具备FP8/INT8/INT4模型量化部署经验,了解GPTQ/AWQ等量化算法
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信

工作职责

负责基于云原生架构的语音识别(ASR)模型推理服务开发,涵盖从端到端轻量级小模型到百亿参数级语音大模型的部署与落地

针对ASR推理链路进行深度优化,包括但不限于计算图优化、算子融合、显存管理与多线程并发,显著降低RTF并提升整体QPS
跟踪并引入业界最新的大模型推理加速技术,如量化、投机采样、KV Cache优化,解决大模型在云端部署的高成本与高延迟痛点
参与构建支持高并发、高可用、可动态弹性扩缩容的云端AI推理网关与资源调度系统,保障核心业务的稳定性

AI 洞察

优缺点分析

优点

  • 京东科技平台大,业务场景丰富,能接触到真实大规模AI服务
  • 技术栈前沿,涉及大模型推理加速,是当前AI领域的热门方向
  • 薪资福利有竞争力,大厂稳定性较好
  • 团队强调技术创新,有良好的技术氛围
  • 技术门槛高,需要同时掌握C++、CUDA、分布式系统等多领域知识
  • 推理优化工作需要极强的耐心和深入底层的能力,调试难度大

缺点 / 挑战

  • 大厂工作节奏可能较快,需要适应一定的加班压力
  • 适合对高性能计算和AI推理有热情、享受技术深挖的工程师,能接受一定的工作压力

角色解读

  • 技术专家路线:深耕AI推理优化,成为GPU高性能计算领域的专家
  • 架构师路线:参与推理平台和资源调度系统设计,向系统架构师发展
  • 技术管理路线:积累经验后带领团队负责更大型的AI基础设施
  • 负责ASR模型在云端的推理服务开发,涵盖从小型端侧模型到百亿参数大模型的部署
  • 对推理链路进行深度优化,包括计算图优化、算子融合、显存管理和多线程并发,以降低RTF并提升QPS
  • 引入最新的大模型加速技术,如量化、投机采样、KV Cache优化,解决部署成本和延迟问题
  • 构建高并发、高可用的云端AI推理网关与资源调度系统,保障业务稳定性
  • 精通C++和Python,具备扎实的数据结构与算法基础
  • 熟悉Linux环境下的多线程、网络编程(gRPC/HTTP等)以及Docker/K8s容器化技术
  • 熟练使用ONNX Runtime、TensorRT等推理加速框架,以及vLLM、TensorRT-LLM等大模型推理框架
  • 具备CUDA/Triton算子开发和性能调优经验,了解模型量化与KV Cache管理

申请策略

  • 在简历中量化成果,如'将RTF降低40%',让HR看到实际影响力
  • 了解京东科技的业务方向,在面试中表达对供应链金融或企业服务的理解,体现与公司使命的契合
  • 突出C++/Python项目经验,尤其是高性能服务或底层优化相关项目
  • 强调在模型推理加速、TensorRT/CUDA调优方面的实际成果,如RTF、QPS提升数据
  • 如果有K8s/Docker的部署经验,务必体现
  • 如有大模型部署或量化经验,作为加分项重点展示
  • 系统学习CUDA编程和GPU架构原理,可以尝试实现简单的算子优化
  • 熟悉TensorRT和vLLM的常用用法,动手部署一个开源ASR模型

面试指南

  • 用STAR法则组织项目经历:情境、任务、行动、结果,突出量化数据
  • 技术对比题先列出关键维度,再结合应用场景分析取舍
  • 系统设计题先明确需求和非功能指标,再给出架构模块和关键设计决策
  • 请介绍你做过的一个ASR推理优化项目,具体优化了哪些环节?
  • TensorRT和ONNX Runtime在模型部署上有何区别?如何选择?
  • 如何减少大模型推理的显存占用?你了解哪些量化方法?
  • 在多线程并发下如何保证推理服务的稳定性?
  • 如何设计一个高可用的AI推理网关?

职位点评

71
综合评分

京东科技ASR引擎岗,前沿大模型推理技术,薪资优厚,但工作节奏和WLB需自行调节。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和前沿AI方向的工程师,不介意工作强度,希望能在大平台快速发展。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值80

薪资福利

70中等

薪资未明确披露,但京东作为大厂提供有竞争力的薪酬和福利。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

85较高

技术栈前沿,涉及大模型推理加速,能获得极佳的技术成长和职业发展空间。

技术前沿前沿/新兴技术
技术栈C++、Python、TensorRT、vLLM、CUDA、模型量化
业务类型ambiguous

工作生活

50较低

未明确提及工作方式,默认现场办公,WLB信号不明,可能存在不确定性。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

公司使命强调技术赋能产业升级,具有正向社会影响力,工作意义感较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号以科技引领产业数智化升级,推动世界更加高效和美好、加入我们,一起用技术让生活更美好
创新程度积极采用新技术
Watch Jobs