Alibaba logo
阿里巴巴
AI推理平台-大模型异构芯片适配与推理优化工程师-杭州/北京

AI推理平台-大模型异构芯片适配与推理优化工程师-杭州/北京

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Moe
Npu
Sglang
Tpu
Vllm
分布式推理
图编译
大模型
推理优化

AI 估算 · 30k–55k

阿里大厂,大模型基础设施方向,2年经验薪资较高,杭州/北京一线城市,综合月薪3-5.5万。

职位详情

关于这个职位

负责主流大模型(如Qwen、DeepSeek、GLM、Kimi)在TPU、NPU等AI加速芯片上的适配与推理优化,需深入理解模型结构、推理框架和编译栈,推动模型在多硬件平台上高效稳定运行

适合对AI Infra和性能优化有热情的工程师

最低要求

深入理解主流大模型结构、推理框架、算子/kernel、编译栈与分布式推理机制

具备2年以上相关工作经验
熟悉vLLM、SGLang或类似推理框架
具备良好的跨层问题定位与解决能力

工作职责

负责 Qwen、DeepSeek、GLM、Kimi等主流模型在 TPU、NPU 等各类AI 加速芯片上的适配、验证和性能优化

分析模型结构与硬件特性,完成 attention、KV cache、MoE、多模态模块、DiT/扩散模型等关键链路的推理打通与优化
基于 vLLM、SGLang 或自研推理框架,推进模型部署、算子替换、图编译、kernel 调优和端到端性能优化
建立模型适配流程,包括精度对齐、性能 benchmark、长上下文验证、并发压测、稳定性回归和版本发布
与上下游团队紧密协作,定位并解决动态 shape、通信瓶颈、内存布局、算子缺失、图编译失败、精度漂移等跨层问题
沉淀通用适配能力和工具链,提升新模型、新硬件平台的接入效率,推动多硬件后端的标准化和平台化

AI 洞察

优缺点分析

优点

  • 接触前沿大模型和AI芯片,技术含金量高,积累稀缺经验
  • 阿里平台资源丰富,能参与大规模落地项目,影响力大
  • 团队协作紧密,能快速提升跨层问题解决和综合技术能力
  • 薪资回报有竞争力,同时有完善的职业发展体系
  • 技术难度高,需要精通模型、框架和硬件多个层面,学习曲线陡峭
  • 多硬件适配工作繁琐,可能需频繁处理兼容性和性能问题
  • 行业演进快,需持续学习新技术,保持竞争力

缺点 / 挑战

  • 适合对AI底层技术有浓厚兴趣、喜欢挑战难题的工程师,尤其是那些享受从模型到硬件全栈优化的技术深度和成就感的人

角色解读

  • 在AI Infra领域深耕,成为大模型推理优化专家
  • 可横向扩展至AI芯片厂商或云计算平台,担任技术专家或架构师
  • 有机会参与前沿技术标准和行业方案制定,向技术管理岗位发展
  • 负责主流大模型在AI芯片上的适配与调优,确保模型能高效运行在TPU/NPU等硬件上
  • 深入分析模型结构和硬件特性,优化关键算子(如attention、MoE)和推理链路
  • 使用vLLM、SGLang或自研框架进行部署和性能优化,解决各种跨层问题
  • 沉淀工具链和适配流程,提升新模型/硬件接入效率,推动标准化
  • 扎实的深度学习基础,熟悉Transformer、MoE、扩散模型等架构
  • 熟悉推理框架(如vLLM、SGLang)和算子优化方法,有kernel调优经验
  • 了解编译原理和分布式推理,具备CUDA/OpenCL或NPU开发经验更佳
  • 良好的工程能力,熟悉Python/C++,能定位和解决复杂系统问题

申请策略

  • 关注阿里云或Qwen团队的技术动态,了解业务方向
  • 面试时准备一个完整的端到端项目,展示从模型到硬件的优化思路
  • 突出大模型推理优化经验,如具体模型和芯片适配案例
  • 强调对推理框架(vLLM等)和算子优化的深入理解,展示性能提升数据
  • 体现对分布式系统和编译栈的掌握,列出相关项目
  • 如有开源贡献或技术博客,可作为加分项
  • 提前学习TPU/NPU编程和异构计算原理,补充硬件知识
  • 熟悉vLLM、SGLang源码,尝试复现模型推理优化流程

面试指南

  • STAR法则:描述背景、任务、行动和结果,突出量化成果
  • 从系统角度思考:问题分析要模型、框架、硬件三层结合,给出系统性解决方案
  • 体现工程化思维:强调可复现的流程和工具化沉淀
  • 如何将一个大模型适配到新的AI芯片上?请描述完整流程
  • 在推理优化中,遇到过哪些性能瓶颈?如何定位和解决?
  • 请解释vLLM的PagedAttention原理,并说明它如何提升吞吐
  • MoE模型在分布式推理中有哪些挑战?如何解决?
  • 如何实现精度对齐和性能平衡?

职位点评

73
综合评分

阿里大模型推理优化前沿岗,技术含金量极高,薪资优厚但WLB未明确

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合重视技术成长、追求前沿AI基础设施挑战的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70

薪资福利

75中等

阿里巴巴薪资水平在业内较高,但具体薪资未在JD披露,福利信息也未提及,补偿性满足度中等偏上。

薪资信号未披露(AI估算:30K-55K/月)

成长发展

90较高

该职位处于AI infra前沿,技术栈新且核心,深度和广度都能极大提升,发展性满足度很高。

技术前沿前沿/新兴技术
技术栈大模型、TPU、NPU、vLLM、SGLang、kernel优化、图编译、分布式推理、MoE
业务类型profit_center

工作生活

50较低

仅现场办公,JD未提及WLB相关内容,无弹性或远程信息,生活化满足度一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

推动大模型在国产芯片上的落地具有战略意义,行业前景好,但JD未明确社会价值导向,意义感满足度中等偏上。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs