Alibaba logo
阿里巴巴
AI推理平台-百炼模型推理服务技术专家-北京/杭州

AI推理平台-百炼模型推理服务技术专家-北京/杭州

发布于 大约 7 小时前

普通员工/个人贡献者

北京市 / 杭州市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Roofline Model
分布式推理
多模态模型
大模型
性能优化
推理引擎

AI 估算 · 40k–70k

资深AI推理技术专家稀缺,大模型领域热门,阿里平台薪资有竞争力,按P7级估算。

职位详情

关于这个职位

该职位负责阿里云百炼平台的多模态大模型推理服务开发与性能优化,涉及分布式推理架构设计、推理引擎服务化及线上稳定性保障

需要深厚的C++/Python功底和系统性能优化能力,适合对LLM推理技术充满热情、追求技术前沿的资深专家

最低要求

计算机/人工智能相关专业硕士及以上学历,熟练掌握C++和Python编程语言,和软件工程面向对象设计(OOP,OOD)等相关技术, 有很好的抽象能力

掌握性能优化方法论,能够快速定位系统瓶颈的原因,能够利用Roofline Model来计算IO、计算和带宽的理论极限,并用编程技术逼近极限
良好的技术洞察力、拥有技术激情、快速学习和协同落地能力,自我驱动力强,具有创新精神

工作职责

多模态模型的推理功能开发和性能优化,包括对Qwen-VL、Qwen-Audio、Qwen-Omni等多模态输入/输出模型的功能支持和推理性能优化

分布式推理架构的研发,包括多机推理架构设计,P/D分离、A/F分离、VL模型分离架构的落地
推理引擎服务化,包括推理引擎如何接入线上服务平台,自动扩缩容和可观测性的适配,以及提升线上服务稳定性

优先资格

熟悉开源LLM推理引擎的架构和实现, 对推理引擎领域开源项目有持续关注

有分布式推理系统架构设计和性能优化经验
有CUDA编程基础和算子性能优化经验
有过高性能计算领域文章发表等相关经验

AI 洞察

优缺点分析

优点

  • 阿里巴巴平台资源丰富,可接触大规模真实业务场景和顶尖技术团队
  • 高薪高福利,稳定的大厂背景,职业背书强
  • 涉及多团队协作,需要较强的沟通和落地能力

缺点 / 挑战

  • 身处大模型推理最前沿,技术挑战大,个人成长速度快
  • 技术复杂度高,需要深入理解软硬件栈,持续学习压力大
  • 大厂工作节奏快,可能面临较高的工作强度和压力
  • 适合对AI系统技术有极致追求、热爱性能优化、愿意接受高强度挑战的资深工程师

角色解读

  • 在技术深度上可发展为AI系统架构师,主导大规模推理基础设施的设计与演进
  • 在业务广度上可转向AI平台产品化方向,将技术能力转化为云服务产品竞争力
  • 凭借大模型推理的稀缺经验,可成长为团队技术负责人或ML Infra方向的技术专家
  • 负责多模态大模型(Qwen-VL/Audio/Omni)的推理功能开发和性能优化,提升模型在线上服务的响应速度和吞吐量
  • 设计并落地分布式推理架构,包括多机推理、P/D分离、A/F分离等方案,解决大规模模型部署的算力和资源调度问题
  • 将推理引擎服务化,与线上平台对接,实现自动扩缩容、可观测性增强和稳定性保障
  • 精通C++和Python,具备良好的软件工程和抽象能力,能够高效实现复杂的推理逻辑
  • 深入理解性能优化方法论,能利用Roofline Model分析IO、计算和带宽瓶颈,并编写高性能代码逼近硬件极限
  • 了解分布式系统和GPU编程(CUDA),熟悉常见推理引擎(如vLLM、TGI)的架构者优先

申请策略

  • 了解阿里云百炼平台的产品定位和技术栈,可以在面试中展现业务理解
  • 准备几个深度技术故事,说明你如何解决复杂的性能瓶颈,体现逻辑和创新能力
  • 突出推理引擎开发或优化相关项目经验,如vLLM、TensorRT等实际落地案例
  • 强调C++/Python编程能力和性能调优的量化成果(如延迟降低XX%、吞吐提升XX%)
  • 展示分布式系统、GPU编程或CUDA优化经验,附上具体技术方案和效果
  • 熟悉主流开源推理引擎的源码和架构,如vLLM、TGI、llama.cpp
  • 系统学习CUDA编程和GPU性能分析工具(NVIDIA Nsight、profiler等)
  • 了解多模态模型的结构和部署特点,如视觉/音频编码器的推理优化

面试指南

  • 用STAR法则,结合具体项目,突出技术挑战、解决方案和量化结果
  • 从系统层面分析问题,先定位瓶颈(计算/IO/带宽),再针对性地优化(算子融合、量化、张量并行等)
  • 展现对前沿技术的关注,对比不同方案优缺点,并说明选型依据
  • 如何设计一个多机多卡的分布式推理服务架构?
  • 你对Roofline Model的理解是什么?在项目中如何运用?
  • 如何优化一个Transformer模型的显存占用和推理速度?
  • 如何诊断线上推理服务的性能瓶颈?请举例说明
  • 你如何看待P/D分离、A/F分离等架构的优劣?

职位点评

75
综合评分

大厂AI平台核心岗位,前沿技术栈,高薪高成长,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求前沿技术创新、渴望深度技术挑战并获得高薪回报的资深工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活45
使命价值75

薪资福利

80较高

职位未披露具体薪资,但阿里巴巴技术专家岗位通常提供高薪酬和优厚福利,薪资竞争力强。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

大模型推理是当前最前沿的技术领域,职位涉及分布式架构、性能优化等深度技术,个人成长空间极大。

技术前沿前沿/新兴技术
技术栈C++、Python、分布式推理、性能优化、CUDA、多模态模型
业务类型ambiguous

工作生活

45较低

职位为现场办公,地点为北京/杭州,未提及弹性工作或远程,互联网大厂工作强度可能较大,WLB一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

75中等

大模型推理平台推动AI应用落地,技术影响力广泛,社会价值较高,且行业处于高速增长期。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs