Alibaba logo
阿里巴巴
面向AI芯片推理系统优化-阿里星

面向AI芯片推理系统优化-阿里星

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 成都市
无经验要求
全职员工
仅现场办公
硕士
系统与安全工程
Cuda
Kv Cache
Rocm
Tensorrt-Llm
Vllm
分布式推理
大模型推理
性能优化
模型量化

AI 估算 · 25k–40k

阿里星定位顶尖应届生,技术门槛极高,薪资显著高于普通校招,一线城市月薪约2.5-4万。

职位详情

关于这个职位

这是一个面向AI芯片的高性能推理系统优化岗位,属于阿里星顶尖人才项目

你将在千亿参数大模型推理场景下,从事图执行引擎、内存管理、分布式推理等核心模块的设计与开发,致力于实现业界领先的推理吞吐和延迟
岗位涉及算法、系统、硬件多层面协同优化,适合对AI基础设施有浓厚兴趣、渴望挑战技术难题的应届硕博

最低要求

计算机科学、软件工程、人工智能或相关专业,硕士及以上学历(博士优先)

深入理解深度学习模型的推理过程,熟悉 Transformer/LLM 的架构和计算特性
扎实的 C/C++ 和 Python 编程能力,有高性能系统开发经验
熟悉 CUDA/ROCm 等 GPU 编程模型,或有其他 AI 加速器编程经验
对操作系统内存管理、多线程并发、分布式系统有深入理解
有强烈的性能优化意识,习惯用数据驱动决策

工作职责

设计并实现高性能推理引擎,支持主流大模型(LLaMA/Qwen/GPT 等)的高效推理

研究和落地推理优化技术,包括但不限于:KV Cache 管理、Continuous Batching、Speculative Decoding、模型量化(INT8/INT4/FP8)、稀疏化推理
设计高效的显存管理策略,优化大模型推理的显存占用和碎片问题
开发分布式推理框架,支持张量并行(Tensor Parallelism)、流水线并行(Pipeline Parallelism)、专家并行(Expert Parallelism)等策略
与算子库团队协作,定义高性能算子的接口和性能目标
与编译器团队协作,优化推理场景下的编译策略和代码生成
构建推理性能基准测试框架,持续跟踪和优化推理性能

优先资格

在 MLSys、系统、体系结构等领域发表过顶级论文(OSDI/SOSP/ASPLOS/EuroSys/MLSys 等)

参与过 vLLM、SGLang、TensorRT-LLM、LMDeploy 等开源推理框架的核心开发
有 GPU/NPU 上的高性能算子开发经验(如 FlashAttention、FlashInfer 等)
熟悉分布式训练/推理框架(Megatron-LM、DeepSpeed、Ray 等)
有大规模模型部署经验,处理过千卡级别的推理集群

AI 洞察

优缺点分析

优点

  • 阿里星项目提供顶级平台和资源,接触业界最前沿的大模型推理技术,技术成长速度远超普通岗位
  • 工作地点选择多(北京/成都/杭州/上海),可兼顾个人生活偏好
  • 薪资和福利在应届生中极具竞争力,且阿里星后续培养路径清晰,有机会成为未来技术领军人物
  • 岗位要求极高,需要同时具备算法、系统、硬件多领域的知识,学习曲线陡峭
  • 工作可能伴随较大不确定性,自研AI芯片生态尚在发展,需面对较多底层技术难题
  • 适合对AI系统与性能优化有强烈热情,抗压能力强,渴望在技术深度上不断突破自我的顶尖应届生

缺点 / 挑战

  • 工作内容横跨算法、系统和硬件,技术挑战大,能积累深厚的系统优化和并行计算经验
  • 高强度竞争和工作压力,阿里星项目汇聚顶尖人才,需要持续输出高质量成果

角色解读

  • 在阿里星项目中,可快速接触超大模型推理的行业顶级挑战,成长为AI基础设施领域的专家
  • 向系统架构师方向深入,主导推理引擎整体架构设计,或转向AI芯片软硬件协同设计领域
  • 拥有极佳的技术影响力机会,通过发表论文、开源贡献(如vLLM等)建立个人品牌,未来可进入行业顶级团队或创业
  • 设计并实现高性能推理引擎,支撑主流大模型在自研AI芯片上的高效推理,涉及图执行引擎、内存管理等核心模块
  • 研究与落地KV Cache管理、Continuous Batching、Speculative Decoding、模型量化等前沿推理优化技术
  • 开发分布式推理框架,实现张量并行、流水线并行、专家并行策略,配合算子库和编译器团队进行全栈性能协同优化
  • 构建性能基准测试框架,持续跟踪并优化大规模模型部署的端到端推理性能
  • 扎实的C/C++和Python编程能力,具备高性能系统开发经验,能进行底层性能调优
  • 深入理解Transformer/LLM架构,掌握深度学习模型推理过程以及GPU/加速器编程模型(CUDA/ROCm)
  • 熟悉操作系统内存管理、多线程并发、分布式系统理论,具备系统级问题诊断能力
  • 有强烈的性能优化意识,习惯用数据驱动决策,熟悉常用AI推理框架(如vLLM、TensorRT-LLM等)

申请策略

  • 阿里星面试非常注重深度,要准备好深入探讨技术方案的细节,展现独立思考和工程实现能力
  • 尽量了解阿里巴巴自研AI芯片(如含光)的现状和方向,在面试中体现你对AI芯片与系统协同的理解
  • 突出高性能系统开发经历,如参与过分布式训练/推理框架、GPU算子优化或编译优化项目
  • 展示对LLM推理机制的深入理解,可准备量化、KV Cache、Speculative Decoding等方向的项目经验
  • 如果有顶级会议论文(如MLSys、OSDI)或开源贡献,务必放在显眼位置
  • 强调数据驱动的性能优化案例,用具体数字证明你的优化成果(如吞吐提升X倍)
  • 提前学习并深入梳理vLLM、SGLang等主流推理框架的代码结构,尝试提交PR
  • 补充CUDA编程和算子优化实践,如自己实现FlashAttention的简化版

面试指南

  • 用STAR法则组织项目经历,着重说清背景、技术挑战、你的做法和量化效果
  • 对系统设计类问题,可按「需求分析-架构拆解-关键技术选型-权衡取舍」的框架回答,突出全局视野
  • 对原理类问题,先给出清晰定义,再结合具体应用场景分析优缺点,最后延伸至实际工程中的优化点
  • 请介绍你在推理系统优化方面最深入的一个项目,具体做了哪些优化?效果如何?
  • 如何设计一个针对千亿参数LLM的推理引擎的内存管理策略?
  • 请分析Continuous Batching的原理及其对推理吞吐的影响
  • 如果让你在自研AI芯片上实现一个FlashAttention算子,你会从哪些方面入手?
  • 如何在大规模集群上扩展分布式推理,并解决负载均衡和通信瓶颈?

职位点评

79
综合评分

阿里星顶尖项目,AI芯片推理优化,前沿技术+高薪+高压,现场办公,适合技术狂人。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求极致技术成长、渴望在AI系统领域深耕、对薪资和平台有高期望但不介意高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展93
工作生活48
使命价值78

薪资福利

85较高

阿里星作为顶级校招项目,薪资显著高于平均水平,且享受阿里大厂完善的福利体系,虽JD未明确数字,但整体补偿性回报很有吸引力。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

93较高

岗位聚焦AI推理前沿技术,与算法、系统、硬件多领域交叉,阿里星提供明确的培养路径和顶级平台,发展性极强。

技术前沿前沿/新兴技术
技术栈C/C++、Python、CUDA、ROCm、大模型推理、KV Cache、模型量化、Speculative Decoding、分布式推理
业务类型ambiguous

工作生活

48较低

岗位明确要求现场办公,未提及弹性工作安排,且阿里星工作强度高,对工作生活平衡的满足度较低。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

78中等

岗位处于AI基础设施最前沿,对推动大模型技术落地有价值,但社会直接影响力偏中性,行业本身处于高速增长期。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs