Alibaba logo
阿里巴巴
AI-Infra工程师

AI-Infra工程师

发布于 大约 8 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
本科
后端开发
Ai基础设施
Cuda
Gpu
Pytorch
分布式系统
性能优化
深度学习

AI 估算 · 30k–60k

阿里巴巴作为互联网大厂,AI Infra岗位技术门槛高,薪资竞争力强,结合北京市场,月薪30-60K合理。

职位详情

关于这个职位

该职位负责构建和优化AI训练与推理基础设施,包括分布式系统、高性能计算集群和AI框架底层改进

你将参与大规模AI服务的部署与加速,解决算力调度、通信存储等系统级瓶颈,并与算法团队合作探索前沿技术,如编译优化和Agent框架
适合对系统性能有极致追求、熟悉C++/Python和GPU编程的工程师

最低要求

擅长C++/Python/Golang其中的一种,熟悉Linux环境开发,具备扎实的数据结构与算法基础

了解分布式系统原理,熟悉PyTorch使用,了解自动微分、计算图优化等相关机制
计算机科学、电子工程等相关专业,本科及以上学历

工作职责

参与AI训练与推理系统的定制和优化,基于计算-存储-通信协同设计,为算法和模型迭代提供优秀的分布式训练和推理解决方案

构建高性能计算集群,提供跨地域异构算力的管理,解决通信、存储、调度等系统级瓶颈
深入AI框架底层(如PyTorch、Megatron、vLLM等),改进分布式计算、自动并行、显存优化等核心模块
支持AI服务的规模化部署,参与加速优化,算力调度优化和稳定性保障工作,提供通用的模型加速,问题诊断,可观测性等解决方案
探索前沿技术方向,如编译优化、post-train训练、agent基础框架等,参与算法模型和工程技术的联合创新实践,解决AI落地业务应用过程中,新出现的效率、规模问题

优先资格

有GPU/CUDA编程经验,掌握显存管理、Kernel优化等技能优先

有顶会论文,或有知名开源项目贡献者优先

AI 洞察

优缺点分析

优点

  • 接触最前沿的AI基础设施技术,如分布式训练、GPU优化、编译优化等,技术成长快
  • 阿里巴巴平台资源丰富,业务场景复杂,能积累大规模系统的实战经验
  • 公司重视技术创新,有顶会论文和开源项目贡献的机会
  • 工作内容技术难度高,需要持续学习新知识,如CUDA、分布式框架等
  • 竞争激烈,周围同事技术水平高,需要快速产出成果

缺点 / 挑战

  • 可能需要应对高强度压力,保障AI服务稳定性和性能,紧急问题处理频繁
  • 适合对系统性能有极致追求、喜欢挑战技术难题、具备扎实编程和算法基础的工程师

角色解读

  • 技术深度发展:成为AI基础设施领域的专家,主导大规模分布式系统的设计与优化
  • 技术广度拓展:涉及编译优化、Agent框架等前沿方向,与算法团队联合创新
  • 管理方向:可晋升为技术负责人或团队主管,带领基础设施团队支持业务发展
  • 设计和优化AI训练与推理的分布式系统,包括计算、存储、通信的协同设计
  • 构建和管理高性能计算集群,解决跨地域异构算力的调度和系统瓶颈
  • 深入PyTorch、Megatron等框架底层,改进分布式计算、显存优化等核心模块
  • 支持AI服务的规模化部署,进行加速优化和稳定性保障,提供模型加速和问题诊断方案
  • 精通C++/Python/Golang之一,扎实的数据结构和算法基础
  • 了解分布式系统原理,熟悉PyTorch使用,了解自动微分和计算图优化
  • 有GPU/CUDA编程经验,掌握显存管理和Kernel优化
  • 具备系统级性能分析和调优能力,熟悉Linux环境开发

申请策略

  • 在简历和面试中强调与职位描述中技术栈的匹配度,尤其是C++/Python和PyTorch
  • 了解阿里巴巴AI基础设施的业务方向(如大模型训练、推理优化),准备相关案例
  • 突出分布式系统优化经验,例如大规模训练或推理的集群搭建、性能调优案例
  • 展示GPU/CUDA编程相关项目,包括显存优化、Kernel融合等具体成果
  • 如果参与过开源项目(如PyTorch、vLLM等),务必详细说明贡献内容
  • 强调对AI框架底层的理解,例如自动并行、计算图优化等
  • 补充或加深CUDA编程技能,学习NVIDIA相关工具如NCCL、TensorRT
  • 熟悉至少一个主流分布式训练框架(Megatron、DeepSpeed等)的架构

面试指南

  • 使用STAR法则(情境-任务-行动-结果)描述项目经验,突出技术细节和量化成果
  • 对于原理性问题,先梳理核心概念,再结合实践经验解释,体现深度理解
  • 开放性问题需展示技术视野,结合当前热点(如大模型)和个人观点,避免空泛
  • 请描述你参与过的一个分布式训练系统优化案例,具体解决了什么问题?
  • 如何在PyTorch中实现自定义的分布式通信算子?请解释Ring AllReduce的原理
  • GPU显存优化有哪些常用技术?请举例说明pipeline parallelism和activation checkpointing的区别
  • 当一个分布式训练任务出现性能瓶颈时,你如何定位和优化?
  • 你对AI Infra未来技术趋势的看法,比如编译优化或AGI基础设施?

职位点评

76
综合评分

阿里AI Infra岗位,前沿技术栈,薪资优厚但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿挑战的求职者,愿意在快节奏环境中持续学习。
表现最好
成长发展
相对薄弱
工作生活
薪资福利82
成长发展95
工作生活45
使命价值70

薪资福利

82较高

阿里巴巴作为上市巨头,薪资福利具有竞争力,但薪酬信号未在JD中明确体现。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

95较高

职位涉及AI基础设施前沿技术,如分布式训练、GPU优化、编译优化,成长空间巨大。

技术前沿前沿/新兴技术
技术栈分布式系统、GPU、CUDA、PyTorch、Megatron、vLLM、编译优化、自动并行
业务类型profit_center

工作生活

45较低

JD未提及工作模式,但阿里巴巴通常要求现场办公,且AI Infra岗位可能涉及高强度工作。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施是推动AI落地的关键,具有技术影响力,但社会使命感一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs