Ant Group logo
蚂蚁集团
蚂蚁集团-AI Infra 训练系统高级技术专家-上海

蚂蚁集团-AI Infra 训练系统高级技术专家-上海

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
架构师
Deepspeed
Fsdp
Megatron-Lm
Nccl
Pytorch
Rdma
分布式训练
大模型

AI 估算 · 60k–90k

高级技术专家,蚂蚁大厂,AI Infra方向技术稀缺,市场薪酬竞争力强,月薪范围合理。

职位详情

关于这个职位

这是一个蚂蚁集团AI Infra团队的高级技术专家职位,专注于大模型训练系统的架构设计与优化

你将主导训练引擎和框架的核心技术路线,面向万卡级集群优化分布式训练性能,并与算法团队协同推动新模型和新算法的快速落地
适合在分布式系统、高性能计算或机器学习系统领域有深厚积累的技术专家

最低要求

具备扎实的计算机系统基础,在分布式系统、高性能计算、机器学习系统或计算机体系结构等方向有深入积累

精通 Python、C++ 中至少一种语言,具备复杂系统架构设计和核心模块研发能力
深入理解 PyTorch 运行机制,对自动微分、计算图、分布式通信、并行训练和显存管理有系统认识
深入理解 Megatron-LM、FSDP、DeepSpeed、verl 等训练框架中的一种或多种,能够分析其核心架构与性能边界
熟悉大规模分布式训练中的通信、计算、显存和存储瓶颈,能够完成跨层性能分析与优化
熟悉 NCCL/HCCL、RDMA、集合通信算法、通信计算重叠或大规模网络拓扑
具备复杂技术问题的抽象能力,能够从局部现象识别系统性根因,并形成可演进的解决方案
具备较强的技术判断力和推动力,能够主导关键技术方向并协调多团队完成复杂系统建设

工作职责

主导大模型训练引擎与训练框架的核心架构设计,定义关键技术路线和长期演进方向

建设覆盖 CPT、SFT、RL、MoE、长上下文及多模态训练的统一训练体系
设计和优化数据并行、张量并行、流水并行、序列并行、专家并行及多维混合并行策略
面向万卡级集群,系统优化计算、通信、显存、存储和网络效率,持续提升端到端训练性能与扩展效率
建设 Checkpoint、断点续训、故障恢复、弹性训练、精度保障、性能分析和可观测体系,提升长周期训练任务的可靠性
推动训练框架、编译器、通信库、算子与多种 AI 芯片之间的深度协同
与模型算法团队共同开展 Algorithm-System Co-design,支持新模型结构、新训练算法和新型并行范式快速落地
识别并解决跨模型、框架、系统和硬件层的关键瓶颈,沉淀可复用的架构、标准与方法论
发挥技术影响力,牵引复杂项目落地,并推动团队在训练系统核心方向形成长期能力

优先资格

主导或深度参与过百亿、千亿参数模型的预训练、后训练或强化学习训练系统建设

具备数百卡、千卡及以上规模的分布式训练实践
在 MoE、长上下文、多模态、Agentic RL 或新型模型架构方向有系统经验
具备 CUDA、Triton、CANN、算子开发、编译优化或性能建模经验
具备异构芯片适配、跨硬件精度对齐或大规模训练稳定性建设经验
在训练框架、分布式系统、高性能计算相关开源项目中有核心贡献
有从技术方向规划、核心架构设计到规模化生产落地的完整经验

AI 洞察

优缺点分析

优点

  • AI Infra是当前热点方向,人才稀缺,职业前景广阔,薪资竞争力强
  • 与顶尖算法和系统团队合作,能深度参与Algorithm-System Co-design,积累跨领域经验
  • 工作强度较大,需应对长周期训练任务的稳定性问题,可能需要on-call
  • 技术栈深且更新快,需要持续学习新框架、新芯片和新并行策略
  • 跨团队协作复杂,需要较强的沟通和推动能力
  • 适合在分布式系统、高性能计算或机器学习系统领域有深厚积累,喜欢解决硬核技术问题,追求技术前沿和影响力的资深工程师

缺点 / 挑战

  • 蚂蚁集团平台大,资源充足,能够接触万卡级集群和前沿AI技术,技术挑战大,成长快

角色解读

  • 在AI Infra领域深耕,成为分布式训练系统的顶级专家,影响行业技术标准
  • 可向技术管理方向转型,带领训练系统团队,或转向更广泛的AI平台架构
  • 积累大规模系统设计和落地经验,未来可成为CTO或技术VP的后备人选
  • 主导大模型训练引擎和训练框架的核心架构设计,制定技术路线图
  • 优化分布式训练策略(数据并行、张量并行、流水并行等),提升万卡级集群的训练效率和稳定性
  • 与算法团队协作,支持新模型结构(MoE、长上下文、多模态)和训练算法(RL、SFT)的快速落地
  • 解决跨模型、框架、系统和硬件层的性能瓶颈,建设可观测性和容错机制
  • 精通Python和C++,具备复杂系统架构设计能力
  • 深入理解PyTorch内部机制及主流训练框架(Megatron-LM、FSDP、DeepSpeed等)
  • 熟悉大规模分布式训练中的通信、计算、显存优化,以及NCCL/RDMA等底层技术
  • 具备跨层问题抽象和系统性根因分析能力,能主导技术方向并推动多团队协作

申请策略

  • 面试前准备一两个系统设计的深度案例,展示从问题分析到方案落地的完整思路
  • 关注蚂蚁集团在AI Infra领域的公开分享和技术博客,了解其技术栈和方向
  • 突出在分布式训练系统架构方面的项目经验,尤其是大规模(千卡以上)训练优化案例
  • 量化成果,例如训练效率提升百分比、集群利用率、故障恢复时间等
  • 展示对主流训练框架的深入理解,如修改过Megatron-LM源码或贡献过开源项目
  • 强调跨团队协作和技术领导力,例如主导过跨部门技术方案落地
  • 深入研读Megatron-LM、FSDP等框架源码,理解并行策略实现细节
  • 学习CUDA编程和算子优化,或熟悉Triton、CANN等工具

面试指南

  • 描述具体场景,用STAR方法(Situation, Task, Action, Result)结构化回答
  • 从系统层面分析问题,先定位瓶颈(计算、通信、显存、存储),再给出针对性优化方案,并对比不同方案的trade-off
  • 展示对前沿技术的理解,例如引用最新论文或开源方案,体现持续学习能力
  • 请介绍你参与过的最大的分布式训练系统,你遇到了哪些瓶颈,如何优化?
  • 如何设计一个支持万卡级训练的并行策略?请从数据并行、模型并行、流水并行等角度分析
  • 在训练大模型时,如何解决通信瓶颈和显存不足的问题?
  • 如果训练过程中出现hang或slow节点,如何定位和恢复?
  • 请比较Megatron-LM和DeepSpeed的架构差异,以及各自的适用场景

职位点评

75
综合评分

技术前沿、薪资优厚、成长空间巨大,但工作强度高,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最看重技术成长和行业前沿,愿意在高压环境下追求技术突破的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活40
使命价值85

薪资福利

75中等

薪资未披露但基于职位级别和公司规模,预计处于市场高位;未提及具体福利,但大厂福利通常较好。

薪资信号未披露(AI估算:60K-90K/月)

成长发展

95较高

该职位处于AI Infra前沿技术领域,涉及分布式训练、并行策略、AI芯片协同等,成长空间极大;JD多次强调技术方向和影响力,但未明确提及晋升通道。

技术前沿前沿/新兴技术
技术栈分布式训练、并行策略、NCCL、RDMA、Megatron-LM、FSDP、DeepSpeed、PyTorch、AI芯片
业务类型profit_center

工作生活

40较低

仅现场办公,未提及弹性工作或远程选项;互联网大厂工作强度较大,但JD未明确说明加班情况。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

85较高

AI基础设施是高速增长赛道,对行业有重要推动作用;该职位直接贡献于大模型训练能力,社会意义和技术影响力显著。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
Watch Jobs