Ant Group logo
蚂蚁集团
蚂蚁集团-AI infra工程师-杭州

蚂蚁集团-AI infra工程师-杭州

发布于 大约 14 小时前

普通员工/个人贡献者

杭州市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Ai Infra
Gpu集群调度
Megatron-Lm
Moe
Rl框架
Sglang
Vllm
分布式训练
强化学习

AI 估算 · 30k–60k

AI基础设施核心岗位,大模型技术前沿,蚂蚁平台雄厚,薪资高于一般后端,通常14-16薪。

职位详情

关于这个职位

该职位负责蚂蚁集团大模型分布式训练与推理框架的研发和性能优化,深度参与自研RL框架,推进MoE架构的训推协同设计,实现千亿级模型的高效训练与推理

你将接触到SGLang、vLLM、Megatron-LM等前沿技术栈,解决大规模GPU集群调度和资源利用率问题,是AI系统领域极具挑战和成长空间的核心岗位

最低要求

具备 2 年及以上 AI 系统、任务调度或高性能并行计算相关领域的研发经验,拥有良好的工程实践能力

熟悉 Transformer、MoE 等大模型架构,以及分布式训推与调度、大模型 Agent 系统或高性能软硬件架构中的至少一个方向
对大模型及 AI 系统新技术保持热情,具备良好的逻辑思维、问题分析、沟通表达和团队协作能力

工作职责

负责大模型分布式训练与推理框架的研发和性能优化,持续提升训练效率、推理吞吐、资源利用率及系统稳定性

深度参与蚂蚁自研RL框架的研发,推进基于 MoE 的模型架构与训推框架协同设计(co-design),实现千亿级模型的高效训练与推理
熟悉分布式训练任务调度与资源编排,通过AI Infra全栈优化充分挖掘和利用空闲 GPU 资源,提升集群 GPU 利用率和整体训练产能

优先资格

熟悉 SGLang、vLLM、Megatron-LM 等训推框架,或具备大规模模型训练、推理性能优化及 GPU 集群调度经验者优先

熟悉 GRPO、PPO、DPO 等强化学习或偏好对齐算法,或了解 AReaL、veRL、Slime、OpenRLHF 等 RL 框架者优先

AI 洞察

优缺点分析

优点

  • AI Infra是大模型时代核心方向,人才稀缺,职业前景广阔
  • 接触前沿技术栈和自研框架,技术视野开阔
  • 薪酬福利在行业内具有竞争力
  • 技术栈较深,需要较强的底层系统能力,学习曲线陡峭
  • 需要与算法团队紧密配合,对沟通协作要求高
  • 大模型训练成本高,工作强度可能较大

缺点 / 挑战

  • 蚂蚁集团平台大,业务场景复杂,技术挑战高,有助于快速成长
  • 适合对AI系统底层充满热情、有分布式系统和性能优化经验、喜欢挑战的工程师

角色解读

  • 在AI Infra方向深耕,成为分布式系统或大模型训练推理专家
  • 往技术专家或架构师方向发展,主导大规模AI系统设计
  • 也可转向ML平台、大数据基础设施等相邻领域
  • 负责大模型分布式训练与推理框架的研发,优化训练效率和推理吞吐
  • 深度参与蚂蚁自研RL框架,推进基于MoE的模型与训推协同设计
  • 进行分布式训练任务调度与资源编排,利用空闲GPU资源提升集群利用率
  • 与算法、系统团队协作,解决千亿级模型训练与推理的性能瓶颈
  • 熟悉Transformer、MoE等大模型架构,理解分布式训练和推理原理
  • 掌握SGLang、vLLM、Megatron-LM等至少一种训推框架
  • 了解PPO、GRPO等强化学习算法及RL框架
  • 具备高性能并行计算、GPU集群调度和性能优化经验

申请策略

  • 了解蚂蚁自研框架(如AReaL)和业务场景,在面试中展示对AI Infra的深入理解
  • 提前准备系统设计题和性能优化案例
  • 突出分布式训练/推理项目经验,量化性能提升指标
  • 强调熟悉的具体框架和工具,如SGLang、vLLM、Megatron-LM
  • 展示对GPU集群调度、资源优化的理解
  • 如有开源贡献或RL相关经验,重点提及
  • 深入学习MoE架构和大型模型训练原理
  • 动手部署和使用主流推理框架,了解其内部机制

面试指南

  • STAR法则:情境、任务、行动、结果,突出技术细节和数字
  • 先分析问题瓶颈,再方案设计,最后总结收益
  • 展示系统性思考:从模型、数据、硬件、调度等多个维度
  • 如何优化大模型推理的吞吐量?请具体谈谈
  • 解释MoE架构的原理及训练时的挑战
  • 如何设计一个分布式训练任务调度器来最大化GPU利用率?
  • 你如何看待RL训练中训练与推理的协同设计?
  • 请描述一次你解决分布式系统性能瓶颈的经历

职位点评

72
综合评分

蚂蚁集团AI Infra工程师,前沿技术栈,高薪高成长,但WLB未明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和前沿成长、对AI基础设施充满热情、能够接受较高工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活40
使命价值65

薪资福利

80较高

虽未在JD中披露具体薪资,但蚂蚁集团作为头部互联网公司,提供具有竞争力的薪酬和稳定的职业保障。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

90较高

职位处于AI基础设施前沿领域,涉及大模型训练推理和自研RL框架,技术成长空间巨大。

技术前沿前沿/新兴技术
技术栈分布式训练、推理优化、MoE、SGLang、vLLM、Megatron-LM、GPU集群、强化学习
业务类型ambiguous

工作生活

40较低

要求现场办公,未提及远程或弹性工作,且大模型训练场景可能带来较大的工作强度,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

AI大模型属于高速增长赛道,岗位对技术基础设施有重要支撑,但直接社会影响力不明显。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs