Ant Group logo
蚂蚁集团
蚂蚁集团-系统工程师 / 大模型基础设施方向-百灵特种兵

蚂蚁集团-系统工程师 / 大模型基础设施方向-百灵特种兵

发布于 大约 8 小时前

普通员工/个人贡献者

杭州市
中级经验
全职员工
仅现场办公
学历未注明
DevOps/SRE
Ebpf
Linux内核
Nccl
Rdma
分布式系统
可观测性
大模型训练
性能分析
推理

AI 估算 · 30k–50k

杭州大厂大模型基础设施方向,技术门槛高,薪资竞争力强,通常16薪。

职位详情

关于这个职位

这个职位负责蚂蚁集团大模型训练、推理和评测链路的系统工程建设,涉及基础设施优化、性能分析和稳定性治理

你将深入操作系统、网络、存储等底层技术,解决大规模集群中的复杂问题,并建设可观测性和自动化体系
适合对AI基础设施有热情、具备扎实系统功底的工程师

最低要求

具备扎实的计算机系统基础,熟悉操作系统、Linux 内核、容器、调度、资源隔离、性能分析等相关技术

熟悉网络基础原理和常见问题定位方法,了解 TCP/IP、RDMA、RoCE、NCCL、集合通信、网络拥塞、丢包、抖动等问题分析优先
熟悉存储系统基础能力,了解本地盘、分布式文件系统、对象存储、缓存、I/O 性能分析、数据一致性和可用性等相关问题
具备较强的复杂系统问题解决能力,能够从现象出发,结合日志、指标、trace、系统调用、内核状态、网络和存储链路进行端到端分析
具备良好的工程能力,能够通过工具化、自动化、可观测性建设和机制设计,将单点问题沉淀为系统性能力
具备良好的跨团队协作能力,能够和模型、算法、框架、平台、基础设施团队共同推进复杂问题闭环
有大规模训练、推理服务、AI Infra、云原生基础设施、高性能计算、分布式系统稳定性建设经验者优先
有 Linux 内核、eBPF、性能分析、网络通信、分布式存储、GPU/XPU 集群、Kubernetes、NCCL/RDMA 调优经验者优先

工作职责

负责大模型训练、推理、评测等核心链路中的系统工程建设,提升系统稳定性、资源效率和问题定位效率

参与计算、网络、存储等基础设施能力建设,支撑大规模模型训练、RL、SFT、推理准出等场景高效运行
深入分析系统瓶颈和稳定性问题,包括性能抖动、任务失败、资源异常、网络通信异常、存储访问异常等,并推动根因定位和长期治理
建设可观测、可诊断、可回归的系统问题分析体系,提升复杂问题的发现、定位、复现和闭环效率
与模型、训练引擎、推理框架、调度、网络、存储等团队协同,推动端到端系统优化和工程能力沉淀

优先资格

有大模型训练或推理系统问题定位经验,能够理解训练稳定性、推理性能、资源效率和任务成功率之间的关系

有复杂线上故障处理经验,能够承担关键问题的 root cause 分析和长期治理
有系统工具、诊断平台、压测平台、故障演练、自动化巡检等工程化建设经验
具备系统性思考能力,能够从单点问题中抽象出问题类别,并推动机制化解决

AI 洞察

优缺点分析

优点

  • 蚂蚁集团大平台,技术资源丰富,可接触大规模真实业务场景
  • 大模型基础设施是当前最前沿技术方向,技术成长速度快,行业需求旺盛
  • 完善的工程师文化,注重可观测性、稳定性和自动化建设,积累沉淀机会多
  • 薪资福利具有竞争力,且公司品牌背书强,对职业生涯有加分
  • 大模型系统复杂度极高,问题定位难度大,对综合技术能力要求很高
  • 可能需要处理线上故障和紧急任务,工作节奏较快,存在加班可能
  • 技术迭代频繁,需持续学习跟进新框架、新协议(如NCCL、RDMA)和新的系统优化方法
  • 适合具备扎实系统底层基础、热爱攻克复杂技术难题、渴望在AI基础设施领域长期深耕的工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 技术专家方向:深耕AI基础设施,成为大模型系统优化领域的权威专家
  • 架构师方向:参与大规模分布式系统设计,成长为系统架构师
  • 管理方向:带领SRE团队,负责基础设施稳定性与效率治理
  • 负责大模型训练、推理、评测链路的系统工程建设,保障系统稳定性与资源效率
  • 参与计算、网络、存储基础设施建设,支撑大规模模型训练与推理场景
  • 深入分析系统瓶颈,定位性能抖动、任务失败等根因并推进长期治理
  • 建设可观测、可诊断、可回归的体系,并跨团队协同推动端到端优化
  • 扎实的计算机系统基础,熟悉操作系统、Linux内核、容器、调度、资源隔离与性能分析
  • 网络与存储知识,熟悉TCP/IP、RDMA、RoCE、NCCL、分布式存储及I/O性能分析
  • 复杂问题解决能力,能结合日志、指标、trace、系统调用进行端到端分析
  • 工程化能力,通过工具化、自动化、可观测性建设沉淀系统性能力

申请策略

  • 关注蚂蚁集团技术博客和开源项目(如Kusionstack、SOFAStack),提前了解其技术栈文化
  • 准备一个典型的系统问题case,从现象到根因再到工程化解决,展现系统性思维
  • 突出系统底层项目经验:内核、容器、网络、存储相关的优化或稳定性工作
  • 强调大规模系统稳定性建设或性能优化案例,量化性能提升和故障改进效果
  • 如有NCCL/RDMA/eBPF等高性能计算经验,务必重点展现
  • 展示可观测性平台、自动化工具或SRE方法论的落地成果
  • 补充大模型训练链路知识,理解训练/推理框架(如PyTorch、DeepSpeed)与底层基础设施的交互
  • 学习eBPF、perf、gdb等性能分析工具,并深入理解Linux内核网络与存储栈

面试指南

  • 采用STAR法则(情境-任务-行动-结果)组织案例,突出个人角色和量化成果
  • 从系统视角分层分析:现象→指标→日志→代码→内核,层层递进定位根因
  • 强调工程化沉淀,不仅解决单点问题,还通过工具、平台或机制避免重复发生
  • 如何定位分布式训练中出现的通信慢或性能抖动问题?
  • 描述一次线上故障的完整root cause分析过程及后续治理措施
  • 如何设计一个大规模集群的可观测性系统?需要覆盖哪些维度?
  • RDMA和NCCL的工作原理是什么?在调优时有哪些关键参数和实践?
  • 面对大规模训练任务资源利用率低的情况,你会如何分析和优化?

职位点评

71
综合评分

大厂大模型基础设施,技术前沿薪资高,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术前沿和快速成长、不畏高强度挑战的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值75

薪资福利

70中等

蚂蚁集团作为大厂,薪资和福利通常具有竞争力,但JD未给出具体薪酬范围,补偿性满足程度中等偏上。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

85较高

大模型基础设施是前沿技术领域,涉及系统底层和AI结合,技术成长空间大,发展性动机能得到较好满足。

技术前沿前沿/新兴技术
技术栈大模型训练、推理、Linux内核、RDMA、NCCL、Kubernetes、eBPF、分布式存储
业务类型cost_center

工作生活

50较低

工作地点为杭州,需现场办公,JD未提及弹性工作或WLB政策,大厂SRE岗位通常节奏较快,生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

大模型基础设施是高速增长赛道,对AI产业发展有支撑作用,具备一定技术使命感,但岗位社会直接影响力中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs