Ant Group logo
蚂蚁集团
蚂蚁数字科技-数字科技线-大模型训推引擎工程师

蚂蚁数字科技-数字科技线-大模型训推引擎工程师

发布于 大约 3 小时前

普通员工/个人贡献者

北京市 / 上海市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Agentic Rl
Cuda
Deepspeed
Gpu编程
Megatron-Lm
Nccl
Rlhf
Sglang
Vllm

AI 估算 · 35k–60k

大厂核心AI岗位,技术门槛高,薪资竞争力强,参考一线城市大模型工程师市场行情。

职位详情

关于这个职位

加入蚂蚁集团数字科技线,作为大模型训推引擎工程师,你将负责大规模分布式训练与推理系统的设计与优化,包括混合并行策略调优、推理服务部署与量化落地、Agentic RL 沙箱环境搭建等,与顶尖团队共同推动大模型技术的工程化应用

最低要求

编程功底:熟练掌握 Python / C++,有 GPU 编程(CUDA / Triton)或分布式系统实战经验优先

框架深度:对 Megatron-LM / DeepSpeed / vLLM / SGLang 中至少一项有源码级理解,而非停留在配置层面
协作与 Ownership:能向下扎到代码细节,也能向上对齐目标,作为多团队间的技术枢纽把事推动落地

工作职责

按方向划分,你将承担以下职责中一项或多项:

分布式训练方向:
(1)设计并调优大规模混合并行策略(TP/PP/DP/EP/CP 组合方案),持续提升集群 MFU
(2)做训练性能 profiling 与全链路瓶颈攻坚,扛起训练稳定性终极排查(NCCL 超时、梯度异常、显存泄漏)
(3)对 Megatron-LM / DeepSpeed 等训练框架做深度适配、魔改与 bug 修复,主导 mid-train 阶段的分布式方案设计与执行,与基座模型团队做核心技术对接
推理服务方向:
(1)负责推理服务搭建与维护(vLLM / SGLang 部署、升级、深度调优)
(2)推进批量推理优化与量化方案落地,在精度与吞吐之间找到商业最优解
(3)建设 Checkpoint 管理与模型格式转换工具链,作为基模与算法团队之间的桥接层,提供日常 infra 支持
Agentic RL 沙箱方向:
(1)从 0 到 1 搭建 Agentic RL 训练的沙箱环境基建,做多团队协作的技术枢纽
(2)设计标准化的环境接口(observation / action / reward),保障沙箱的隔离性、容错与资源管控
(3)优化沙箱吞吐与延迟,持续接入新工具与新环境
大模型训练参与方向:
(1)负责专项数据合成,为模型训练提供高质量数据燃料
(2)参与专项能力优化与模型训练,把引擎能力转化为真实的模型能力提升

优先资格

万卡级集群训练经验

开源框架贡献
Agentic RL / RLHF 训练系统落地经验

AI 洞察

优缺点分析

优点

  • 前沿技术栈:接触大模型训练/推理最核心的分布式系统、量化、RLHF 等热点技术
  • 大厂平台:蚂蚁集团提供海量算力资源、真实业务场景和顶尖技术团队
  • 高成长性:AI Infra 方向人才稀缺,职业发展空间广阔,薪资涨幅可期
  • 技术影响力:优化万卡集群效率或成为开源贡献者,可沉淀行业级成果
  • 技术难度高:需要深入理解分布式系统、GPU 编程和深度学习框架源码,学习曲线陡峭
  • 工作强度大:大模型竞赛激烈,项目周期紧,可能面临长时间攻坚和倒班排查
  • 适合对底层系统性能充满热情、喜欢解决复杂分布式难题、追求技术极致的工程师,能承受高强度并享受技术突破成就感

缺点 / 挑战

  • 竞争压力:顶尖人才汇聚,内部晋升需持续输出高价值成果

角色解读

  • 技术专家方向:深耕大模型训练/推理系统,成为分布式计算或 AI Infra 领域的权威
  • 技术管理方向:带领团队负责大模型引擎架构,逐步向技术总监或架构师发展
  • 产品化方向:将引擎能力封装为平台产品,转向 AI 平台产品经理或架构师
  • 设计并调优大规模分布式训练策略(TP/PP/DP/EP/CP组合),提升集群效率与稳定性
  • 负责推理服务搭建、调优与量化落地,在精度与吞吐之间取得商业最优解
  • 从零搭建 Agentic RL 训练沙箱环境,设计标准接口并优化资源管控
  • 参与专项数据合成与模型训练,将引擎能力转化为实际模型提升
  • 精通 Python 和 C++,具备 GPU 编程经验(CUDA/Triton)或分布式系统实战经验
  • 对 Megatron-LM / DeepSpeed / vLLM / SGLang 至少一项有源码级理解
  • 具备出色的协作与 Ownership,能深入技术细节也能推动跨团队落地

申请策略

  • 在面试中准备一个完整的大模型训练/推理案例,从问题分析到方案落地,体现系统性思考
  • 了解蚂蚁在 AI Infra 领域的布局(如 AntLLM、AI 平台),在交流中表达你的技术热情和匹配度
  • 突出分布式训练或推理优化的实战项目,详细描述你如何调优并行策略、解决稳定性问题
  • 展示对 Megatron-LM / DeepSpeed / vLLM 等框架的源码级理解,最好附上阅读笔记或修改点
  • 强调 GPU 编程经验(CUDA/Triton),尤其是性能优化(kernel fusion、显存管理)相关成果
  • 如果有开源贡献,列出具体 PR 或 issue,凸显技术影响力
  • 深入学习 Megatron-LM 的并行策略(TP/PP/DP/EP)源码,尝试构建小规模实验
  • 熟悉 vLLM 的推理调度和 PagedAttention 机制,了解量化方法(GPTQ、AWQ)

面试指南

  • 对于训练/推理优化类问题:先明确目标指标(MFU/吞吐/延迟),然后分析瓶颈(计算/通信/显存),提出具体策略(并行度调整、算子优化、量化)并给出实验对比
  • 对于故障排查类问题:描述系统性排查步骤——从日志、监控、profiling 工具定位
  • 复现问题
  • 逐个假设验证
  • 根因分析
  • 给出长期改进方案
  • 对于协作类问题:突出你如何沟通技术方案、设定里程碑、推动多方共识,并举例说明在冲突时的决策逻辑
  • 如何设计千卡级分布式训练策略?请具体说明 TP、PP、DP 的权衡与组合

职位点评

76
综合评分

大厂核心AI岗位,前沿技术栈,高薪酬,但工作强度较高

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合极度追求技术成长、愿意投入时间在AI Infra前沿的求职者,能接受较高工作强度并看重长期职业回报。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值85

薪资福利

80较高

该职位来自头部大厂,虽未在JD中明示薪资,但行业惯例提供有竞争力的薪酬和福利【未在JD中体现,评分基于公司背景】。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

95较高

岗位涵盖大模型训练、推理、Agentic RL等前沿技术,技术栈新且深度大,能极大提升个人核心竞争力。

技术前沿前沿/新兴技术
技术栈Megatron-LM、DeepSpeed、vLLM、SGLang、CUDA、Triton、Agentic RL、RLHF、混合并行
业务类型profit_center

工作生活

40较低

JD未明确工作模式与加班情况,但大厂核心研发岗位通常以现场办公为主,工作强度较大,灵活性一般。

工作模式未明确
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

85较高

大模型是当前高速增长赛道,岗位直接参与核心技术研发,技术影响力大,但社会价值角度较为中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs