
蚂蚁集团
蚂蚁数字科技-数字科技线-大模型训推引擎工程师
蚂蚁数字科技-数字科技线-大模型训推引擎工程师
发布于 大约 3 小时前普通员工/个人贡献者
北京市 / 上海市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Agentic Rl
Cuda
Deepspeed
Gpu编程
Megatron-Lm
Nccl
Rlhf
Sglang
Vllm
AI 估算 · 35k–60k
大厂核心AI岗位,技术门槛高,薪资竞争力强,参考一线城市大模型工程师市场行情。
职位详情
关于这个职位
加入蚂蚁集团数字科技线,作为大模型训推引擎工程师,你将负责大规模分布式训练与推理系统的设计与优化,包括混合并行策略调优、推理服务部署与量化落地、Agentic RL 沙箱环境搭建等,与顶尖团队共同推动大模型技术的工程化应用
最低要求
编程功底:熟练掌握 Python / C++,有 GPU 编程(CUDA / Triton)或分布式系统实战经验优先
框架深度:对 Megatron-LM / DeepSpeed / vLLM / SGLang 中至少一项有源码级理解,而非停留在配置层面
协作与 Ownership:能向下扎到代码细节,也能向上对齐目标,作为多团队间的技术枢纽把事推动落地
工作职责
按方向划分,你将承担以下职责中一项或多项:
分布式训练方向:
(1)设计并调优大规模混合并行策略(TP/PP/DP/EP/CP 组合方案),持续提升集群 MFU
(2)做训练性能 profiling 与全链路瓶颈攻坚,扛起训练稳定性终极排查(NCCL 超时、梯度异常、显存泄漏)
(3)对 Megatron-LM / DeepSpeed 等训练框架做深度适配、魔改与 bug 修复,主导 mid-train 阶段的分布式方案设计与执行,与基座模型团队做核心技术对接
推理服务方向:
(1)负责推理服务搭建与维护(vLLM / SGLang 部署、升级、深度调优)
(2)推进批量推理优化与量化方案落地,在精度与吞吐之间找到商业最优解
(3)建设 Checkpoint 管理与模型格式转换工具链,作为基模与算法团队之间的桥接层,提供日常 infra 支持
Agentic RL 沙箱方向:
(1)从 0 到 1 搭建 Agentic RL 训练的沙箱环境基建,做多团队协作的技术枢纽
(2)设计标准化的环境接口(observation / action / reward),保障沙箱的隔离性、容错与资源管控
(3)优化沙箱吞吐与延迟,持续接入新工具与新环境
大模型训练参与方向:
(1)负责专项数据合成,为模型训练提供高质量数据燃料
(2)参与专项能力优化与模型训练,把引擎能力转化为真实的模型能力提升
优先资格
万卡级集群训练经验
开源框架贡献
Agentic RL / RLHF 训练系统落地经验
AI 洞察
优缺点分析
优点
- 前沿技术栈:接触大模型训练/推理最核心的分布式系统、量化、RLHF 等热点技术
- 大厂平台:蚂蚁集团提供海量算力资源、真实业务场景和顶尖技术团队
- 高成长性:AI Infra 方向人才稀缺,职业发展空间广阔,薪资涨幅可期
- 技术影响力:优化万卡集群效率或成为开源贡献者,可沉淀行业级成果
- 技术难度高:需要深入理解分布式系统、GPU 编程和深度学习框架源码,学习曲线陡峭
- 工作强度大:大模型竞赛激烈,项目周期紧,可能面临长时间攻坚和倒班排查
- 适合对底层系统性能充满热情、喜欢解决复杂分布式难题、追求技术极致的工程师,能承受高强度并享受技术突破成就感
缺点 / 挑战
- 竞争压力:顶尖人才汇聚,内部晋升需持续输出高价值成果
角色解读
- 技术专家方向:深耕大模型训练/推理系统,成为分布式计算或 AI Infra 领域的权威
- 技术管理方向:带领团队负责大模型引擎架构,逐步向技术总监或架构师发展
- 产品化方向:将引擎能力封装为平台产品,转向 AI 平台产品经理或架构师
- 设计并调优大规模分布式训练策略(TP/PP/DP/EP/CP组合),提升集群效率与稳定性
- 负责推理服务搭建、调优与量化落地,在精度与吞吐之间取得商业最优解
- 从零搭建 Agentic RL 训练沙箱环境,设计标准接口并优化资源管控
- 参与专项数据合成与模型训练,将引擎能力转化为实际模型提升
- 精通 Python 和 C++,具备 GPU 编程经验(CUDA/Triton)或分布式系统实战经验
- 对 Megatron-LM / DeepSpeed / vLLM / SGLang 至少一项有源码级理解
- 具备出色的协作与 Ownership,能深入技术细节也能推动跨团队落地
申请策略
- 在面试中准备一个完整的大模型训练/推理案例,从问题分析到方案落地,体现系统性思考
- 了解蚂蚁在 AI Infra 领域的布局(如 AntLLM、AI 平台),在交流中表达你的技术热情和匹配度
- 突出分布式训练或推理优化的实战项目,详细描述你如何调优并行策略、解决稳定性问题
- 展示对 Megatron-LM / DeepSpeed / vLLM 等框架的源码级理解,最好附上阅读笔记或修改点
- 强调 GPU 编程经验(CUDA/Triton),尤其是性能优化(kernel fusion、显存管理)相关成果
- 如果有开源贡献,列出具体 PR 或 issue,凸显技术影响力
- 深入学习 Megatron-LM 的并行策略(TP/PP/DP/EP)源码,尝试构建小规模实验
- 熟悉 vLLM 的推理调度和 PagedAttention 机制,了解量化方法(GPTQ、AWQ)
面试指南
- 对于训练/推理优化类问题:先明确目标指标(MFU/吞吐/延迟),然后分析瓶颈(计算/通信/显存),提出具体策略(并行度调整、算子优化、量化)并给出实验对比
- 对于故障排查类问题:描述系统性排查步骤——从日志、监控、profiling 工具定位
- 复现问题
- 逐个假设验证
- 根因分析
- 给出长期改进方案
- 对于协作类问题:突出你如何沟通技术方案、设定里程碑、推动多方共识,并举例说明在冲突时的决策逻辑
- 如何设计千卡级分布式训练策略?请具体说明 TP、PP、DP 的权衡与组合
职位点评
76
综合评分
大厂核心AI岗位,前沿技术栈,高薪酬,但工作强度较高
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合极度追求技术成长、愿意投入时间在AI Infra前沿的求职者,能接受较高工作强度并看重长期职业回报。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值85
薪资福利
80较高
该职位来自头部大厂,虽未在JD中明示薪资,但行业惯例提供有竞争力的薪酬和福利【未在JD中体现,评分基于公司背景】。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
95较高
岗位涵盖大模型训练、推理、Agentic RL等前沿技术,技术栈新且深度大,能极大提升个人核心竞争力。
技术前沿前沿/新兴技术
技术栈Megatron-LM、DeepSpeed、vLLM、SGLang、CUDA、Triton、Agentic RL、RLHF、混合并行
业务类型profit_center
工作生活
40较低
JD未明确工作模式与加班情况,但大厂核心研发岗位通常以现场办公为主,工作强度较大,灵活性一般。
工作模式未明确
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
85较高
大模型是当前高速增长赛道,岗位直接参与核心技术研发,技术影响力大,但社会价值角度较为中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
微信-后台开发高级工程师-机器学习工程方向
腾讯 · 广州市AI 估算 · 25k-45k广告算法实习生
知乎 · 北京市AI 估算 · 4k-8k2026 Shanghai Machine Learning Modelling Engineer Internship, PhD
澳蒂华 · 上海市AI 估算 · 15k-25kSenior Machine Learning Engineer
澳蒂华 · 上海市AI 估算 · 40k-70kAI Application Development Intern
联想 · 中国台湾, Taipei City, 中山(Zhongshan)AI 估算 · 3k-5k
Watch Jobs