Ant Group logo
蚂蚁集团
蚂蚁集团-AI模型平台技术专家/架构师-杭州/上海

蚂蚁集团-AI模型平台技术专家/架构师-杭州/上海

发布于 大约 1 小时前

普通员工/个人贡献者

上海市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
架构师
Kv Cache
Llm
Pytorch
Sglang
Vllm
分布式训练
多模态
推理优化
量化

AI 估算 · 60k–100k

互联网巨头核心技术岗,AI平台方向人才稀缺,薪资竞争力强,年终奖丰厚。

职位详情

关于这个职位

该职位负责蚂蚁集团AI模型平台核心能力建设,支撑大规模文本和多模态大模型的预训练、后训练与在线推理

你将参与训练推理基础设施架构设计,优化分布式训练与推理性能,并与算法团队协作将前沿模型能力平台化
适合具备扎实分布式系统和AI工程经验的工程师

最低要求

计算机基础扎实,熟悉 Linux、分布式系统、网络、存储、数据库、并发编程和常用算法,具备复杂系统设计和问题排查能力

精通 Python/Java/Golang/C++ 至少一门语言,具备良好的工程化实践,能够独立负责平台核心模块设计和落地
熟悉 LLM、VLM、Diffusion/Flow Matching 等模型的基本结构、训练范式、数据组织方式、前后训练和评测流程,能够理解算法目标并转化为平台能力
熟悉 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法或训练策略,有实际训练、调参、数据构造或平台化落地经验
熟悉 PyTorch、SGLang、vLLM 等模型训练与推理生态,具备分布式训练、推理服务部署、吞吐/时延优化、稳定性治理和 GPU 资源效率优化等模型工程经验
熟悉 LLM 推理系统核心技术,包括 KV Cache 管理、PagedAttention、量化(INT4/INT8/FP8)、Continuous Batching、Speculative Decoding、Tensor/Pipeline Parallelism 等,有推理服务性能优化和线上稳定性治理经验者优先
有多模态模型(VLM/图生视频/语音大模型等)推理服务落地经验,了解多模态输入的预处理 pipeline、异构计算调度与端到端延迟优化
或有大规模推理集群的容量规划、成本优化和 SLA 治理经验
具备平台产品意识、技术判断力和跨团队协作能力,能够面向算法研发用户抽象通用能力,建设稳定、易用、可扩展的模型研发平台,并在算法快速演进和工程复杂度之间做出合理架构取舍

工作职责

负责集团 AI 模型平台核心能力建设,支撑文本或多模态大模型的预训练、后训练、线上推理服务和自动化实验迭代等关键场景

面向自动化模型研发、推理和 AutoResearch 类场景,建设模型前后训练、推理、实验编排、结果分析、经验沉淀、策略推荐和下一轮实验规划能力,将模型研发和推理部署流程抽象为高效、稳定、可复用的平台能力
参与后训练平台能力建设,支持 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法和实验流程的工程化、平台化和自动化
面向重点业务的大模型推理平台建设,打造统一的在线推理服务能力,覆盖文本、多模态等模型类型
建设统一推理网关,支持模型版本管理、灰度发布、流量调度与多租户隔离
持续优化推理吞吐(TPS)和首 token 延迟(TTFT),保障线上服务 SLA
负责训练和推理基础设施的架构设计与核心技术攻坚,持续提升任务成功率、资源利用率、训练吞吐、推理性能和平台稳定性
与算法、业务团队深度协作,围绕 AutoResearch、模型前后训练和文本/多模态大规模推理等方向,将前沿模型算法、低延迟推理链路和研发流程沉淀为标准化平台能力,推动能力在多业务、多模型场景中复用

优先资格

有推理服务性能优化和线上稳定性治理经验者优先

AI 洞察

优缺点分析

优点

  • AI平台是当前最热门的技术方向,接触最前沿的大模型技术栈
  • 与顶级算法和工程团队合作,个人成长速度快
  • 对技术深度和广度要求高,需要同时掌握训练和推理优化
  • 大模型技术迭代快,需要持续学习和适应变化
  • 适合有深厚分布式系统和大模型工程经验,热衷于技术攻坚和平台建设的工程师

缺点 / 挑战

  • 蚂蚁集团提供大型互联网平台,业务场景复杂,技术挑战大
  • 平台建设需要跨团队协作,沟通成本较高

角色解读

  • 可成长为AI平台领域的技术专家,主导大规模分布式系统架构设计
  • 有机会深入大模型底层技术,向算法与工程复合型方向发展
  • 可晋升为技术管理岗位,带领团队建设平台能力
  • 负责集团AI模型平台核心能力建设,支撑大模型预训练、后训练和推理服务等关键场景
  • 设计并优化训练推理基础设施,包括分布式训练、推理网关、资源调度等,提升性能和稳定性
  • 与算法团队协作,将前沿模型算法和研发流程沉淀为标准化平台能力,推动多业务场景复用
  • 扎实的计算机基础,精通Python/Java/Golang/C++至少一门语言,具备复杂系统设计能力
  • 熟悉大模型(LLM/VLM等)结构和训练范式,了解SFT、PPO、DPO等后训练算法
  • 熟悉PyTorch、vLLM、SGLang等训练推理生态,具备分布式训练和推理性能优化经验

申请策略

  • 建议了解蚂蚁集团的AI战略和产业布局,在面试中展现对平台化的思考
  • 准备好讲述一个从零构建复杂系统的项目故事,突出架构决策和取舍
  • 突出在大模型训练/推理平台方面的项目经验,具体量化性能优化成果
  • 强调对分布式系统、底层通信和GPU优化的深入理解
  • 展示对算法原理的理解能力,例如对PPO、DPO等算法的实际应用
  • 补充学习vLLM、SGLang等主流推理框架的源码和架构
  • 熟悉KV Cache、量化等推理优化技术,尝试在真实场景中实践
  • 了解多模态模型的推理链路和异构计算调度

面试指南

  • 建议采用STAR法则(情境-任务-行动-结果)描述项目经验,突出技术难点和量化收益
  • 对于算法问题,结合具体业务场景说明你的理解
  • 请描述你在一个大型分布式训练系统中的角色和遇到的挑战
  • 你如何优化大模型推理服务的延迟和吞吐?请举例说明
  • 谈谈你对SFT、PPO、DPO等训练算法的理解和工程化经验
  • 在设计一个AI模型平台时,如何平衡算法灵活性和平台稳定性?
  • 请解释KV Cache和PagedAttention的原理及在推理中的作用
  • 复习大模型训练和推理的完整流程,包括数据预处理、模型并行策略

职位点评

74
综合评分

大厂AI平台核心架构岗,前沿技术栈与高薪资,但工作节奏快、WLB一般

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和职业成长,能接受高强度工作的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活55
使命价值70

薪资福利

75中等

大厂薪资水平较高,虽未披露具体数字,但技术专家岗位通常具有很强竞争力,且稳定性好。

薪资信号未披露(AI估算:60K-100K/月)

成长发展

90较高

该岗位处于AI大模型最前沿,技术栈新,挑战大,能快速积累分布式系统和大模型工程经验。

技术前沿前沿/新兴技术
技术栈LLM、PyTorch、vLLM、SGLang、分布式训练、推理优化、KV Cache、量化
业务类型ambiguous

工作生活

55较低

未提及工作弹性或WLB,大厂节奏通常较快,需要现场办公,可能面临较高工作强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI模型平台对行业有较大技术影响力,但岗位更偏技术实现,社会价值体现为支撑业务。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs