
蚂蚁集团
蚂蚁集团-AI模型平台技术专家/架构师-杭州/上海
蚂蚁集团-AI模型平台技术专家/架构师-杭州/上海
发布于 大约 1 小时前普通员工/个人贡献者
上海市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
架构师
Kv Cache
Llm
Pytorch
Sglang
Vllm
分布式训练
多模态
推理优化
量化
AI 估算 · 60k–100k
互联网巨头核心技术岗,AI平台方向人才稀缺,薪资竞争力强,年终奖丰厚。
职位详情
关于这个职位
该职位负责蚂蚁集团AI模型平台核心能力建设,支撑大规模文本和多模态大模型的预训练、后训练与在线推理
你将参与训练推理基础设施架构设计,优化分布式训练与推理性能,并与算法团队协作将前沿模型能力平台化
适合具备扎实分布式系统和AI工程经验的工程师
最低要求
计算机基础扎实,熟悉 Linux、分布式系统、网络、存储、数据库、并发编程和常用算法,具备复杂系统设计和问题排查能力
精通 Python/Java/Golang/C++ 至少一门语言,具备良好的工程化实践,能够独立负责平台核心模块设计和落地
熟悉 LLM、VLM、Diffusion/Flow Matching 等模型的基本结构、训练范式、数据组织方式、前后训练和评测流程,能够理解算法目标并转化为平台能力
熟悉 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法或训练策略,有实际训练、调参、数据构造或平台化落地经验
熟悉 PyTorch、SGLang、vLLM 等模型训练与推理生态,具备分布式训练、推理服务部署、吞吐/时延优化、稳定性治理和 GPU 资源效率优化等模型工程经验
熟悉 LLM 推理系统核心技术,包括 KV Cache 管理、PagedAttention、量化(INT4/INT8/FP8)、Continuous Batching、Speculative Decoding、Tensor/Pipeline Parallelism 等,有推理服务性能优化和线上稳定性治理经验者优先
有多模态模型(VLM/图生视频/语音大模型等)推理服务落地经验,了解多模态输入的预处理 pipeline、异构计算调度与端到端延迟优化
或有大规模推理集群的容量规划、成本优化和 SLA 治理经验
具备平台产品意识、技术判断力和跨团队协作能力,能够面向算法研发用户抽象通用能力,建设稳定、易用、可扩展的模型研发平台,并在算法快速演进和工程复杂度之间做出合理架构取舍
工作职责
负责集团 AI 模型平台核心能力建设,支撑文本或多模态大模型的预训练、后训练、线上推理服务和自动化实验迭代等关键场景
面向自动化模型研发、推理和 AutoResearch 类场景,建设模型前后训练、推理、实验编排、结果分析、经验沉淀、策略推荐和下一轮实验规划能力,将模型研发和推理部署流程抽象为高效、稳定、可复用的平台能力
参与后训练平台能力建设,支持 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法和实验流程的工程化、平台化和自动化
面向重点业务的大模型推理平台建设,打造统一的在线推理服务能力,覆盖文本、多模态等模型类型
建设统一推理网关,支持模型版本管理、灰度发布、流量调度与多租户隔离
持续优化推理吞吐(TPS)和首 token 延迟(TTFT),保障线上服务 SLA
负责训练和推理基础设施的架构设计与核心技术攻坚,持续提升任务成功率、资源利用率、训练吞吐、推理性能和平台稳定性
与算法、业务团队深度协作,围绕 AutoResearch、模型前后训练和文本/多模态大规模推理等方向,将前沿模型算法、低延迟推理链路和研发流程沉淀为标准化平台能力,推动能力在多业务、多模型场景中复用
优先资格
有推理服务性能优化和线上稳定性治理经验者优先
AI 洞察
优缺点分析
优点
- AI平台是当前最热门的技术方向,接触最前沿的大模型技术栈
- 与顶级算法和工程团队合作,个人成长速度快
- 对技术深度和广度要求高,需要同时掌握训练和推理优化
- 大模型技术迭代快,需要持续学习和适应变化
- 适合有深厚分布式系统和大模型工程经验,热衷于技术攻坚和平台建设的工程师
缺点 / 挑战
- 蚂蚁集团提供大型互联网平台,业务场景复杂,技术挑战大
- 平台建设需要跨团队协作,沟通成本较高
角色解读
- 可成长为AI平台领域的技术专家,主导大规模分布式系统架构设计
- 有机会深入大模型底层技术,向算法与工程复合型方向发展
- 可晋升为技术管理岗位,带领团队建设平台能力
- 负责集团AI模型平台核心能力建设,支撑大模型预训练、后训练和推理服务等关键场景
- 设计并优化训练推理基础设施,包括分布式训练、推理网关、资源调度等,提升性能和稳定性
- 与算法团队协作,将前沿模型算法和研发流程沉淀为标准化平台能力,推动多业务场景复用
- 扎实的计算机基础,精通Python/Java/Golang/C++至少一门语言,具备复杂系统设计能力
- 熟悉大模型(LLM/VLM等)结构和训练范式,了解SFT、PPO、DPO等后训练算法
- 熟悉PyTorch、vLLM、SGLang等训练推理生态,具备分布式训练和推理性能优化经验
申请策略
- 建议了解蚂蚁集团的AI战略和产业布局,在面试中展现对平台化的思考
- 准备好讲述一个从零构建复杂系统的项目故事,突出架构决策和取舍
- 突出在大模型训练/推理平台方面的项目经验,具体量化性能优化成果
- 强调对分布式系统、底层通信和GPU优化的深入理解
- 展示对算法原理的理解能力,例如对PPO、DPO等算法的实际应用
- 补充学习vLLM、SGLang等主流推理框架的源码和架构
- 熟悉KV Cache、量化等推理优化技术,尝试在真实场景中实践
- 了解多模态模型的推理链路和异构计算调度
面试指南
- 建议采用STAR法则(情境-任务-行动-结果)描述项目经验,突出技术难点和量化收益
- 对于算法问题,结合具体业务场景说明你的理解
- 请描述你在一个大型分布式训练系统中的角色和遇到的挑战
- 你如何优化大模型推理服务的延迟和吞吐?请举例说明
- 谈谈你对SFT、PPO、DPO等训练算法的理解和工程化经验
- 在设计一个AI模型平台时,如何平衡算法灵活性和平台稳定性?
- 请解释KV Cache和PagedAttention的原理及在推理中的作用
- 复习大模型训练和推理的完整流程,包括数据预处理、模型并行策略
职位点评
74
综合评分
大厂AI平台核心架构岗,前沿技术栈与高薪资,但工作节奏快、WLB一般
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和职业成长,能接受高强度工作的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活55
使命价值70
薪资福利
75中等
大厂薪资水平较高,虽未披露具体数字,但技术专家岗位通常具有很强竞争力,且稳定性好。
薪资信号未披露(AI估算:60K-100K/月)
成长发展
90较高
该岗位处于AI大模型最前沿,技术栈新,挑战大,能快速积累分布式系统和大模型工程经验。
技术前沿前沿/新兴技术
技术栈LLM、PyTorch、vLLM、SGLang、分布式训练、推理优化、KV Cache、量化
业务类型ambiguous
工作生活
55较低
未提及工作弹性或WLB,大厂节奏通常较快,需要现场办公,可能面临较高工作强度。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI模型平台对行业有较大技术影响力,但岗位更偏技术实现,社会价值体现为支撑业务。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs