
蚂蚁集团
蚂蚁集团-大模型评测基础设施研发工程师 / 技术专家-杭州/北京
蚂蚁集团-大模型评测基础设施研发工程师 / 技术专家-杭州/北京
发布于 大约 8 小时前普通员工/个人贡献者
北京市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Go
任务编排
分布式系统
可观测性
大模型
机器学习平台
状态机
评测基础设施
AI 估算 · 30k–60k
大模型赛道火热,蚂蚁集团为巨头公司,该岗位要求资深技术专家,薪资具有竞争力,综合市场水平估算。
职位详情
关于这个职位
这个职位负责建设大模型评测基础设施,将模型能力评估、短板发现和迭代验证连接成高效工程闭环,直接服务模型和Agent的研发过程
你将接触评测资产、任务编排、算力调度等核心系统,并与模型、产品团队紧密协作,适合对AI基础设施有热情的工程师
最低要求
【工程与平台基础】具备扎实的计算机基础、编码能力和后端系统设计能力,熟练掌握 Java、Go、Python 等至少一种主流开发语言
有复杂平台或基础设施建设经验
【分布式系统】熟悉状态机、任务编排、服务治理、消息与事件、幂等、重试、并发控制、数据一致性、故障隔离和恢复等常见机制,并有生产环境落地经验
【交付与架构抽象】能够独立完成复杂模块的需求分析、技术设计、开发上线和持续治理,并从具体需求中抽象可复用机制
技术专家候选人还需具备领域建模、整体架构设计和大型存量系统渐进式重构经验
【工程深度与质量】具备较强的工程动手、质量保障和复杂问题定位能力,重视接口契约、代码可维护性、版本治理、自动化测试、可观测性和线上稳定性
能够深入代码和运行链路还原并闭环复杂故障
【学习与协作】具备快速学习能力和持续的技术热情,对复杂工程问题保持好奇心和主动性
具备良好的沟通协作能力,能够推动跨团队完成方案对齐和交付
技术专家候选人还需能够通过技术影响力牵引关键决策和系统演进
工作职责
建设支撑大模型研发与进化的下一代评测基础设施,将模型能力评估、短板发现、迭代验证和发版决策连接为高效、可信的工程闭环,直接服务模型和 Agent 的研发过程
面向模型、Agent 和智能应用,建设评测资产、评测生命周期和可信证据链,把复杂的模型版本、Benchmark、Judge、执行环境和评测口径沉淀为稳定、可复用的系统能力,使评测结论可复现、可比较、可解释、可追溯
面向大规模、长链路和 Agentic 评测的新挑战,连接执行框架、算力调度、模型服务、Judge、工具及交互环境,建设可靠的任务编排、故障恢复和可观测能力,支撑新模型、新 Benchmark 和新评测形态快速接入
深入模型研发和评测一线,与模型、评测、产品及基础设施团队共同定义问题并完成端到端交付
从真实问题出发持续改善评测效率和可信度,并推动局部解法沉淀为长期可复用的技术能力
优先资格
有工作流或调度系统、机器学习平台、数据平台、可观测系统、大规模任务平台、模型训练推理、大模型或 Agent 评测、开源 Benchmark 工程化经验者优先
AI 洞察
优缺点分析
优点
- 身处AI核心赛道,大模型评测是刚需,岗位重要性和稀缺性高
- 蚂蚁集团技术实力强,能接触到大规模分布式系统和前沿AI工程实践
- 团队协作广泛,与模型、产品、基础设施等多团队合作,成长空间大
- 技术栈复杂,需要同时掌握分布式系统、机器学习平台和大模型评测领域知识
- 评测标准和技术形态快速迭代,需要持续学习和适应变化
- 适合对AI基础设施有浓厚兴趣、具备分布式系统背景、乐于解决复杂工程问题的后端工程师
缺点 / 挑战
- 工作强度可能较高,涉及线上稳定性保障和紧急故障排除
角色解读
- 技术深度:从工程师成长为技术专家,主导评测系统架构演进
- 跨域扩展:接触大模型训练、推理、Agent等前沿领域,成为AI基础设施专家
- 管理方向:未来可转向技术管理,带领团队攻克系统性难题
- 设计并实现大模型评测基础设施,包括评测资产、任务编排、算力调度等核心系统
- 与模型研发、评测、产品团队协作,将复杂评测流程工程化,确保评测结果可复现、可追溯
- 支撑大规模、长链路和Agentic评测,解决任务编排、故障恢复和可观测性等挑战
- 扎实的后端开发能力,精通Java、Go、Python之一,具备复杂平台建设经验
- 深入理解分布式系统,掌握状态机、任务编排、服务治理等机制并有实战经验
- 较强的工程能力和质量意识,能够独立完成模块设计、开发、测试和运维
申请策略
- 在简历中体现你对工程质量的高度重视,如代码可维护性、自动化测试、可观测性等方面的实践
- 关注蚂蚁集团的技术博客和开源项目,了解其技术栈和工程文化,面试时展示共鸣
- 突出你负责过的大型平台或基础设施项目,强调系统设计、架构抽象和工程落地能力
- 详细描述你在分布式系统方面的实战经验,如任务编排、状态机、数据一致性等
- 如果有大模型、机器学习平台或评测相关经验,务必重点展示
- 学习主流大模型评测框架(如MMLU、GSM8K)和Agent评测方法,提前了解领域知识
- 熟悉工作流引擎(如Airflow、Temporal)或机器学习平台组件
面试指南
- 系统设计类:明确需求(功能/非功能)→ 划分模块 → 关键设计(数据流/状态机/容错)→ 权衡与取舍
- 故障排查类:复现问题 → 定位根因(日志/监控/链路)→ 提出修复方案 → 防止复发措施
- 如何设计一个可扩展的大模型评测平台?请画出架构图并说明关键设计决策
- 在分布式任务调度中,如何保证任务在节点故障时可靠执行?请结合具体机制说明
- 如何确保评测结果的可复现性和可比较性?你会怎么设计证据链?
- 描述一个你曾解决的复杂工程问题,包括问题分析、方案设计和最终效果
- 复习分布式系统核心知识:CAP理论、一致性协议、任务编排模式、幂等性设计
- 准备1-2个你主导的系统设计案例,能用白板讲清架构和决策依据
职位点评
70
综合评分
蚂蚁大模型评测基础设施岗,前沿技术栈、高成长性,但现场办公且WLB信号弱。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长、渴望参与AI基础设施建设的工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展88
工作生活50
使命价值78
薪资福利
65中等
薪资未在JD中披露,但蚂蚁集团作为大厂,薪资福利通常有竞争力,且该岗位为资深职位,能满足基本补偿需求。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
88较高
该岗位涉及大模型、分布式系统等前沿技术,学习机会多;JD强调'推动局部解法沉淀为长期可复用技术能力',成长空间大。
技术前沿前沿/新兴技术
技术栈大模型、分布式系统、任务编排、状态机、Agent、Benchmark、可观测性
业务类型ambiguous
工作生活
50较低
工作地点为杭州/北京,现场办公,JD未提及弹性工作或WLB相关福利,推测为常规工作模式。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
78中等
大模型行业处于高速增长期,该岗位直接赋能模型能力迭代,具有较强技术价值和社会影响力。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs