
蚂蚁集团
蚂蚁集团-大模型评测测试开发工程师-杭州/北京
蚂蚁集团-大模型评测测试开发工程师-杭州/北京
发布于 大约 8 小时前普通员工/个人贡献者
北京市 / 杭州市
中级经验
全职员工
仅现场办公
学历未注明
测试开发
CI/CD
Go
分布式系统
大模型评测
故障注入
自动化测试
质量工程
Agentic评测
AI 估算 · 35k–60k
大厂核心基建岗位,技术含量高,大模型评测领域稀缺,薪资具备竞争力。
职位详情
关于这个职位
该职位负责建设大模型评测的质量工程体系,包括自动化测试框架、评测可信度验证、故障注入与稳定性测试等,与研发和评测团队协作,确保评测系统稳定可靠
适合具备扎实编码能力、熟悉分布式系统与CI/CD、对LLM评测有浓厚兴趣的测试开发工程师
最低要求
【研发与系统设计】具备扎实的计算机基础、编码能力和系统设计能力,熟练掌握 Java、Go、Python 等至少一种主流开发语言,能够独立设计和开发测试框架、平台及工程工具
【质量工程】熟悉自动化测试和持续交付体系,对单元测试、契约测试、集成测试、端到端测试、回归测试以及 CI/CD 的设计和实践有深入理解
【分布式系统】熟悉服务治理、消息与事件、状态管理、幂等、重试、并发控制、数据一致性和故障恢复等常见机制,能够针对复杂系统设计有效的验证方案
【质量分析与诊断】具备较强的质量分析和复杂问题定位能力,能够结合代码、日志、监控、运行状态和上下游依赖还原故障现场,并善于通过自动化、故障注入和数据对比发现静默错误与系统性风险
【学习与协作】具备快速学习能力和持续的技术热情,对复杂工程问题保持好奇心和主动性
具备良好的沟通协作能力,能够与研发、评测、模型及基础设施团队共同定义质量标准并推动落地
【加分项】有测试开发、质量平台、工作流或调度系统、机器学习平台、模型训练推理、LLM / Agent 评测或开源 Benchmark 工程化经验者优先
工作职责
负责大模型评测质量工程体系的设计与建设,搭建覆盖单元、契约、集成、端到端和跨版本回归的自动化测试框架,并将关键质量检查接入 CI/CD,形成高效、可解释的发布门禁
建设评测可信度验证能力,围绕模型、Benchmark、Judge、数据、代码、镜像和运行环境建立测试基线与兼容性矩阵,通过差异检测和受控变量验证评测结果可复现、可比较、可追溯
面向大规模、长链路和 Agentic 评测场景,建设故障注入、任务回放和稳定性测试能力,验证任务编排、状态一致性、幂等、失败隔离、断点恢复和结果完整性等关键系统机制
与研发、评测专家和基础设施团队共同定义质量标准,深入参与技术方案评审、测试设计、灰度发布和线上质量分析
基于真实运行数据识别系统性风险,推动问题闭环并沉淀可复用的质量能力
优先资格
有测试开发、质量平台、工作流或调度系统、机器学习平台、模型训练推理、LLM / Agent 评测或开源 Benchmark 工程化经验者优先
AI 洞察
优缺点分析
优点
- 岗位处于基础设施关键位置,对个人技术视野和影响力提升有帮助
- 技术栈主流,可积累自动化、分布式系统、AI评测等多维技能
- 大模型评测领域尚在早期,需要应对快速变化的需求和技术不确定性
- 对综合能力要求高,需同时具备编码、系统设计和质量分析能力
缺点 / 挑战
- 蚂蚁集团平台大,技术挑战高,能接触最前沿的大模型评测场景
- 可能面临跨团队协作压力,需要较强的沟通和推动能力
- 适合技术功底扎实、对质量保障有热情、喜欢挑战复杂系统问题,并希望深入AI基础设施领域的工程师
角色解读
- 深耕大模型评测领域,成为质量工程专家,主导评测基础设施演进
- 横向拓展至AI平台、LLM应用开发等方向,转型为测试架构师或研发专家
- 向技术管理方向发展,带领质量保障团队,负责更大范围的技术决策
- 设计并搭建大模型评测的自动化测试框架,覆盖从单元到端到端的全链路质量保障
- 建设评测可信度验证体系,确保模型、数据、代码等环节的稳定性与可追溯性
- 针对Agentic等复杂评测场景,实施故障注入、压力测试和稳定性验证
- 与研发、评测和基础设施团队协作,制定质量标准并推动质量改进闭环
- 精通Java、Go、Python中至少一种语言,能独立开发测试框架和工具
- 深入理解自动化测试、CI/CD持续交付体系及各类测试方法
- 熟悉分布式系统的关键机制,如幂等、重试、一致性、故障恢复等
- 具备良好的问题定位能力和质量分析能力,善于用数据驱动改进
申请策略
- 了解蚂蚁集团技术文化和质量体系关注点
- 在简历中强调对评测可信度和可复现性的理解
- 突出测试开发或质量平台项目经验,展示设计自动化框架的能力
- 强调对分布式系统机制(如幂等、一致性)有实战验证案例
- 如有大模型评测或AI平台相关经验,单独列出并说明具体成果
- 展示编程能力,例如GitHub高质量项目或技术博客
- 补充LLM评测相关知识,了解Benchmark、Judge等概念
- 学习主流CI/CD工具(如Jenkins、GitLab CI)及云原生测试实践
面试指南
- 从问题定义、方案设计、实施过程和效果验证四步骤展开,强调数据驱动
- 结合具体技术细节,如使用消息重试、状态机、隔离机制等,体现深度
- 突出团队协作和闭环思维,展示你如何推动落地和沉淀
- 如何设计一个针对大模型评测平台的自动化测试框架?
- 请举例说明你如何用故障注入发现系统潜在问题
- 在分布式系统中,如何验证幂等性和数据一致性?
- 如何评估评测结果的可信度和准确性?
- 请描述一个你推动跨团队质量改进的案例
职位点评
70
综合评分
头部大厂、前沿技术栈、强技术成长性,工作强度未知但平台价值高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合以技术成长为核心驱动力,对前沿AI基础设施充满热情,能接受快节奏工作的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活45
使命价值65
薪资福利
70中等
薪资未在JD中披露,但蚂蚁集团作为头部大厂,薪酬竞争力较强,福利体系完善。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
90较高
大模型评测是前沿领域,技术挑战大,能有效提升个人在质量工程和AI基础设施方向的能力,成长空间广阔。
技术前沿前沿/新兴技术
技术栈大模型评测、质量工程、自动化测试、CI/CD、分布式系统、故障注入、Agentic评测、Java、Go、Python
业务类型ambiguous
工作生活
45较低
工作地点在北京或杭州,未提及弹性或远程办公,互联网大厂节奏可能较快,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
评测是AI发展的关键基础设施,能推动行业健康发展,具有一定的社会价值,使命感中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs