Ant Group logo
蚂蚁集团
蚂蚁集团-AI质量评测工程师-杭州/北京

蚂蚁集团-AI质量评测工程师-杭州/北京

发布于 大约 3 小时前

普通员工/个人贡献者

杭州市 / 北京市
中级经验
全职员工
仅现场办公
学历未注明
质量保证
人工智能
大模型评测
测试开发
自动化测试
质量保障

AI 估算 · 25k–45k

AI质量评测岗位技术要求全面,蚂蚁集团薪资水平较高,杭州/北京两地均处于互联网高薪区间,市场行情看好。

职位详情

关于这个职位

这是一份蚂蚁集团的AI质量评测工程师岗位,主要参与大模型、智能体及业务系统的评测与测试体系建设

你将负责设计评测任务、构建自动化测试框架,并与研发、算法等团队协作推动质量闭环
适合对AI测试和自动化方向有浓厚兴趣的测试工程师

最低要求

熟悉软件测试基础方法,具备测试用例设计、接口测试、集成测试、回归测试等经验,有白盒测试经验更佳

熟悉 Linux 操作系统,具备一定的问题排查、日志分析和脚本编写能力
熟悉 Java 或其他至少一种主流编程语言,了解常见开发框架,熟悉 Shell / Python / Ruby / Perl 等脚本语言之一优先
对软件工程、服务端架构、接口设计、数据一致性、质量风险有基本理解,能够参与需求分析和技术方案评审
对 AI 测试、模型评测、Agent、RAG、Prompt、自动化评估等方向有兴趣,愿意学习并参与相关能力建设
具备良好的沟通能力、团队协作能力和问题推进意识,能够与产品、研发、算法、测试等角色高效协作

工作职责

参与大模型、Agent、AITesting 等场景的评测体系建设,包括评测任务设计、指标定义、评测集构建、自动化评测和结果分析

参与 AI 测试能力建设,包括测分 / 用例生成、接口测试、服务端测试、端到端测试、回归测试、日志 / DB / 接口校验、测试报告等能力落地
结合业务需求和技术方案,完成测试计划制定、用例设计、测试执行、问题定位、回归验证和质量风险评估
基于评测和测试结果,分析模型、Agent、工具链路或业务系统中的问题,推动优化闭环,提升 AI 应用效果和业务交付质量
参与测试工具、自动化框架、评测平台、质量看板等工程能力建设,提升测试效率、覆盖率和问题发现能力
与产品、研发、算法、测试、业务团队协作,推动问题定位、修复和持续改进,保障核心业务链路质量

优先资格

有大模型评测、LLM-as-a-Judge、Agent 评测、RAG 评测、自动化评测平台建设经验

有 AITesting、测试用例自动生成、接口自动化、服务端自动化、端到端自动化测试经验
有金融、支付、信贷、风控、营销等复杂业务系统测试经验
有质量平台、测试工具、数据构造、Mock、日志 / DB 校验、线上核对、防线监控建设经验
有 Java 服务端开发、测试开发、CI/CD、DevOps 或大型分布式系统质量保障经验
有较强的数据分析、问题归因、评测集构建、难例沉淀和效果闭环意识

AI 洞察

优缺点分析

优点

  • 身处AI前沿赛道,参与大模型与智能体评测,技术积累含金量高
  • 蚂蚁集团平台大、资源丰富,能接触到复杂业务场景与海量数据
  • 岗位复合性强,技能栈(测试+AI+开发)带来更宽的职业发展空间
  • 涉及业务系统与AI模型双重质量保障,问题定位可能较复杂
  • 适合对AI测试充满热情、技术栈全面、乐于在复杂系统中解决难题的测试工程师

缺点 / 挑战

  • AI技术迭代快,需要持续学习新模型和评估方法,学习压力较大
  • 跨团队协作频繁,沟通成本较高,需具备较强的推进能力

角色解读

  • 向AI测试专家或质量架构师方向发展,成为大模型评测领域的资深技术人才
  • 横向拓展到测试开发、平台工程或DevOps,参与更广泛的质量保障体系建设
  • 有机会转型为AI产品经理或技术管理,结合业务理解与AI能力推动创新
  • 设计并落地大模型、Agent等AI场景的评测体系,包括指标定义、评测集构建与自动化评测
  • 建设AI测试能力,实现测试用例自动生成、接口测试、回归测试等自动化工具和框架
  • 根据业务需求制定测试计划,执行测试并分析结果,推动问题定位与质量闭环
  • 与产品、研发、算法等多团队协作,保障核心业务链路的质量与交付效率
  • 扎实的软件测试基础,熟悉接口测试、集成测试、回归测试及白盒测试方法
  • 精通Java或至少一种主流编程语言,同时具备Shell/Python等脚本能力
  • 了解大模型、Agent、RAG等AI技术方向,对模型评测和自动化评估有浓厚兴趣
  • 良好的沟通与协作能力,能够在跨团队环境中推进问题解决

申请策略

  • 了解蚂蚁的AI业务方向(如支付、金融、智能客服),在面试中展示业务理解
  • 准备一个完整的项目案例:从测试计划到自动化实现,再到问题闭环的过程
  • 突出AI相关测试或评测经验,如大模型评估、Agent测试等
  • 强调自动化测试能力,包括自建框架、工具平台或CI/CD集成经验
  • 展示Java编程能力与系统设计思路,特别是服务端或分布式系统经验
  • 补充大模型评测基础知识,如LLM-as-a-Judge、RAG评估方法
  • 练习使用主流测试工具(如JUnit、Selenium)与性能测试工具(如JMeter)
  • 深入学习Linux系统与Shell脚本,提升问题排查效率

面试指南

  • 对于评测方案类问题,先明确评测目标,再定义指标(准确率、召回率、BLEU等),然后设计评测集(包含正常/边界/对抗样本),最后给出自动化流程
  • 对于缺陷处理类问题,采用STAR原则:描述场景、任务、行动(定位、修复验证)和结果(质量提升)
  • 对于自动化类问题,强调模块化设计、数据隔离、Mock使用,以及持续集成中的稳定性
  • 如何设计一个大模型的评测方案?包括指标、数据集和自动化流程
  • 请描述一次你发现并推动解决复杂缺陷的经历
  • 在自动化测试中,如何处理接口依赖和数据构造问题?
  • 对LLM-as-a-Judge方法有什么了解?它有哪些优缺点?
  • 如何评估测试覆盖率并优化测试用例?

职位点评

71
综合评分

蚂蚁集团AI质量评测岗,技术前沿、薪资优厚,但工作强度较大,几乎无远程办公。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、愿意投入AI前沿领域、对薪酬有较高期望,且能接受较高工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活40
使命价值70

薪资福利

80较高

蚂蚁集团薪资水平处于行业领先,且提供完善福利,但JD未披露具体薪资,属于面议范畴。

薪资信号面议 (25K-45K/月)

成长发展

85较高

岗位涉及AI评测前沿技术,能积累大模型与自动化测试的深度技能,成长空间大,但JD未明确提及晋升通道。

技术前沿前沿/新兴技术
技术栈大模型、Agent、RAG、LLM-as-a-Judge、自动化测试、Java
业务类型ambiguous

工作生活

40较低

仅现场办公,未提及弹性工作或远程,且蚂蚁集团工作强度通常较高,生活平衡有限。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

AI评测对于推动AI技术落地有积极意义,但金融业务的社会影响力中性,创新水平较高。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs