Ant Group logo
蚂蚁集团
蚂蚁集团-AI质量评测工程师-芝麻企业信用

蚂蚁集团-AI质量评测工程师-芝麻企业信用

发布于 大约 15 小时前

普通员工/个人贡献者

杭州市
初级经验
全职员工
仅现场办公
本科
质量保证
Agent评测
大模型(Llm)
数据集构建
模型评估
自动化测试
Prompt测试
Rag评测
对抗测试

AI 估算 · 20k–35k

AI质量评测岗位需求火热,蚂蚁平台加持,薪资处于行业中上水平。

职位详情

关于这个职位

作为AI质量评测工程师,你将专注于大模型(LLM)及AI产品的质量评估与测试体系建设,设计自动化评测工具和数据集,与算法、产品团队协作推动AI质量提升,是AI产品落地的重要保障角色

最低要求

本科及以上学历,计算机、人工智能、数学、统计学等相关专业

年以上算法评测或AI相关经验
熟练掌握Python,具备自动化测试或数据分析能力
理解大模型(LLM)基本原理与常见问题,如幻觉、提示词注入、上下文污染
了解AI评测和常见评测指标
熟悉Prompt测试与对抗测试方法
能独立构建测试Case与Benchmark数据集
熟悉自动化测试框架与评测流水线

工作职责

● 负责AI产品、大模型(LLM)、智能Agent等系统的质量评测体系建设

● 设计并执行模型效果评估方案,包括准确率、稳定性、安全性、鲁棒性、幻觉率等指标
● 建立Prompt评测、RAG评测、Agent任务评测及自动化Benchmark体系
● 构建AI评测数据集,包括测试集、对抗样本、红队数据、安全样本等
● 负责模型输出质量分析,定位问题并推动算法、数据、Prompt优化
● 开发自动化评测工具与平台,提高AI测试效率与覆盖率
● 与算法、数据、产品、研发团队协作,推动AI产品质量持续提升
● 跟踪行业评测标准与前沿Benchmark体系
● 建立AI上线前后的质量监控与回归测试机制

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大,项目资源丰富,能接触到前沿的大模型和AI应用场景
  • AI评测是新兴领域,技能积累具有高度可迁移性,行业需求旺盛
  • 与算法、产品团队紧密协作,能快速提升对AI系统的整体理解
  • 大模型迭代快,测试用例和数据集需要持续更新,维护成本高
  • 适合对AI质量保障有热情、具备扎实编程和数据分析能力、喜欢解决复杂问题的工程师

缺点 / 挑战

  • AI评测标准尚不成熟,需要自主探索方法论,工作有较高不确定性
  • 需同时掌握算法理解能力和工程能力,对综合能力要求较高

角色解读

  • 可向AI质量专家或测试架构师方向发展,主导大型AI项目的质量保障
  • 积累AI评测经验后,可转岗至算法或数据团队,成为AI全栈人才
  • 随着AI行业标准化需求增加,该岗位稀缺性高,未来可担任QA团队负责人
  • 构建AI产品的质量评测体系,重点评估大模型的准确性、安全性、鲁棒性等指标
  • 设计并执行Prompt、RAG、Agent等自动化Benchmark,确保模型输出质量
  • 开发自动化评测工具和平台,提升测试效率和覆盖率
  • 与算法、产品团队协作,定位模型问题并推动优化
  • 扎实的Python编程能力,能够搭建自动化测试框架和数据处理流水线
  • 深入理解大模型(LLM)原理及常见问题,如幻觉、提示词注入等
  • 熟悉AI评测指标体系,掌握Prompt测试和对抗测试方法
  • 具备独立构建测试数据集和Benchmark的能力,包括对抗样本和安全样本

申请策略

  • 申请时附上个人GitHub项目,尤其是AI评测相关工具或数据分析案例
  • 了解蚂蚁集团在AI信用评估、金融场景的应用,面试时展现对业务的兴趣
  • 突出过往AI相关项目经验,特别是模型评测、Prompt测试或自动化测试经历
  • 强调Python编程能力、框架开发及数据处理经验,展示独立构建数据集的能力
  • 如果有参与开源AI评测工具或发表相关论文,务必重点呈现
  • 学习主流大模型(如GPT、LLaMA)的评测方法论,熟悉MLPerf、GLUE等标准
  • 掌握自动化测试框架(如pytest、Robot Framework)和CI/CD工具
  • 补充统计学知识,以便更科学地设计评估实验和分析数据

面试指南

  • 结构化回答:先明确目标,再拆解步骤(数据准备、指标选择、工具实现、结果分析),最后举例说明
  • 突出量化思维:多用具体数据(如准确率提升X%,覆盖率Y%)支撑观点
  • 强调协作:说明如何与算法、产品团队沟通推进问题解决
  • 如何设计一个针对大模型的幻觉评测方案?
  • 请描述你如何构建一个高质量的AI测试数据集
  • 在自动化评测中,如何平衡测试效率与覆盖率?
  • RAG评测中你会关注哪些关键指标?为什么?
  • 当你发现模型输出存在安全性漏洞时,如何处理?

职位点评

77
综合评分

蚂蚁AI评测岗,前沿技术栈,薪资优厚,但现场办公且强度可能偏高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿领域、能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活60
使命价值70

薪资福利

80较高

蚂蚁集团薪资福利在行业内具有较强竞争力,且该岗位为AI方向,整体待遇较好。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

90较高

该岗位涉及前沿AI技术,有丰富的学习资源和内部培训,成长空间大。

技术前沿前沿/新兴技术
技术栈大模型、LLM、Prompt、RAG、Agent、自动化测试
业务类型profit_center

工作生活

60中等

杭州工作,现场办公为主,工作强度可能较高,但蚂蚁集团有弹性工作制可能。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

AI质量评测对保障产品安全和可靠性有直接意义,但行业整体以商业驱动为主。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs