Ant Group logo
蚂蚁集团
蚂蚁集团-大模型评测工程师-蚂蚁保

蚂蚁集团-大模型评测工程师-蚂蚁保

发布于 大约 8 小时前

普通员工/个人贡献者

北京市 / 杭州市
初级经验
全职员工
仅现场办公
学历未注明
测试开发
Rag
Sql
大模型评测
数据分析
测试开发
自动化测试

AI 估算 · 25k–45k

蚂蚁集团平台薪资竞争力强,大模型评测方向热门,一般16薪左右。

职位详情

关于这个职位

蚂蚁集团蚂蚁保业务的大模型评测工程师,主要负责保险核心链路的质量保障和大模型相关AI能力的评测体系建设

你将在真实的金融业务场景中,结合功能测试、自动化工具开发和AI评测方法论,确保系统稳定性和模型效果,是连接业务、技术与算法的重要角色

最低要求

具备软件测试基础,熟悉功能测试、接口测试、回归测试及常见用例设计方法

具备一定研发能力,熟悉 Python、Java 等至少一种编程语言,能够独立编写测试或数据处理工具
熟悉 Linux、SQL、日志分析和接口调试,具备基本的问题排查能力
对大模型、Agent、RAG、Prompt 和 AI 评测有兴趣,愿意深入参与相关能力建设
具备良好的业务理解、问题分析和跨团队协作能力

工作职责

负责蚂蚁保险“蚁小保”相关业务的功能测试,包括接口、服务端、端到端及回归测试,保障核心业务链路质量

参与大模型、Agent、RAG 等 AI 能力评测,完成评测指标设计、评测集构建、自动化评测及结果分析
负责评测数据的采集、清洗、标注和难例沉淀,持续提升数据质量和评测覆盖度
开发测试脚本、自动化工具及评测能力,提升测试和评测效率
分析并定位模型效果、系统功能及数据链路问题,协同产品、研发和算法团队推动问题闭环

优先资格

有大模型评测、AI 测试、自动化测试或测试平台建设经验

有数据清洗、评测集构建、LLM-as-a-Judge 或难例分析经验
有保险、金融、支付等复杂业务系统测试经验

AI 洞察

优缺点分析

优点

  • 大模型评测是前沿赛道,当前人才稀缺,技能成长快,未来价值高
  • 薪资福利有竞争力,职业发展空间广,团队协作氛围通常较好
  • 大模型评测涉及多种技术栈,需要持续学习新知识,保持技术敏感度
  • 保险业务链路复杂,测试场景多,工作强度可能较大,需应对多任务并行
  • 跨团队协作频繁,需要较强的沟通推动能力,确保问题闭环
  • 适合对AI质量保障有热情、喜欢解决复杂问题、具备测试和编程能力,且能适应快节奏工作的工程师

缺点 / 挑战

  • 蚂蚁集团平台大,业务核心,技术挑战高,能接触真实金融级复杂场景

角色解读

  • 从测试工程师向AI评测专家发展,深度参与大模型质量保障体系,成为稀缺的复合型人才
  • 积累蚂蚁保险核心业务经验,向金融领域质量架构师或AI产品测试负责人方向晋升
  • 可横向拓展至算法评测、AI研发或质量平台架构等方向,职业路径多元
  • 负责蚂蚁保险核心业务的功能测试与质量保障,包括接口、服务端和端到端测试,确保业务链路稳定可靠
  • 参与大模型、Agent、RAG等AI能力的评测体系搭建,设计评测指标、构建评测集并执行自动化评测
  • 开发测试脚本、自动化工具和评测平台,提升测试效率,并分析定位模型效果与系统问题
  • 扎实的软件测试基础,熟悉功能、接口和回归测试方法,能设计全面的测试用例
  • 熟练使用Python或Java进行脚本开发,具备独立编写测试工具和数据处理程序的能力
  • 掌握Linux、SQL和日志分析,能快速定位系统链路问题,具备良好的跨团队协作能力
  • 对大模型、Agent、RAG、Prompt等AI技术有浓厚兴趣,愿意深入评测领域

申请策略

  • 深入了解蚂蚁保业务和产品,思考AI在保险领域的应用场景,面试中展现业务理解
  • 在简历中突出对AI评测的兴趣和持续学习的态度,体现自驱力
  • 突出软件测试项目经验,特别是自动化测试、接口测试和回归测试的实际案例,量化成果
  • 强调数据清洗、评测集构建、LLM-as-a-Judge等大模型评测相关经验,即使只是项目中的一部分也要说明
  • 展示编程能力,列出独立开发的测试工具或脚本,体现解决实际问题的能力
  • 学习大模型评测方法论,了解评测指标设计、评测集构建、LLM-as-a-Judge等核心概念
  • 熟悉Agent、RAG架构,动手搭建简单的AI应用测试,积累实操经验

面试指南

  • 使用STAR法则描述项目经历,背景-任务-行动-结果,突出量化指标
  • 针对评测设计问题,从评测目标、指标定义、数据构建、自动化执行、结果分析等维度结构化回答
  • 强调跨团队协作和问题闭环能力,展示自己如何推动团队达成目标
  • 如何设计一个大模型问答系统的评测方案?请说明评测指标、数据构建和评估方法
  • 描述一次你发现并推动解决复杂测试问题的经历,具体做了哪些事情,结果如何?
  • 如何构建一个高质量的评测数据集?如何处理噪声数据和难例?
  • 介绍你常用的自动化测试框架和工具,以及它们在实际项目中的应用
  • 你对Agent和RAG技术了解多少?它们在保险业务中可能有哪些应用?

职位点评

74
综合评分

大厂AI评测岗位,技术前沿薪资优厚,但工作生活平衡不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和职业发展、看重平台价值和前沿技术、能够接受工作强度不确定性的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活50
使命价值70

薪资福利

80较高

蚂蚁集团薪资福利在行业内处于领先水平,但JD中未明确具体薪资和福利,不过大厂平台和业务重要性为补偿性动机提供较强支撑。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

该职位聚焦大模型评测这一前沿领域,技术挑战大,技能成长快,虽然JD未明确晋升路径,但蚂蚁的平台和业务能提供丰富的发展机会。

技术前沿前沿/新兴技术
技术栈大模型、Agent、RAG、Prompt、Python、Java、Linux、SQL
业务类型ambiguous

工作生活

50较低

工作地点在北京或杭州,JD未提及远程或弹性办公,也未明确加班情况,生活方式满足度一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

该职位服务于蚂蚁保险业务,通过AI评测保障模型质量,具有一定的社会价值,且处于创新前沿,但JD未强调使命感。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs