Ant Group logo
蚂蚁集团
蚂蚁集团-大模型算法评测-蚂蚁星河

蚂蚁集团-大模型算法评测-蚂蚁星河

发布于 大约 13 小时前

普通员工/个人贡献者

杭州市
高级经验
全职员工
仅现场办公
学历未注明
测试开发
Ai大模型
Go
Nlp
Sql
安全测试
性能测试
测试开发
算法评测
自动化测试

AI 估算 · 25k–45k

大模型评测方向稀缺,蚂蚁平台出价高,要求高,月薪中位数3.5万。

职位详情

关于这个职位

该职位负责蚂蚁集团AI大模型应用及算法服务的质量保障与评测工作,包括测试工具平台开发、自动化/性能/安全测试,以及大模型特有的精度验证、幻觉检测等难题

需要同时具备扎实的测试功底和对AI技术栈的深入理解,与算法、工程团队紧密协作,推动质量体系升级

最低要求

三年以上互联网或传统行业开发测试及质量保障经验

对软件质量保障有体系化思考和实践经验,能应对复杂系统的质量挑战
熟悉大模型应用测试场景:精通至少一个测试领域(自动化测试/性能测试/安全测试);熟悉主流AI技术栈,熟练使用Python/Java/go/sql等编程语言.有测试工具平台开发经验,具备工程化能力
具备算法评测基础知识,熟悉评测指标,了解badcase分析及评测数据集构建方法,了解模型应用skill,agent,MCP,prompt,loop等技术体系,能设计针对特定场景下大模型应用的合适的工程能力
对新事物有强烈求知欲、有创新精神,乐于和热于技术钻研

工作职责

按照产品架构和业务要求,设计覆盖功能及非功能需求,AI大模型应用、智能引擎、算法服务的产品质量保障

测试能力建设:解决测试复杂技术问题,开发适配大模型及算法服务的测试工具与平台
研究测试新技术方法,推进AI算法评测、AI原生应用测试能力升级;攻克算法领域特有质量难题(精度验证、AB实验评估、幻觉检测等)
结合AI行业发展趋势,制定技术团队的合适的质量发展规划,与算法、工程、产品团队紧密协作,深入理解AI模型能力和边界
推动质量技术左移及需求迭代全栈

优先资格

一年以上AI大模型/算法类产品测试经验(大模型/推荐/搜索/NLP系统等)优先

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大,业务场景丰富,能接触前沿的大模型技术
  • 大模型评测方向人才稀缺,技术积累和职业前景俱佳
  • 工作内容包含工具平台开发,工程能力能得到充分锻炼
  • 岗位要求高,需同时掌握测试和AI知识,学习曲线陡峭
  • 大模型评测领域尚不成熟,需要自主探索新的测试方法和标准

缺点 / 挑战

  • 与顶尖算法、工程团队协作,技术挑战大,成长速度快
  • 互联网大厂工作节奏较快,可能面临较高的工作强度和工作压力
  • 适合对AI技术有强烈热情、具备扎实测试功底、喜欢技术挑战并乐于钻研的工程师

角色解读

  • 从测试专家向AI质量架构师发展,负责整个AI产品线的质量策略设计
  • 深耕大模型评测领域,成为稀缺的AI原生应用测试专家
  • 可向技术管理岗位晋升,带领质量保障团队
  • 负责AI大模型应用、智能引擎和算法服务的质量保障,设计测试方案并执行
  • 开发适配大模型的测试工具与平台,提升测试自动化和效率
  • 研究AI算法评测方法,攻克精度验证、AB实验评估、幻觉检测等质量难题
  • 与算法、工程、产品团队协作,推动质量技术左移和全栈测试覆盖
  • 精通软件测试方法论,至少掌握自动化、性能或安全测试中的一项
  • 熟练使用Python/Java/Go/SQL,具备测试工具开发与工程化能力
  • 了解大模型技术栈,如Agent、MCP、Prompt、Loop等,能设计针对性测试方案
  • 熟悉算法评测指标,具备badcase分析和评测数据集构建能力

申请策略

  • 深入了解蚂蚁星河的业务方向,关注大模型在金融等领域的应用
  • 在面试中展现体系化测试思维和对质量保障的前瞻性思考
  • 突出AI相关测试项目,尤其是大模型、推荐、搜索或NLP系统的经验
  • 强调在自动化测试、性能测试或安全测试等领域的深度专长
  • 展示编程能力和工具开发成果,如测试平台、框架搭建等
  • 如熟悉评测指标或badcase分析,务必在简历中具体体现
  • 系统学习大模型评测方法,包括RAG、幻觉检测、AB实验评估等
  • 补全Agent、MCP等新兴技术栈,动手实践相关测试场景

面试指南

  • 对于设计类问题,从功能、性能、安全、可用性等维度,结合大模型特点提出分层策略
  • 对于评测类问题,强调指标选择与任务对齐,说明数据分布和多样性的重要性
  • 对于经历类问题,使用STAR法则,突出技术难点、解决过程和量化结果
  • 如何为大模型应用设计一套完整的质量保障方案?
  • 你如何评估一个AI模型的效果?会选择哪些评测指标?
  • 描述一次你解决复杂测试技术问题的经历
  • 如何测试基于Agent或MCP的应用?有哪些特有风险?
  • 如何进行badcase分析和评测数据集构建?

职位点评

69
综合评分

大厂大模型评测岗,技术前沿成长快,薪资竞争力强,但工作强度未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长、渴望接触前沿AI技术,且能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值65

薪资福利

70中等

蚂蚁集团薪资福利在行业内属高水平,但JD未披露具体福利,整体补偿性较好。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

岗位涉及前沿大模型评测技术,提供工具开发和规划职责,技术成长空间大。

技术前沿前沿/新兴技术
技术栈AI大模型、算法评测、Agent、MCP、Prompt、自动化测试
成长机会发展规划
业务类型ambiguous

工作生活

50较低

JD未说明工作模式和加班情况,且大厂通常节奏较快,生活平衡可能受影响。

工作模式未明确
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

65中等

AI行业前景好,但岗位偏技术支撑,社会价值感知一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs