Ant Group logo
蚂蚁集团
蚂蚁集团-AI 评测产品经理-AI创新产品

蚂蚁集团-AI 评测产品经理-AI创新产品

发布于 大约 14 小时前

普通员工/个人贡献者

上海市 / 杭州市
中级经验
全职员工
仅现场办公
学历未注明
AI产品经理
Ai评测
产品设计
数据分析
数据标注
模型评估
跨团队协作

AI 估算 · 30k–50k

AI产品经理在大厂属高薪岗位,且涉及前沿Agent评测,技能稀缺,薪资竞争力强。

职位详情

关于这个职位

这是一份专注于AI Agent评测的产品经理岗位,负责蚂蚁集团阿宝(AI版支付宝)的评估体系设计与优化

你将深入理解用户需求,设计评测标准与流程,与算法、工程等团队协作,通过评测结果牵引产品迭代
适合对AI产品有深度理解、热爱评测方法论的候选人

最低要求

有 C 端 AI 产品评测 / 体验度量 / 模型评估相关经验

对 AI Agent 以及评测方法论有较好的理解,熟悉 Benchmark、数据集以及标注相关流程
具备数据分析与实验设计能力,有数据可视化经验是加分项
学习能力强,对 AI 产品有独立判断与体感,具备优秀的跨团队协作与沟通能力

工作职责

理解、研究用户与场景:深度理解阿宝(AI 版支付宝)用户的真实诉求与痛点,结合 AI 技术发展趋势,设计并优化产品的评测方向与重点

Agent 评测:负责阿宝(AI 版支付宝)的评估体系设计、评估结论产出,针对意图理解、任务规划、工具调用、多轮对话、记忆与个性化等 Agent 各环节提出改进建议,对产品迭代起到牵引作用
负责 Agent 评测体系的平台产品化建设:设计模型能力及应用效果的评估体系,搭建评测流程和功能
调研行业最新评测研究和报告,结合实际应用场景,更新内部评测方案
基于评测结果,监控端到端的体验与质量,定期输出评测问题归因报告
与算法、工程、数据标注、业务运营团队紧密协作,设计评测标准、定义评估指标、评测集、Badcase分类、人工评审标准和自动化评测方案

优先资格

有大模型评测平台、数据标注平台、实验平台、A/B平台经验

对通用智能体有深入了解和重度使用经验者优先

AI 洞察

优缺点分析

优点

  • 处于AI前沿领域,接触最先进的Agent技术与评测方法
  • 蚂蚁集团平台大,资源丰富,职业发展空间广阔
  • 评测岗位对产品迭代有实际牵引力,成就感强
  • 可积累深厚的数据分析、模型评估等可迁移技能
  • AI评测方法论仍在演进,需要不断学习和探索
  • 跨团队协作复杂,需要较强的沟通和推动能力
  • 适合对AI产品有热情、逻辑严谨、喜欢数据驱动决策的产品经理,尤其擅长拆解复杂问题并推动落地

缺点 / 挑战

  • 大厂节奏快,可能面临较高的OKR压力

角色解读

  • 在AI评测领域深耕,成为评测专家,主导评测体系演进
  • 向AI产品管理方向进阶,负责更核心的AI产品规划与迭代
  • 横向拓展至AI平台产品,负责评测平台商业化或开放平台建设
  • 设计和迭代AI Agent(阿宝)的评测体系,包括评测维度、指标、数据集和流程
  • 深度分析评测数据,识别Agent在意图理解、任务规划等环节的问题,并输出改进建议
  • 搭建评测平台,推动评测流程的自动化和产品化,提升评测效率
  • 与算法、工程、标注、运营团队协作,确保评测标准落地并持续优化
  • 熟悉AI产品评测方法论,了解Benchmark、数据集构建和标注流程
  • 具备数据分析与实验设计能力,能够从评测数据中提炼洞察
  • 对AI Agent技术有较好的理解,能独立判断产品体验优劣
  • 优秀的跨团队沟通与协作能力,能够推动多方协同

申请策略

  • 深入了解蚂蚁集团阿宝的产品形态和AI战略,在面试中体现对业务的思考
  • 准备一个完整的评测案例,展示从设计到落地的全过程
  • 突出过往AI产品评测或模型评估项目,量化成果(如评测效率提升、问题发现数量)
  • 展示对Agent技术栈的理解,如工具调用、多轮对话等具体环节的实践经验
  • 强调数据分析能力,包括SQL、Python、可视化工具的使用
  • 体现跨团队推动经验,尤其是与算法、工程协作的案例
  • 学习主流评测框架(如HELM、MMLU)和Agent评测方法论
  • 了解大模型基础原理,熟悉Prompt Engineering和RAG等

面试指南

  • 针对评测设计类问题,采用“目标-维度-指标-流程”的结构,强调业务场景和用户价值
  • 对于方案权衡类问题,先分析利弊,再给出分阶段或混合策略,体现思辨能力
  • 对于经历类问题,使用STAR法则,突出你的角色和产出影响
  • 如何设计一个针对AI Agent的评测维度?请举例说明
  • 在评测过程中,如何平衡人工评审和自动化评测?
  • 如果发现Agent在某个任务上表现不稳定,你会如何定位原因并提出改进?
  • 你如何看待现有大模型评测的局限性?
  • 描述一次你通过评测推动产品优化的经历

职位点评

74
综合评分

AI评测产品经理,前沿领域、技术成长快,但薪资未明示且工作强度可能较大

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和快速成长、对AI产品有强烈兴趣且能接受一定工作压力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展88
工作生活55
使命价值78

薪资福利

72中等

该职位薪资水平预计较高,蚂蚁集团平台稳定,但JD未明确薪资福利细节,属于未披露状态。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

88较高

AI评测属于前沿方向,技术含量高,能接触最新Agent技术,成长空间显著。

技术前沿前沿/新兴技术
技术栈AI评测、Agent、Benchmark、数据标注、模型评估
业务类型ambiguous

工作生活

55较低

工作地点在上海/杭州,大厂节奏可能较快,JD未提及弹性工作或远程政策,生活方式满意度一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

78中等

AI创新产品有较大行业价值,但评测岗位偏向内部支撑,社会影响中性偏正面。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs