
蚂蚁集团
蚂蚁集团-评测产品专家-AI原生产品
蚂蚁集团-评测产品专家-AI原生产品
发布于 大约 8 小时前普通员工/个人贡献者
杭州市
中级经验
全职员工
仅现场办公
学历未注明
AI产品经理
Agent评测
Ai产品
产品策略
大模型评测
数据分析
用户体验
用户研究
自动化评测
AI 估算 · 30k–50k
蚂蚁集团为互联网巨头,杭州AI产品岗位薪资较高,结合经验要求2年以上,月薪范围合理
职位详情
关于这个职位
该职位负责蚂蚁集团AI原生产品的评测体系搭建,通过用户研究、数据分析和效果评测,驱动产品体验优化
你将与算法、工程团队协作,建设离线与线上结合的评测系统,并持续跟进大模型与Agent评测前沿方法
适合有产品策略或模型评测经验、对AGI充满热情的求职者
最低要求
年以上产品策略、模型产品或效果评测相关经验
至少主导或深度参与过一个完整的业务评测项目,亲自构建过完整的业务评测方法和评测集,能够判断评测方式与评测集的有效性和质量
理解大模型及 Agent 的基本工作原理和常见能力边界,能够与算法、工程和数据团队讨论模型行为、评测方法及优化方案
具备较强的用户洞察和同理心,对数据和指标体系敏感,有较强的数据分析能力
对 AGI 充满热情,动手能力强,熟练使用各类 AI coding/Agent 产品并将其深度融入工作流中
工作职责
你将参与探索下一代国民级的 AI 入口,通过用户研究、产品数据与效果评测,识别关键问题并推动产品策略落地,提升产品的用户体验
将产品目标转化为明确的评估策略,设计匹配真实场景的效果评测方式和评测集,建设覆盖离线评测与线上实验、结合人工与自动化评测的效果评估体系
收集和分析用户的实际使用情况与反馈,将发现的问题转化为评测案例,推动产品和模型改进,并验证评测结果是否能够反映用户的真实体验
推动评测方法和工具的持续完善,包括自动化评测、实验设计和用户反馈收集
与算法、工程、数据和评测团队协作,提升评测效率与结果的可靠性
持续跟进大模型与Agent评测的最新研究与实践,结合业务场景形成可落地的方法
AI 洞察
优缺点分析
优点
- 身处AI前沿赛道,参与国民级AI入口产品,接触大模型和Agent最新技术
- 蚂蚁集团平台资源丰富,能积累大规模AI产品的评测经验,职业竞争力提升快
- 工作内容兼具用户研究和数据分析,技能树全面,发展空间广阔
- AI评测领域尚在快速发展,需要持续学习新技术和方法论,保持知识更新
- 适合对AI和AGI有强烈热情、具备产品思维和数据分析能力的求职者,尤其是希望在大厂深耕AI产品评测方向的人
缺点 / 挑战
- 与多团队协作,沟通成本较高,需平衡多方诉求并推动落地
- 评测结果可能直接影响产品方向,压力较大,要求严谨性和判断力
角色解读
- 在AI评测领域深耕,成为评测专家或技术产品负责人
- 横向转型至AI产品经理、策略产品经理或更广泛的AI应用产品岗位
- 向AI技术管理方向发展,带领评测团队或负责整个AI产品线的体验优化
- 负责AI原生产品的评测体系搭建,通过用户研究和数据分析识别产品问题,推动策略优化
- 设计并维护效果评估方案,包括离线评测、线上实验及自动化工具,确保评估结果反映真实用户体验
- 与算法、工程、数据团队紧密协作,将用户反馈转化为评测案例,推动模型和产品改进
- 持续跟踪大模型与Agent评测前沿技术,结合业务场景引入可落地的评测方法
- 具备产品策略或模型评测经验,至少主导过一个完整评测项目,熟悉评测方法论
- 理解大模型和Agent工作原理,能与技术团队有效沟通模型行为及优化方向
- 较强的用户洞察和数据分析能力,能通过数据驱动产品决策
- 熟练使用AI coding/Agent工具,并将其融入日常工作流
申请策略
- 在申请材料中表达对AGI的热情,并说明你如何将AI工具融入工作流
- 关注蚂蚁集团AI产品的最新动态,面试中可结合具体产品提出评测改进思路
- 突出你主导或深度参与的完整评测项目,详细说明评测方法论、数据集构建及业务影响
- 强调你对大模型和Agent的理解,可提及具体模型(如GPT、LLaMA)的评测经验
- 展示数据分析能力,如使用SQL、Python进行数据分析和实验设计
- 体现你使用AI工具(如Cursor、Copilot)提升工作效率的案例,体现动手能力
- 如果缺乏AI评测经验,可以学习大模型评测标准(如MMLU、HumanEval)和Agent评估框架
- 强化数据分析技能,掌握A/B实验设计、统计假设检验等方法
面试指南
- 对于项目经验题,使用STAR法则(情境、任务、行动、结果),突出你的角色和贡献
- 对于评测设计题,从离线评测(自动指标+人工评估)和线上实验(A/B测试、用户指标)两个维度回答,并强调指标选择与业务目标对齐
- 对于矛盾问题,展示你的数据驱动思维和用户同理心,说明如何交叉验证并迭代改进
- 请描述一个你主导的评测项目,包括评测目标、方法设计、数据集构建及最终结果
- 如何评估一个大语言模型在某个具体场景(如客服)中的表现?你会设计哪些评测指标?
- 当线上实验结果显示A方案优于B方案,但用户反馈却相反,你会如何处理?
- 你如何理解大模型的能力边界?举例说明模型在哪些场景容易失败
- 请举例说明你如何利用AI工具提升工作效率,具体效果如何?
职位点评
78
综合评分
蚂蚁集团AI评测产品专家,前沿技术栈,成长空间大,工作强度未明确但预期较高
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术成长和行业前沿的发展型求职者,能在AI评测领域快速积累经验。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活60
使命价值85
薪资福利
75中等
蚂蚁集团作为行业巨头,薪资福利具有竞争力,但JD未明确具体薪资和福利细节,属于市场水准。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
职位涉及AI前沿技术,大模型和Agent评测属新兴领域,成长空间大。JD中明确提及“持续跟进最新研究与实践”,且蚂蚁集团内部有完善的培养体系。
技术前沿前沿/新兴技术
技术栈大模型、Agent、评测、自动化评测、用户研究
业务类型ambiguous
工作生活
60中等
杭州是宜居城市,但蚂蚁集团工作强度通常较高,JD未提及WLB或弹性办公,推测为现场办公。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
85较高
参与构建国民级AI入口,具有较大的社会影响力和行业意义,符合AGI推动者使命。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号探索下一代国民级的 AI 入口
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs