DiDi logo
滴滴出行
AI评测产品经理

AI评测产品经理

发布于 大约 14 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
本科
AI产品经理
Ai产品
Llm
大模型
实验设计
数据分析
评测体系

AI 估算 · 25k–45k

北京AI产品经理薪资较高,2年经验且涉及前沿LLM评测,市场需求旺盛,大厂普遍15薪。

职位详情

关于这个职位

这是一个负责构建大模型与智能体(Agent)评测体系的产品经理岗位,你将设计评测标准、指标体系和自动化方案,与算法、工程、标注团队紧密协作,通过评测结果反哺模型迭代,推动AI体验持续优化

适合对大模型评测、数据质量有浓厚兴趣且具备强分析能力的产品人才

最低要求

本科及以上学历,2年以上AI 评测产品经验

理解大模型基本原理和常见能力维度,如指令遵循、推理、幻觉、安全性、多轮对话、工具调用等
具备优秀的结构化分析能力,能将模糊的“效果不好"拆成可评估、可归因、可优化的问题
熟悉数据分析、实验设计和指标体系建设,能推动复杂跨团队项目落地
对模型评测、数据质量、AI体验优化有强兴趣,严谨、细致,能长期打磨标准和方法论

工作职责

负责Agent评测体系的产品化建设,面向LLM、Agent、工具调用、推理等场景,设计科学、可扩展的评测方法与流程

与算法、工程、数据标注、业务运营团队紧密协作,设计评测标准、定义评估指标、评测集、Badcase分类、人工评审标准和自动化评测方案
基于评测结果,监控端到端的体验与质量,定期输出评测问题归因报告
基于评测结果反哺模型训练、方案迭代,搭建标准-评测-数据反馈的闭环迭代机制,通过人工评估+自动评估的方式提升Agent迭代效率和评估标准的合理性
持续跟踪行业前沿Benchmark、评测方法、模型能力演进,探索更贴近真实业务场景的评测范式

优先资格

有大模型评测平台、数据标注平台、实验平台、A/B平台、模型管理平台经验

对通用智能体有深入了解和重度使用经验者优先

AI 洞察

优缺点分析

优点

  • 身处大模型和Agent爆发赛道,评测是刚需,职业发展空间大
  • 能深入接触前沿LLM技术,与算法和工程团队紧密合作,技术视野开阔
  • 滴滴作为大厂平台,资源丰富,业务场景复杂,能锻炼复杂项目管理能力
  • 评测体系构建需要极高的专业性和细致度,对分析能力和耐心要求高
  • 适合对AI技术有热情、逻辑严谨、善于拆解复杂问题,且能在快速变化环境中保持学习动力的产品经理

缺点 / 挑战

  • 需要跨团队协调,推动不同角色达成一致,沟通成本较高
  • 大模型技术迭代快,评测方法和标准需要持续更新,学习压力大

角色解读

  • 在AI评测领域深耕,成为评测方法论专家或AI平台产品专家
  • 横向拓展到数据标注、实验平台、模型管理平台等AI基础设施产品方向
  • 向上晋升为产品负责人,主导AI平台产品线,或转向更广义的AI产品策划与管理
  • 设计并落地Agent评测体系,包括评测标准、指标、数据集和自动化方案,确保LLM应用质量可控
  • 与算法、工程、标注和运营团队协作,定义评测流程和人工评审标准,推动评测结果在模型迭代中实际应用
  • 监控端到端体验质量,输出归因报告,帮助团队定位问题并优化模型或产品方案
  • 跟踪学术界和行业前沿评测方法,探索更贴近业务场景的评测范式
  • 理解Transformer、Prompt、指令遵循、推理、幻觉等大模型核心概念,能设计针对性评测维度
  • 具备SQL和数据分析能力,能基于评测数据做统计分析、实验设计和指标体系建设
  • 有跨团队协作和项目推进能力,能平衡算法、工程、标注等多方诉求
  • 严谨细致,善于将模糊的质量问题拆解为可量化、可归因的结构化指标

申请策略

  • 在简历中明确表达对评测领域的热情,可附上一份关于现有评测体系优缺点分析的简短思考
  • 了解滴滴的出行场景如何应用大模型,思考评测在业务中的具体落地价值
  • 突出你在AI评测、数据标注、实验平台或相关领域的产品经验,尤其是亲手设计过评测标准或指标体系的项目
  • 展示你对大模型能力维度(如幻觉、推理、工具调用)的理解,可以附上相关分析报告或Benchmark对比
  • 强调数据分析能力,写清楚如何用数据驱动产品决策和优化
  • 如果有跨团队协作经验,务必体现你在推动项目落地中的角色
  • 系统学习大模型基础知识,如Transformer架构、RLHF、Agent技术栈,并动手使用主流Agent框架
  • 熟悉常用评测基准(如MMLU、GSM8K、AgentBench等),了解业界评测实践

面试指南

  • 采用'标准-评测-反馈'闭环框架:先明确业务目标和用户价值,再定义多维指标(功能、安全、体验),设计评测集和流程,最后用数据驱动迭代
  • 用STAR法则回答项目经验:情境-任务-行动-结果,突出你的分析逻辑和跨团队协作
  • 对于评测方案,可以从评测维度、数据集构建、评测执行、结果分析和闭环优化几个阶段展开
  • 如何为一款LLM驱动的Agent设计一套评测体系?
  • 你如何定义'效果不好',并拆解为可归因的问题?
  • 如果模型在评测中表现优秀但线上体验差,你会怎么排查?
  • 说说你过去主导过的指标体系建设,如何确保指标能够反映真实质量?
  • 你对Agent工具调用场景的评测有什么思路?

职位点评

73
综合评分

大厂AI评测产品岗,技术前沿,成长空间大,薪资可观,但工作地点固定、WLB信号不明。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最看重技术成长和前沿领域的求职者,对职业发展有强驱动力,且能接受一定工作强度的候选人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活55
使命价值75

薪资福利

70中等

北京大厂AI产品经理薪资有竞争力,但JD未明确薪资和福利信息,补偿感中等偏上。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

88较高

该职位处于大模型评测前沿,技术含量高,能深度参与模型迭代,成长空间大。

技术前沿前沿/新兴技术
技术栈LLM、Agent、Benchmark、评测体系、数据标注、实验设计
业务类型ambiguous

工作生活

55较低

工作地点北京,大概率需现场办公,互联网公司节奏快,JD未提及弹性或加班政策,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

大模型评测对AI质量提升有直接价值,行业前景广阔,但社会影响力相对中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs