
滴滴出行
AI评测产品经理
AI评测产品经理
发布于 大约 14 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
本科
AI产品经理
Ai产品
Llm
大模型
实验设计
数据分析
评测体系
AI 估算 · 25k–45k
北京AI产品经理薪资较高,2年经验且涉及前沿LLM评测,市场需求旺盛,大厂普遍15薪。
职位详情
关于这个职位
这是一个负责构建大模型与智能体(Agent)评测体系的产品经理岗位,你将设计评测标准、指标体系和自动化方案,与算法、工程、标注团队紧密协作,通过评测结果反哺模型迭代,推动AI体验持续优化
适合对大模型评测、数据质量有浓厚兴趣且具备强分析能力的产品人才
最低要求
本科及以上学历,2年以上AI 评测产品经验
理解大模型基本原理和常见能力维度,如指令遵循、推理、幻觉、安全性、多轮对话、工具调用等
具备优秀的结构化分析能力,能将模糊的“效果不好"拆成可评估、可归因、可优化的问题
熟悉数据分析、实验设计和指标体系建设,能推动复杂跨团队项目落地
对模型评测、数据质量、AI体验优化有强兴趣,严谨、细致,能长期打磨标准和方法论
工作职责
负责Agent评测体系的产品化建设,面向LLM、Agent、工具调用、推理等场景,设计科学、可扩展的评测方法与流程
与算法、工程、数据标注、业务运营团队紧密协作,设计评测标准、定义评估指标、评测集、Badcase分类、人工评审标准和自动化评测方案
基于评测结果,监控端到端的体验与质量,定期输出评测问题归因报告
基于评测结果反哺模型训练、方案迭代,搭建标准-评测-数据反馈的闭环迭代机制,通过人工评估+自动评估的方式提升Agent迭代效率和评估标准的合理性
持续跟踪行业前沿Benchmark、评测方法、模型能力演进,探索更贴近真实业务场景的评测范式
优先资格
有大模型评测平台、数据标注平台、实验平台、A/B平台、模型管理平台经验
对通用智能体有深入了解和重度使用经验者优先
AI 洞察
优缺点分析
优点
- 身处大模型和Agent爆发赛道,评测是刚需,职业发展空间大
- 能深入接触前沿LLM技术,与算法和工程团队紧密合作,技术视野开阔
- 滴滴作为大厂平台,资源丰富,业务场景复杂,能锻炼复杂项目管理能力
- 评测体系构建需要极高的专业性和细致度,对分析能力和耐心要求高
- 适合对AI技术有热情、逻辑严谨、善于拆解复杂问题,且能在快速变化环境中保持学习动力的产品经理
缺点 / 挑战
- 需要跨团队协调,推动不同角色达成一致,沟通成本较高
- 大模型技术迭代快,评测方法和标准需要持续更新,学习压力大
角色解读
- 在AI评测领域深耕,成为评测方法论专家或AI平台产品专家
- 横向拓展到数据标注、实验平台、模型管理平台等AI基础设施产品方向
- 向上晋升为产品负责人,主导AI平台产品线,或转向更广义的AI产品策划与管理
- 设计并落地Agent评测体系,包括评测标准、指标、数据集和自动化方案,确保LLM应用质量可控
- 与算法、工程、标注和运营团队协作,定义评测流程和人工评审标准,推动评测结果在模型迭代中实际应用
- 监控端到端体验质量,输出归因报告,帮助团队定位问题并优化模型或产品方案
- 跟踪学术界和行业前沿评测方法,探索更贴近业务场景的评测范式
- 理解Transformer、Prompt、指令遵循、推理、幻觉等大模型核心概念,能设计针对性评测维度
- 具备SQL和数据分析能力,能基于评测数据做统计分析、实验设计和指标体系建设
- 有跨团队协作和项目推进能力,能平衡算法、工程、标注等多方诉求
- 严谨细致,善于将模糊的质量问题拆解为可量化、可归因的结构化指标
申请策略
- 在简历中明确表达对评测领域的热情,可附上一份关于现有评测体系优缺点分析的简短思考
- 了解滴滴的出行场景如何应用大模型,思考评测在业务中的具体落地价值
- 突出你在AI评测、数据标注、实验平台或相关领域的产品经验,尤其是亲手设计过评测标准或指标体系的项目
- 展示你对大模型能力维度(如幻觉、推理、工具调用)的理解,可以附上相关分析报告或Benchmark对比
- 强调数据分析能力,写清楚如何用数据驱动产品决策和优化
- 如果有跨团队协作经验,务必体现你在推动项目落地中的角色
- 系统学习大模型基础知识,如Transformer架构、RLHF、Agent技术栈,并动手使用主流Agent框架
- 熟悉常用评测基准(如MMLU、GSM8K、AgentBench等),了解业界评测实践
面试指南
- 采用'标准-评测-反馈'闭环框架:先明确业务目标和用户价值,再定义多维指标(功能、安全、体验),设计评测集和流程,最后用数据驱动迭代
- 用STAR法则回答项目经验:情境-任务-行动-结果,突出你的分析逻辑和跨团队协作
- 对于评测方案,可以从评测维度、数据集构建、评测执行、结果分析和闭环优化几个阶段展开
- 如何为一款LLM驱动的Agent设计一套评测体系?
- 你如何定义'效果不好',并拆解为可归因的问题?
- 如果模型在评测中表现优秀但线上体验差,你会怎么排查?
- 说说你过去主导过的指标体系建设,如何确保指标能够反映真实质量?
- 你对Agent工具调用场景的评测有什么思路?
职位点评
73
综合评分
大厂AI评测产品岗,技术前沿,成长空间大,薪资可观,但工作地点固定、WLB信号不明。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最看重技术成长和前沿领域的求职者,对职业发展有强驱动力,且能接受一定工作强度的候选人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活55
使命价值75
薪资福利
70中等
北京大厂AI产品经理薪资有竞争力,但JD未明确薪资和福利信息,补偿感中等偏上。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
88较高
该职位处于大模型评测前沿,技术含量高,能深度参与模型迭代,成长空间大。
技术前沿前沿/新兴技术
技术栈LLM、Agent、Benchmark、评测体系、数据标注、实验设计
业务类型ambiguous
工作生活
55较低
工作地点北京,大概率需现场办公,互联网公司节奏快,JD未提及弹性或加班政策,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
大模型评测对AI质量提升有直接价值,行业前景广阔,但社会影响力相对中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Watch Jobs