Meituan logo
美团
平台产品规范负责人

平台产品规范负责人

发布于 大约 15 小时前

中层管理(经理/总监)

北京市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Llm-As-Judge
Nlp
团队管理
大模型评测
搜索推荐
数据质量管理
自动化工程
跨团队协作

AI 估算 · 50k–80k

大模型评测属前沿技术,人才稀缺,美团平台核心部门,薪资竞争力强,通常15薪。

职位详情

关于这个职位

本岗位负责美团核心本地商业平台的大模型评测体系构建,包括设计评测标准、搭建自动化评测流水线、保障数据质量,并推动评测结果落地

你将带领团队与算法、产品、工程协同工作,是AI质量保障的关键角色
适合有搜索/推荐/NLP算法背景、追求技术前沿的资深人才

最低要求

计算机、人工智能、统计学、数学或相关专业,本科及以上学历

年以上搜索/推荐/NLP算法或大模型评测领域工作经验,有搜索算法背景者优先
具备从0到1搭建评测体系的完整经验:独立完成过评测框架设计、评测标准制定、Benchmark数据集构建与迭代管理,能系统性解决评测标准与业务目标对齐、评测结果可解释可复现等核心问题
精通主流评测方法论与工程实践:熟悉LLM-as-Judge、人机对齐校准、多评委协作机制等前沿评测范式,有自动评测流水线的架构设计与落地经验,能将自动评测与人工标注的一致性做到可量化、可持续优化,并使得使用评测结果的易用性持续提升
具备扎实的算法理解与数据建模能力:深入理解搜索排序、相关性、多目标优化等核心算法原理,能将算法理解转化为可操作的评测维度和业务策略设计
熟练掌握Python,有评测/数据平台工具的架构设计经验
具备跨团队体系建设与推动落地能力:有过主导跨产品/算法/工程多团队协作的经验,能推动评测标准在多个业务线落地并持续对齐
有带团队经验,能够带领团队和影响相关团队明确方向、拆解目标、拿到结果
具备前沿技术洞察与内化能力:持续关注AI/大模型/搜索领域的前沿进展,能将外部最佳实践快速转化为内部方法论
具备Vibe coding或自动化流程搭建能力,能快速验证方案可行性并推动规模化落地

工作职责

评测体系建设:面向用户交互场景,设计覆盖搜索、推荐、频道、模型输出结果、优化过程等场景的体验标准和评测框架,保障评测标准对产品迭代有效性,评测结果可解释可复现,并主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效

搭建自动化评测工程:通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见,持续提升自动评测与人工标注的一致性,实现自动化评测
数据生产与质量管控:主导评测/训练数据合成方案设计,建立标注规范与质检体系,同时与数据团队协作,保障大规模数据生产的稳定性与准确性
评测结果易用性迭代:面向美团用户场景产运研执行与管理者,设计与数据报表、实验系统灵活打通的方式,全面提升产运研经营与迭代效率

AI 洞察

优缺点分析

优点

  • 紧跟AI前沿,参与大模型评测全流程建设,技术视野开阔
  • 团队一流,有机会与顶尖AI人才合作,快速积累经验
  • 薪资有竞争力,作为核心岗位备受重视
  • 评测体系构建复杂,需兼顾技术与业务,具备高难度的推动力
  • 跨团队协调困难,需要强大的沟通与影响力

缺点 / 挑战

  • 美团平台场景复杂、数据量大,挑战多,成长空间大
  • 互联网大厂可能加班多,工作强度较高
  • 适合有5年以上算法或评测经验,热爱技术挑战,具备领导力,能承受较大工作压力的资深人才

角色解读

  • 成为大模型评测领域的专家,向AI技术总监方向发展
  • 深入AIGC应用,晋升为算法团队负责人或平台产品负责人
  • 积累复杂业务管理经验,向部门负责人层级迈进
  • 负责设计搜索、推荐、频道等场景的体验评测标准和框架,确保评测结果可解释、可复现
  • 搭建基于LLM-as-Judge的自动化评测流水线,设计多评委协作机制,提升评测效率
  • 主导评测数据的合成与质量管理,建立标注规范,保障大数据集生产的稳定性
  • 推动评测结果与业务工具打通,提升产运研的决策和迭代效率
  • 深入理解搜索排序、相关性、多目标优化等算法原理,能转化为评测维度
  • 精通评测方法论,熟悉LLM-as-Judge、人机对齐、多评委等前沿实践
  • 熟练掌握Python,具备评测/数据平台架构设计经验
  • 具备跨团队领导力,能带团队并推动多方协作落地

申请策略

  • 深入了解美团平台业务,思考评测如何赋能具体场景
  • 准备好一个你主导的评测项目故事,讲清挑战、解法与结果
  • 重点展示从0到1搭建评测体系的完整案例,包括框架、数据、结果
  • 量化成效,如自动评测与人工一致性提升百分比,数据污染降低等
  • 突出带团队或主导跨团队项目的经历及最终成果
  • 体现对LLM-as-Judge等新技术的应用和思考
  • 系统学习最新的大模型评估方法(如RAGAS、LLM-as-Judge的变种)
  • 补充自动化流水线、数据平台设计的工程经验

面试指南

  • 评测设计题:先明确目标维度,再构建数据集,选择指标,最后提出迭代机制
  • 一致性题:强调人机对齐、评委协作、持续校准,并给出可量化目标
  • 推动落地题:突出跨部门沟通、标准化流程、利益绑定等方法
  • 请设计一个评测框架,评估大模型在美团搜索场景的表现
  • 如何保证自动评测与人工评测的一致性?请提供具体方法
  • 请举例说明你如何推动评测标准在多业务线落地
  • 如何防控数据污染与评测失效?
  • LLM-as-Judge有哪些局限?你如何应对?

职位点评

79
综合评分

美团核心AI评测负责人,前沿技术、高薪高成长,但工作强度不确认。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合高度追求技术成长和个人发展,能接受大厂工作节奏,希望站在AI前沿的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展92
工作生活55
使命价值85

薪资福利

80较高

该职位作为美团核心部门的高级岗位,薪资水平在行业中处于高位,且上市公司的福利体系完善,虽然岗位描述未明示具体福利,但整体补偿性较好。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

92较高

职位聚焦大模型评测前沿领域,技术含量高,能深度参与从0到1的体系建设,成长空间巨大,发展性极强。

技术前沿前沿/新兴技术
技术栈大模型、LLM-as-Judge、评测体系、Python、搜索推荐
成长机会快速成长
业务类型ambiguous

工作生活

55较低

工作地点在北京,未提及弹性或远程,且互联网大厂普遍工作节奏快,生活化体验一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

美团平台服务数亿消费者,岗位工作直接改善用户体验,行业前景向好,社会价值高,意义感较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号用科技提升数亿消费者、近千万商家、骑手、司机和团长的服务体验
创新程度积极采用新技术
Watch Jobs