
美团
平台产品规范负责人
平台产品规范负责人
发布于 大约 15 小时前中层管理(经理/总监)
北京市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Llm-As-Judge
Nlp
团队管理
大模型评测
搜索推荐
数据质量管理
自动化工程
跨团队协作
AI 估算 · 50k–80k
大模型评测属前沿技术,人才稀缺,美团平台核心部门,薪资竞争力强,通常15薪。
职位详情
关于这个职位
本岗位负责美团核心本地商业平台的大模型评测体系构建,包括设计评测标准、搭建自动化评测流水线、保障数据质量,并推动评测结果落地
你将带领团队与算法、产品、工程协同工作,是AI质量保障的关键角色
适合有搜索/推荐/NLP算法背景、追求技术前沿的资深人才
最低要求
计算机、人工智能、统计学、数学或相关专业,本科及以上学历
年以上搜索/推荐/NLP算法或大模型评测领域工作经验,有搜索算法背景者优先
具备从0到1搭建评测体系的完整经验:独立完成过评测框架设计、评测标准制定、Benchmark数据集构建与迭代管理,能系统性解决评测标准与业务目标对齐、评测结果可解释可复现等核心问题
精通主流评测方法论与工程实践:熟悉LLM-as-Judge、人机对齐校准、多评委协作机制等前沿评测范式,有自动评测流水线的架构设计与落地经验,能将自动评测与人工标注的一致性做到可量化、可持续优化,并使得使用评测结果的易用性持续提升
具备扎实的算法理解与数据建模能力:深入理解搜索排序、相关性、多目标优化等核心算法原理,能将算法理解转化为可操作的评测维度和业务策略设计
熟练掌握Python,有评测/数据平台工具的架构设计经验
具备跨团队体系建设与推动落地能力:有过主导跨产品/算法/工程多团队协作的经验,能推动评测标准在多个业务线落地并持续对齐
有带团队经验,能够带领团队和影响相关团队明确方向、拆解目标、拿到结果
具备前沿技术洞察与内化能力:持续关注AI/大模型/搜索领域的前沿进展,能将外部最佳实践快速转化为内部方法论
具备Vibe coding或自动化流程搭建能力,能快速验证方案可行性并推动规模化落地
工作职责
评测体系建设:面向用户交互场景,设计覆盖搜索、推荐、频道、模型输出结果、优化过程等场景的体验标准和评测框架,保障评测标准对产品迭代有效性,评测结果可解释可复现,并主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效
搭建自动化评测工程:通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见,持续提升自动评测与人工标注的一致性,实现自动化评测
数据生产与质量管控:主导评测/训练数据合成方案设计,建立标注规范与质检体系,同时与数据团队协作,保障大规模数据生产的稳定性与准确性
评测结果易用性迭代:面向美团用户场景产运研执行与管理者,设计与数据报表、实验系统灵活打通的方式,全面提升产运研经营与迭代效率
AI 洞察
优缺点分析
优点
- 紧跟AI前沿,参与大模型评测全流程建设,技术视野开阔
- 团队一流,有机会与顶尖AI人才合作,快速积累经验
- 薪资有竞争力,作为核心岗位备受重视
- 评测体系构建复杂,需兼顾技术与业务,具备高难度的推动力
- 跨团队协调困难,需要强大的沟通与影响力
缺点 / 挑战
- 美团平台场景复杂、数据量大,挑战多,成长空间大
- 互联网大厂可能加班多,工作强度较高
- 适合有5年以上算法或评测经验,热爱技术挑战,具备领导力,能承受较大工作压力的资深人才
角色解读
- 成为大模型评测领域的专家,向AI技术总监方向发展
- 深入AIGC应用,晋升为算法团队负责人或平台产品负责人
- 积累复杂业务管理经验,向部门负责人层级迈进
- 负责设计搜索、推荐、频道等场景的体验评测标准和框架,确保评测结果可解释、可复现
- 搭建基于LLM-as-Judge的自动化评测流水线,设计多评委协作机制,提升评测效率
- 主导评测数据的合成与质量管理,建立标注规范,保障大数据集生产的稳定性
- 推动评测结果与业务工具打通,提升产运研的决策和迭代效率
- 深入理解搜索排序、相关性、多目标优化等算法原理,能转化为评测维度
- 精通评测方法论,熟悉LLM-as-Judge、人机对齐、多评委等前沿实践
- 熟练掌握Python,具备评测/数据平台架构设计经验
- 具备跨团队领导力,能带团队并推动多方协作落地
申请策略
- 深入了解美团平台业务,思考评测如何赋能具体场景
- 准备好一个你主导的评测项目故事,讲清挑战、解法与结果
- 重点展示从0到1搭建评测体系的完整案例,包括框架、数据、结果
- 量化成效,如自动评测与人工一致性提升百分比,数据污染降低等
- 突出带团队或主导跨团队项目的经历及最终成果
- 体现对LLM-as-Judge等新技术的应用和思考
- 系统学习最新的大模型评估方法(如RAGAS、LLM-as-Judge的变种)
- 补充自动化流水线、数据平台设计的工程经验
面试指南
- 评测设计题:先明确目标维度,再构建数据集,选择指标,最后提出迭代机制
- 一致性题:强调人机对齐、评委协作、持续校准,并给出可量化目标
- 推动落地题:突出跨部门沟通、标准化流程、利益绑定等方法
- 请设计一个评测框架,评估大模型在美团搜索场景的表现
- 如何保证自动评测与人工评测的一致性?请提供具体方法
- 请举例说明你如何推动评测标准在多业务线落地
- 如何防控数据污染与评测失效?
- LLM-as-Judge有哪些局限?你如何应对?
职位点评
79
综合评分
美团核心AI评测负责人,前沿技术、高薪高成长,但工作强度不确认。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合高度追求技术成长和个人发展,能接受大厂工作节奏,希望站在AI前沿的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展92
工作生活55
使命价值85
薪资福利
80较高
该职位作为美团核心部门的高级岗位,薪资水平在行业中处于高位,且上市公司的福利体系完善,虽然岗位描述未明示具体福利,但整体补偿性较好。
薪资信号未披露(AI估算:50K-80K/月)
成长发展
92较高
职位聚焦大模型评测前沿领域,技术含量高,能深度参与从0到1的体系建设,成长空间巨大,发展性极强。
技术前沿前沿/新兴技术
技术栈大模型、LLM-as-Judge、评测体系、Python、搜索推荐
成长机会快速成长
业务类型ambiguous
工作生活
55较低
工作地点在北京,未提及弹性或远程,且互联网大厂普遍工作节奏快,生活化体验一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
美团平台服务数亿消费者,岗位工作直接改善用户体验,行业前景向好,社会价值高,意义感较强。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号用科技提升数亿消费者、近千万商家、骑手、司机和团长的服务体验
创新程度积极采用新技术
美团 的其他在招职位
相似职位推荐
Watch Jobs