Tencent logo
腾讯
微信基础-语音大模型评测产品经理

微信基础-语音大模型评测产品经理

发布于 大约 2 小时前

普通员工/个人贡献者

广州市
高级经验
全职员工
仅现场办公
本科
产品经理
Asr
Cer
Mos
Prompt Engineering
Tts
数据集建设
评测体系
语音对话
音频理解

AI 估算 · 20k–35k

语音大模型评测方向稀缺度高,腾讯平台加持,薪资竞争力强。

职位详情

关于这个职位

该职位负责腾讯微信基础下的语音大模型评测工作,涵盖ASR、TTS、语音对话等方向的评测体系设计与数据集建设

你需要与算法团队紧密协作,通过科学评测驱动模型优化,同时探索自动化和前沿评测方法
适合具备语音技术背景和评测经验的产品经理

最低要求

本科及以上学历,3年及以上互联网产品、模型评测或AI数据相关工作经验,具备语音模型评测相关经验为硬性要求

熟悉ASR、TTS、语音对话、音频理解等语音相关任务,对主流技术方案、评测方法及行业发展趋势有较深入理解
具备完整的评测体系建设经验,能够独立完成评测标准制定、评测集建设、结果分析及评测报告输出
熟悉语音领域主流评测指标与方法论,包括CER、MOS、CMOS、GSB等评测方法,对不同评测指标的适用场景、优势及局限性具备深入理解
具备较强的数据分析与问题归因能力,能够从复杂评测结果中发现问题并推动解决
具备较强的Prompt Engineering能力和一定代码能力,能够通过Prompt、Workflow、Agent等方式提升数据生产与评测效率
具备优秀的跨团队协作和沟通推动能力,能够推动算法、数据、产品等多团队协同完成模型优化闭环

工作职责

负责语音大模型评测体系建设,围绕ASR、TTS、语音对话、音频理解等语音模型方向,设计科学、全面、可持续迭代的评测方案与指标体系

负责评测数据集建设,包括数据需求规划、采集方案设计、标注规范制定、质量管理及评测题库建设等工作
负责模型效果评测与分析,定期输出评测报告,识别模型能力边界、典型问题及优化方向,为模型迭代提供依据
设计自动评测与人工评测结合的混合评测方案,推动评测自动化建设,持续提升评测效率与结果可信度
与算法团队紧密协作,基于评测结果开展模型效果分析与问题归因,推动评测结论转化为数据优化和模型迭代方向,形成评测驱动模型优化的闭环
持续跟踪语音大模型行业发展趋势及前沿评测方法,探索更高效的数据生产和模型评测方式

AI 洞察

优缺点分析

优点

  • 切入语音大模型评测这一细分赛道,技术壁垒高,未来需求量大
  • 腾讯平台资源丰富,接触前沿技术和海量数据,职业背书强
  • 与顶尖算法团队协作,能深入理解模型优化全流程,成长空间大
  • 评测工作细致繁琐,需长期关注数据质量和指标细节,对耐心要求高
  • 语音技术迭代快,需要持续学习新方法,保持对行业趋势的敏感度
  • 适合对语音技术有深厚兴趣、注重细节、喜欢用数据驱动决策的产品经理,尤其是有AI评测或数据建设背景的人

缺点 / 挑战

  • 跨团队协作多,沟通成本较高,需具备较强的推动力

角色解读

  • 在本岗位深耕,成为语音大模型评测领域的专家,主导更复杂的评测体系
  • 向语音算法或AI产品管理方向横向发展,积累技术理解与产品全局观
  • 随着腾讯微信基础业务发展,有机会晋升为团队Leader或高级产品经理
  • 设计语音大模型的评测方案和指标体系,确保模型效果可量化、可持续跟踪
  • 建设和维护评测数据集,包括数据采集、标注规范制定和质量把控
  • 定期输出评测报告,分析模型能力边界和典型问题,为算法团队提供迭代方向
  • 推动评测自动化,结合人工与自动评测提升效率,并跟踪行业前沿评测方法
  • 深入理解语音技术(ASR、TTS、语音对话等)及主流评测指标(CER、MOS等)
  • 具备评测体系建设经验,能独立完成标准制定、数据建设及结果分析
  • 较强的数据分析与问题归因能力,能从复杂评测结果中发现问题
  • Prompt Engineering和代码能力,能通过自动化工具提升评测效率

申请策略

  • 了解腾讯微信基础业务的语音产品方向,在面试中体现对业务场景的理解
  • 准备一份简短的评测方案设计思路,展示系统化思考能力
  • 突出语音相关的项目经验,尤其是评测体系建设和数据集管理案例
  • 强调对CER、MOS等指标的理解和应用,附上具体的评测报告或成果
  • 展示数据分析能力,比如通过评测发现关键问题并推动模型改进的经历
  • 如有Prompt Engineering或自动化工具开发经验,务必重点描述
  • 补充或强化对主流语音大模型(如Whisper、SpeechGPT)的技术理解
  • 学习常用的评测框架和工具,如WER计算、MOS打分平台等

面试指南

  • 用STAR法则描述具体项目:背景、评测目标、指标体系设计、执行过程、成果与影响
  • 先阐述技术原理,再结合实际案例说明指标选择的原因和局限性
  • 展示闭环思维:从发现问题到归因分析,再到与算法团队协作改进,最后验证效果
  • 请描述你设计过的评测体系,包括指标体系、数据集构建流程和结果分析
  • 如何衡量ASR模型的性能?除了CER,还有哪些关键指标?它们各自的优缺点是什么?
  • 如果评测结果显示模型在某些场景下表现差,你会如何定位问题并推动解决?
  • 你了解哪些语音大模型?它们的核心评测挑战是什么?
  • 如何平衡人工评测和自动评测的成本与效果?

职位点评

72
综合评分

腾讯微信语音大模型评测岗,前沿技术、专业度高、薪酬面议,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合重视技能成长和前沿技术探索,对WLB要求不高,且希望获得大厂平台背书的产品经理。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活50
使命价值60

薪资福利

80较高

腾讯作为上市巨头,薪资福利具有竞争力,但JD未明确薪资范围,薪酬面议。

薪资信号面议 (20K-35K/月)

成长发展

85较高

语音大模型属于前沿技术,评测方向专业度高,能积累稀缺经验,成长空间大。

技术前沿前沿/新兴技术
技术栈ASR、TTS、语音大模型、Prompt Engineering、自动评测
业务类型ambiguous

工作生活

50较低

工作地点为广州腾讯,现场办公,JD未提及WLB,互联网大厂通常工作强度较大。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

60中等

科技向善的公司使命,但评测工作对社会直接影响有限,行业处于高速增长期。

行业发展高速增长赛道
社会影响中性/一般
使命信号用户为本,科技向善
创新程度积极采用新技术
Watch Jobs