
蚂蚁集团
蚂蚁集团-语音大模型评测工程师-健康事业群
蚂蚁集团-语音大模型评测工程师-健康事业群
发布于 大约 8 小时前普通员工/个人贡献者
北京市 / 杭州市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Asr
Dsp
Tts
Vad
多模态
数字人
评测体系
语音大模型
AI 估算 · 25k–45k
语音大模型评测工程师为AI算法岗,技术要求高,大厂薪资竞争力强,市场薪酬较高。
职位详情
关于这个职位
该职位负责医疗语音大模型的评测体系建设,包括ASR/TTS等核心能力的测试方案设计、评测集构建和自动化工具开发
你将与算法、产品团队紧密协作,分析模型问题并推动效果优化,是保障语音AI产品在医疗场景中落地质量的关键角色
适合有语音技术背景、擅长体系化思考和工程实现的工程师
最低要求
本科及以上学历,语音、计算机、人工智能、机器学习、多模态等相关专业,2年以上语音算法、语音测试、模型评测或相关工作经验
熟悉语音相关核心技术原理,理解语音前端、唤醒、VAD、ASR、TTS、语音通话处理、端到端语音模型及原生多模态模型的基本机制与常见问题
具备语音模型评测体系设计经验,能够独立设计评测维度、指标体系、测试方案和数据集,具备较强的问题分析与效果归因能力
熟悉语音交互系统或语音产品落地流程,了解业界主流语音系统实现方案,有医疗语音、客服通话、数字人、智能助手等相关场景经验者优先
具备良好的工程能力,熟悉Python,了解C/C++,能够完成评测脚本开发、数据分析、自动化评测流程搭建及相关工具开发
具备较强的跨团队协同和项目推动能力,能够与算法团队高效配合,推动模型效果持续优化并落地业务目标
工作职责
负责医疗语音大模型及相关语音能力的评测体系建设,围绕S2T/ASR/TTS、语音通话、数字人、医疗语音交互等场景,设计评测方案、构建评测标准并持续优化
结合业务目标与模型能力,定义核心评测指标,包括但不限于识别准确率、延迟、稳定性、自然度、可懂度、鲁棒性、安全合规性、医疗场景可用性等,并建立可量化、可追踪的评测机制
负责搭建语音大模型离线评测、在线评测与专项评测能力,建设测试集、基准集和场景化评测集,覆盖真实医疗场景中的口音、噪声、术语、通话链路、长语音、多轮交互等复杂问题
与语音算法、数据、产品、工程团队紧密协同,深入分析模型效果问题,定位性能瓶颈,推动ASR/TTS/语音大模型在医疗业务中的效果优化与目标达成
参与评测自动化平台、评测工具链和数据闭环建设,推动评测流程标准化、工程化和规模化,提升模型迭代效率
持续跟踪语音大模型、多模态、数字人、智能通话等方向的前沿评测方法与行业最佳实践,推动评测体系不断升级
优先资格
有大模型开源项目经验、医疗应用场景实操经验者优先
有人工智能、语音、多模态等方向顶会/顶刊论文发表者优先
AI 洞察
优缺点分析
优点
- 参与前沿的语音大模型和多模态技术,技术视野领先
- 医疗AI赛道前景广阔,工作价值感强
- 大厂平台资源丰富,接触真实复杂场景
- 评测岗位在AI中越来越重要,职业发展空间大
- 评测体系搭建是创新性工作,没有现成方案,需要自主探索
- 医疗场景复杂,口音、噪声、术语等对评测提出高要求
- 适合对语音技术有深刻理解、喜欢系统性思考和工程实现的工程师
缺点 / 挑战
- 需要和多个团队协同,沟通成本较高
角色解读
- 成长为语音评测领域的专家,负责更全面的AI质量体系
- 可转向语音算法研发,深入模型优化与架构设计
- 在AI大模型时代,评测经验可拓展至多模态评测或AI产品管理
- 设计医疗语音大模型的评测体系,包括评测维度、指标体系和测试方案
- 构建测试集、基准集和场景化评测集,覆盖口音、噪声、术语等复杂问题
- 开发自动化评测工具和平台,提升评测效率和模型迭代速度
- 与算法、产品团队协作,分析模型问题并推动效果优化落地
- 深入理解语音核心技术,包括ASR、TTS、VAD、语音前端等
- 具备模型评测体系设计能力,能定义指标和构建数据集
- 熟练的Python编程能力,了解C/C++,能开发评测脚本和工具
- 良好的跨团队沟通和项目推动能力
申请策略
- 了解蚂蚁健康业务方向,思考语音评测如何帮助医疗场景
- 准备一个完整的评测项目案例,展示从设计到落地的过程
- 突出语音相关项目经验,尤其是评测体系建设或测试方案设计
- 展示对ASR/TTS等技术的理解,包括原理和常见问题
- 强调Python开发能力和自动化工具开发经历
- 列出跨团队合作推动项目落地的案例
- 学习业界主流语音评测指标和工具(如WER、MOS、ESPnet)
- 熟悉大模型评测方法论,关注语音大模型的最新进展
面试指南
- 从业务目标出发,定义核心指标,设计测试场景和数据集,建立评测闭环
- 利用数据分析和错误归因方法,结合专业知识定位根因
- 利用自动化工具和平台,提高评测的重复性和扩展性
- 如何为一个语音识别系统设计评测方案?
- 如何评估TTS的自然度和可懂度?
- 当模型在真实场景效果不佳时,你如何定位问题?
- 如何实现评测流程的自动化?
- 如何平衡评测准确性和效率?
职位点评
82
综合评分
大厂AI算法评测岗,前沿技术密集,薪资高,但办公灵活性未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长、希望投身AI前沿领域、并能接受一定不确定性的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展92
工作生活60
使命价值85
薪资福利
85较高
大厂薪资福利有竞争力,但JD未明确具体薪资,属于行业较高水平。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
92较高
岗位处于语音大模型前沿,技术挑战性强,涉及多模态等新方向,成长空间极大。
技术前沿前沿/新兴技术
技术栈语音大模型、ASR、TTS、多模态、VAD、DSP、数字人、评测体系
业务类型profit_center
工作生活
60中等
工作地点在北京/杭州,现场办公,未明确WLB情况,但大厂通常有一定弹性。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
医疗普惠的使命导向强,技术直接服务于医疗健康场景,社会价值高。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号医疗普惠
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs