Ant Group logo
蚂蚁集团
蚂蚁集团-语音数据算法工程师-健康事业群

蚂蚁集团-语音数据算法工程师-健康事业群

发布于 大约 9 小时前

普通员工/个人贡献者

杭州市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Asr
Badcase分析
Pytorch
大模型
数据闭环
方言识别
自监督学习
语音信号处理

AI 估算 · 40k–60k

蚂蚁集团算法岗位薪资丰厚,杭州生活成本适中,语音大模型方向热门,专家级别薪资竞争力强。

职位详情

关于这个职位

作为语音数据算法工程师,你将主导构建支撑千亿级大模型训练的高质量语音数据体系,攻克方言识别、多人混叠等难题,建立自动化数据闭环

你的工作将直接决定大模型在复杂现实场景下的能力上限,推动行业标准定义

最低要求

教育背景:计算机、信号处理、数学或相关专业硕士及以上学历

核心背景:在语音识别(ASR)、说话人识别、或多模态学习领域有扎实的研发经验
算法功底:深厚掌握语音信号处理算法(如降噪、回声消除、增益控制等)
深刻理解语音大模型(Speech LLM)的训练范式及数据配比逻辑
工程与架构:精通 Python,熟练使用 PyTorch/TensorFlow
具备设计高并发、可扩展的数据处理 Pipeline 的能力
数据思维:极强的数据敏感度,能从海量 Badcase 中总结规律,并将其转化为可量化的技术方案

工作职责

数据体系架构:主导海量音视频数据的自动化清洗、质量评估与标注一致性检查体系,构建行业领先的高质量语音训练数据集

核心难点攻坚:
方言与低资源语种:研发高效的方言检测(LID)与多方言自动化处理方案,解决非标口语场景下的模型泛化难题
复杂角色切分:攻克多人对话中严重的言语重叠(Overlapping)识别,优化说话人日志(Speaker Diarization)算法,实现高精度的角色分离与切割
全链路数据闭环:
Badcase 溯源:深入分析线上模型失效场景,精准定义修复特定缺陷(如特定口音、极端噪声、远场环境)所需的数据分布
端到端验证:构建自动化的数据收益评估体系,通过严谨的消融实验(Ablation Studies)量化数据对模型能力的提升,驱动算法迭代闭环
前沿技术转化:探索自监督学习(SSL)、弱监督对齐、以及基于生成式 AI 的数据合成技术,在真实数据稀缺时补齐数据短板

优先资格

复杂场景实战:在多人会议、车载环境或医疗临床等极高难度场景下有成功交付经验

多模态深度结合:有基于音视频对齐(如唇动辅助、视觉聚类)提升语音分离或识别效果的经验
学术影响力:在 ICASSP, INTERSPEECH, CVPR, NeurIPS 等顶级会议发表过高水平论文或在权威挑战赛(如 M2MeT, VoxCeleb)中取得优异成绩
大数据能力:熟悉 Spark, Flink 等分布式框架,具备处理 PB 级大规模数据的工程实践经验

AI 洞察

优缺点分析

优点

  • 技术前沿:专注语音大模型数据难题,有大量创新空间
  • 平台优势:蚂蚁集团提供海量数据和丰富场景,影响力大
  • 科学闭环:强调消融实验和数据驱动,避免盲目调参
  • 难度高:需要同时攻克方言、重叠语音等复杂问题
  • 技术更新快:需持续跟进自监督学习、生成式AI等新方向
  • 适合对语音技术有深厚热情、喜欢解决高难度问题、享受从数据中提炼规律的技术专家

缺点 / 挑战

  • 压力大:数据质量直接影响大模型效果,容错率低

角色解读

  • 技术深耕:成为语音数据领域顶级专家,定义行业标准
  • 横向扩展:向多模态、大模型全栈方向拓展,成为AI架构师
  • 管理路线:带领数据团队,主导核心算法方向
  • 主导构建大规模的语音数据清洗、标注和评估体系,确保训练数据的高质量
  • 攻克方言识别和多人对话中的言语重叠问题,优化说话人日志算法
  • 建立Badcase驱动的数据闭环,通过消融实验量化数据对模型的影响
  • 探索自监督学习和数据合成技术,弥补真实数据不足
  • 扎实的语音识别、说话人识别或多模态学习研发经验
  • 精通Python和PyTorch/TensorFlow,能设计高并发数据处理Pipeline
  • 深刻理解语音信号处理算法和语音大模型训练范式
  • 极强的数据敏感度,能从Badcase中总结规律并转化为技术方案

申请策略

  • 在简历中量化成果,例如数据量级、识别准确率提升等
  • 提前了解蚂蚁健康事业群的业务场景,思考如何将语音技术应用于医疗领域
  • 突出语音识别或说话人识别的项目经验,尤其是处理方言或重叠语音的案例
  • 展示数据Pipeline搭建能力,包括大规模的清洗、标注和评估流程
  • 强调对Badcase分析和消融实验的具体实践与量化结果
  • 补强自监督学习(如wav2vec 2.0)和数据合成技术
  • 熟悉分布式数据处理框架如Spark和Flink

面试指南

  • STAR法则:先说明背景和挑战,再讲具体方案和行动,最后用量化结果收尾
  • 数据驱动思维:强调从Badcase出发,设计实验验证数据效果
  • 如何设计一个自动化数据清洗和标注一致性检查系统?
  • 请描述你解决过的一个多人对话中的言语重叠问题,具体算法和效果
  • 如何通过Badcase分析确定数据增强方向?请举例
  • 你对语音大模型的训练数据配比有什么理解?
  • 如何在方言数据稀缺情况下提升模型泛化能力?
  • 复习ASR和说话人日志经典论文,如Speaker Diarization最新方法

职位点评

74
综合评分

前沿语音数据算法专家,高成长、高薪资,但工作强度大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿、高成长性、不在意加班和办公灵活性的技术专家。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值70

薪资福利

80较高

薪资市场水准偏高,且蚂蚁集团福利完善,但未在JD中明确具体薪资和福利,补偿性动机中等偏上。

薪资信号未披露(AI估算:40K-60K/月)

成长发展

95较高

职位处于语音大模型前沿,技术挑战大,成长空间极高,且有明确的科学闭环和前沿探索。

技术前沿前沿/新兴技术
技术栈ASR、Speaker Diarization、Speech LLM、自监督学习、生成式AI、多模态
业务类型profit_center

工作生活

40较低

工作地点仅现场办公,未提及弹性工作或远程,可能面临高强度加班,生活化动机满足度较低。

工作模式仅现场办公
办公地点市区核心地段
加班情况JD含高强度暗示词

使命价值

70中等

行业属于AI高速增长赛道,且蚂蚁健康事业群有社会价值,但JD未明确表达使命感。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs