Tencent logo
腾讯
腾讯云语音大模型算法工程师(TTS)

腾讯云语音大模型算法工程师(TTS)

发布于 大约 2 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Cosyvoice
Fastspeech
Flow Matching
Pytorch
Tensorflow
Tts
Vits
多语种
大模型

AI 估算 · 30k–60k

语音大模型为前沿方向,人才稀缺,腾讯平台加持,硕士+3年经验,薪资竞争力强,月薪3-6万合理。

职位详情

关于这个职位

这是一个腾讯云语音大模型算法工程师(TTS)岗位,负责多任务、多语种TTS大模型的研发与优化,包括预训练、后训练、声学模型、声码器等核心算法

你将推动语音合成技术在实时对话、客服、社交、教育等场景落地,并跟踪前沿技术如Flow Matching、DiT等
适合具备3年以上TTS经验、精通Python和深度学习框架的资深算法人才

最低要求

计算机、人工智能、通信等相关专业,3年+ TTS方向工作经验,硕士及以上学历

熟悉 TTS 基础理论与主流模型,包括 FastSpeech、VITS、CosyVoice 等
精通 Python,熟悉 Linux 与深度学习框架,如 PyTorch 或 TensorFlow
熟练使用 AI Coding 工具或 Coding Agent 辅助研发,具备通过 AI 工具提升代码开发、实验迭代、问题排查和工程协作效率的能力

工作职责

负责多任务、多语种 TTS 大模型的研发,包括预训练、后训练 与效果优化

负责语音合成核心算法研发,包括 声学模型、声码器、Voice Cloning 等
推动语音合成技术在实时对话、客服、社交、教育等业务场景中的落地与优化
负责大规模语音数据处理与训练体系建设,包括数据清洗、评测、训练
跟踪语音生成领域前沿技术,包括 Flow Matching、 DiTAR、DiT、多模态语音生成等方向

优先资格

具备语音大模型训练、多语种 TTS 或大规模语音数据处理经验优先

AI 洞察

优缺点分析

优点

  • 腾讯大厂平台,资源丰富,业务场景多,落地机会多
  • 薪资水平高,福利完善,股票激励等
  • 与业界顶尖团队合作,能接触大规模数据和算力
  • 工作强度大,需要持续学习和跟进最新技术
  • 大模型训练对工程能力要求高,可能需要处理复杂的数据和调试问题
  • 竞争激烈,需要输出高质量成果

缺点 / 挑战

  • 语音大模型是AI热门方向,技术前沿,有挑战性和成长空间
  • 适合有3年以上TTS经验、喜欢挑战前沿技术、愿意在大厂高压力环境下成长的算法工程师

角色解读

  • 从算法工程师向技术专家或架构师发展,深耕语音生成领域
  • 横向拓展到多模态生成、大模型预训练等更前沿方向
  • 在腾讯云平台有机会参与大规模落地项目,积累业务影响力
  • 负责TTS大模型的预训练与后训练,优化多任务、多语种语音合成效果
  • 研发声学模型、声码器、Voice Cloning等核心算法,提升语音自然度和克隆质量
  • 推动语音合成技术在实时对话、客服、社交、教育等业务场景中的落地
  • 建设大规模语音数据处理与训练体系,包括数据清洗、评测、训练流程
  • 熟悉TTS基础理论与主流模型,如FastSpeech、VITS、CosyVoice
  • 精通Python,熟练使用PyTorch或TensorFlow等深度学习框架
  • 具备语音大模型训练、多语种TTS或大规模语音数据处理经验更佳
  • 熟练使用AI Coding工具或Coding Agent提升开发效率

申请策略

  • 了解腾讯云语音相关产品,如腾讯云TTS服务,思考改进点
  • 关注腾讯招聘官网,投递时注明对TTS大模型的兴趣和见解
  • 突出TTS相关项目经验,特别是大模型训练、多语种合成、Voice Cloning等
  • 强调Python和深度学习框架的熟练程度,附上GitHub或技术博客
  • 展示在语音数据处理、训练体系搭建方面的能力
  • 如果有发表论文或开源贡献,务必提及
  • 熟悉主流TTS模型代码,如VITS、CosyVoice,并跑通实验
  • 了解语音大模型的最新趋势,如Flow Matching、DiT、多模态生成

面试指南

  • 用STAR法则描述项目:情境、任务、行动、结果,突出难点和你的贡献
  • 对比模型时从输入输出、训练方式、音质和速度几个维度展开
  • 讲系统设计时先明确约束,再给出方案,考虑权衡和取舍
  • 请介绍你参与过的TTS项目,具体模型架构和优化方法?
  • FastSpeech和VITS的核心区别是什么?如何选择?
  • 如何设计多语种TTS的数据和训练策略?
  • 如果在实时对话中降低TTS延迟,你会怎么做?
  • 你对Flow Matching在语音生成中的应用有什么理解?

职位点评

78
综合评分

腾讯语音大模型算法岗,前沿技术、高薪高成长,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和前沿探索、对薪资有较高期望,且能接受较大工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值70

薪资福利

85较高

腾讯提供有竞争力的薪资和福利,上市大厂稳定性较好,补偿性动机得到较好满足。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

95较高

语音大模型是前沿技术方向,参与核心研发,能积累深厚的技术经验,成长空间大。

技术前沿前沿/新兴技术
技术栈TTS、大模型、Flow Matching、DiT、Voice Cloning、PyTorch
业务类型ambiguous

工作生活

50较低

仅现场办公,未提及弹性工作,大厂强度可能较高,生活化满足一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

语音合成技术能改善人机交互体验,应用于教育、社交等场景,具有一定社会价值,但商业导向较强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs