
腾讯
腾讯云语音大模型算法工程师(TTS)
腾讯云语音大模型算法工程师(TTS)
发布于 大约 2 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Cosyvoice
Fastspeech
Flow Matching
Pytorch
Tensorflow
Tts
Vits
多语种
大模型
AI 估算 · 30k–60k
语音大模型为前沿方向,人才稀缺,腾讯平台加持,硕士+3年经验,薪资竞争力强,月薪3-6万合理。
职位详情
关于这个职位
这是一个腾讯云语音大模型算法工程师(TTS)岗位,负责多任务、多语种TTS大模型的研发与优化,包括预训练、后训练、声学模型、声码器等核心算法
你将推动语音合成技术在实时对话、客服、社交、教育等场景落地,并跟踪前沿技术如Flow Matching、DiT等
适合具备3年以上TTS经验、精通Python和深度学习框架的资深算法人才
最低要求
计算机、人工智能、通信等相关专业,3年+ TTS方向工作经验,硕士及以上学历
熟悉 TTS 基础理论与主流模型,包括 FastSpeech、VITS、CosyVoice 等
精通 Python,熟悉 Linux 与深度学习框架,如 PyTorch 或 TensorFlow
熟练使用 AI Coding 工具或 Coding Agent 辅助研发,具备通过 AI 工具提升代码开发、实验迭代、问题排查和工程协作效率的能力
工作职责
负责多任务、多语种 TTS 大模型的研发,包括预训练、后训练 与效果优化
负责语音合成核心算法研发,包括 声学模型、声码器、Voice Cloning 等
推动语音合成技术在实时对话、客服、社交、教育等业务场景中的落地与优化
负责大规模语音数据处理与训练体系建设,包括数据清洗、评测、训练
跟踪语音生成领域前沿技术,包括 Flow Matching、 DiTAR、DiT、多模态语音生成等方向
优先资格
具备语音大模型训练、多语种 TTS 或大规模语音数据处理经验优先
AI 洞察
优缺点分析
优点
- 腾讯大厂平台,资源丰富,业务场景多,落地机会多
- 薪资水平高,福利完善,股票激励等
- 与业界顶尖团队合作,能接触大规模数据和算力
- 工作强度大,需要持续学习和跟进最新技术
- 大模型训练对工程能力要求高,可能需要处理复杂的数据和调试问题
- 竞争激烈,需要输出高质量成果
缺点 / 挑战
- 语音大模型是AI热门方向,技术前沿,有挑战性和成长空间
- 适合有3年以上TTS经验、喜欢挑战前沿技术、愿意在大厂高压力环境下成长的算法工程师
角色解读
- 从算法工程师向技术专家或架构师发展,深耕语音生成领域
- 横向拓展到多模态生成、大模型预训练等更前沿方向
- 在腾讯云平台有机会参与大规模落地项目,积累业务影响力
- 负责TTS大模型的预训练与后训练,优化多任务、多语种语音合成效果
- 研发声学模型、声码器、Voice Cloning等核心算法,提升语音自然度和克隆质量
- 推动语音合成技术在实时对话、客服、社交、教育等业务场景中的落地
- 建设大规模语音数据处理与训练体系,包括数据清洗、评测、训练流程
- 熟悉TTS基础理论与主流模型,如FastSpeech、VITS、CosyVoice
- 精通Python,熟练使用PyTorch或TensorFlow等深度学习框架
- 具备语音大模型训练、多语种TTS或大规模语音数据处理经验更佳
- 熟练使用AI Coding工具或Coding Agent提升开发效率
申请策略
- 了解腾讯云语音相关产品,如腾讯云TTS服务,思考改进点
- 关注腾讯招聘官网,投递时注明对TTS大模型的兴趣和见解
- 突出TTS相关项目经验,特别是大模型训练、多语种合成、Voice Cloning等
- 强调Python和深度学习框架的熟练程度,附上GitHub或技术博客
- 展示在语音数据处理、训练体系搭建方面的能力
- 如果有发表论文或开源贡献,务必提及
- 熟悉主流TTS模型代码,如VITS、CosyVoice,并跑通实验
- 了解语音大模型的最新趋势,如Flow Matching、DiT、多模态生成
面试指南
- 用STAR法则描述项目:情境、任务、行动、结果,突出难点和你的贡献
- 对比模型时从输入输出、训练方式、音质和速度几个维度展开
- 讲系统设计时先明确约束,再给出方案,考虑权衡和取舍
- 请介绍你参与过的TTS项目,具体模型架构和优化方法?
- FastSpeech和VITS的核心区别是什么?如何选择?
- 如何设计多语种TTS的数据和训练策略?
- 如果在实时对话中降低TTS延迟,你会怎么做?
- 你对Flow Matching在语音生成中的应用有什么理解?
职位点评
78
综合评分
腾讯语音大模型算法岗,前沿技术、高薪高成长,但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿探索、对薪资有较高期望,且能接受较大工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值70
薪资福利
85较高
腾讯提供有竞争力的薪资和福利,上市大厂稳定性较好,补偿性动机得到较好满足。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
95较高
语音大模型是前沿技术方向,参与核心研发,能积累深厚的技术经验,成长空间大。
技术前沿前沿/新兴技术
技术栈TTS、大模型、Flow Matching、DiT、Voice Cloning、PyTorch
业务类型ambiguous
工作生活
50较低
仅现场办公,未提及弹性工作,大厂强度可能较高,生活化满足一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
语音合成技术能改善人机交互体验,应用于教育、社交等场景,具有一定社会价值,但商业导向较强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs