
科大讯飞
【星火X计划】音频生成大模型研究(J13901)
【星火X计划】音频生成大模型研究(J13901)
发布于 大约 8 小时前普通员工/个人贡献者
合肥市 / 上海市
高级经验
全职员工
仅现场办公
博士
机器学习工程
Dit
Mtp
Pytorch
Tts
分布式训练
大模型
扩散模型
深度学习
语音合成
AI 估算 · 40k–70k
顶尖博士AI研究员,技术前沿稀缺,科大讯飞AI龙头,薪资竞争力强。
职位详情
关于这个职位
这是一个前沿的语音生成大模型研究岗位,你将参与科大讯飞“星火X计划”,面向端到端语音生成大模型开展研究,突破传统TTS在音质、可控性和泛化性方面的瓶颈
你需要具备扎实的深度学习和语音生成基础,熟悉扩散模型、LLM、tokenizer等技术,并具备独立科研和工程实现能力
在这里,你将与顶尖团队合作,产出高水平论文并推动技术落地
最低要求
-27届博士毕业生,人工智能、计算机科学、深度学习、信号处理、自然语言处理、电子信息等相关专业,具备良好的科研素养与前沿研究视野
理论功底扎实,掌握深度学习与大模型核心基础理论,熟悉语音合成、音频生成、扩散模型、离散音频表征或语音—语言多模态建模的核心原理与前沿进展,了解大模型预训练、微调、推理全链路技术体系
具备优秀的独立科研攻关与复杂问题拆解能力,能够精准定位端到端语音生成建模中的核心技术瓶颈,独立完成原创算法方案设计、原理迭代与大规模实验验证,具备较强的问题复盘与技术优化思维
拥有扎实的数理推导、算法建模与实验设计能力,可独立完成语音生成框架设计、音频表征学习、可控生成、扩散/多 token 预测建模等方向的算法创新与消融实验
具备良好的工程实操能力,熟练使用 PyTorch 及主流大模型/扩散模型训练框架,熟悉大模型分布式训练、显存优化、推理加速等工程落地技术
具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏
工作职责
方向一:端到端语音生成模型框架
以大语言模型完成文本/语义到声学表征的映射,以扩散模型(DiT)或多 token 预测(MTP, Multi-Token Prediction)完成高保真声学生成,构建语义骨架与声学引擎协同的端到端框架
重点研究 LLM 与 DiT/MTP 的耦合方式、语义条件注入机制、生成质量与推理效率的平衡、流式低延迟生成(支撑课题一实时交互)等问题
方向二:通用音频生成 tokenizer
研究面向生成大模型的通用音频离散化表征,覆盖语音、音乐、音效等多类音频
重点攻坚高压缩率下的重建保真度、语义信息与声学细节的分层解耦、码本利用率与稳定性、tokenizer 与下游生成模型的联合优化,构建可作为通用"音频词表"的高质量 tokenizer
方向三:多人多轮细粒度指令语音生成技术
面向真实对话与内容生成场景,攻坚多说话人、多轮对话、细粒度指令控制的语音生成
重点研究零样本音色复刻与说话人解耦、情感/语速/风格/副语言的细粒度指令控制、多轮对话中的音色一致性与韵律连贯、长音频生成的稳定性与一致性等问题
优先资格
具备端到端语音生成、DiT/流匹配、音频 tokenizer 相关研究经验者优先
有 ICASSP、INTERSPEECH、ACL、ICLR、NeurIPS、ICML 等顶会/顶刊语音、音频、生成模型相关论文发表或录用经历优先
具备大规模语音/音频/多模态模型训练经验者优先
AI 洞察
优缺点分析
优点
- 技术前沿性极高,课题聚焦端到端语音生成大模型,属于当前AI风口,个人技术成长快
- 公司平台大,科大讯飞在语音领域积累深厚,能提供大规模数据和算力资源
- 顶尖人才计划,有较好的薪资和培养资源,且可产出高水平论文,学术影响力大
- 业务落地场景多,技术能迅速在语音合成、虚拟人、有声内容等产品中应用
- 研究难度大,涉及LLM与扩散模型的融合、tokenizer设计、可控生成等复杂问题,需要较强的科研攻坚能力
- 领域竞争激烈,AI人才密度高,需要持续学习保持领先
缺点 / 挑战
- 工作强度可能较高,工业级研发节奏快,需要同时兼顾研究创新和工程落地
- 适合对语音生成和AI前沿技术有强烈兴趣、具备扎实科研功底、愿意挑战高难度问题并追求技术卓越的博士毕业生
角色解读
- 技术专家路线:在语音生成领域深耕,成为端到端语音生成大模型的技术带头人,主导前沿算法研发
- 学术与产业结合:产出顶会论文,积累技术影响力,同时参与产品落地,形成从研究到应用的闭环
- 跨领域拓展:基于音频生成技术向多模态、虚拟人、智能交互等方向延伸,扩展职业发展空间
- 研究并构建端到端语音生成大模型,设计LLM与DiT/MTP的协同框架,提升语音合成的自然度、可控性和生成效率
- 研发通用音频生成tokenizer,攻克高压缩率下的重建保真度与语义-声学解耦难题,为生成模型提供高质量"音频词表"
- 实现多人多轮细粒度指令语音生成,包括零样本音色复刻、情感/语速/风格控制、多轮一致性等,支撑真实交互场景
- 扎实的深度学习与大模型理论基础,熟悉语音合成、音频生成、扩散模型、离散音频表征等核心原理
- 熟练使用PyTorch及主流大模型/扩散模型训练框架,具备大规模模型训练和分布式训练经验
- 优秀的算法建模与实验设计能力,能独立完成从方案设计到消融实验的完整研究流程
- 良好的工程实操能力,熟悉推理加速、显存优化等落地技术
申请策略
- 在申请材料中明确表达对端到端语音生成技术的理解和个人研究规划,展示与课题方向的匹配度
- 了解科大讯飞在语音领域的产品和技术布局,在面试中体现对业务场景的思考
- 突出语音合成、音频生成、扩散模型、大模型相关的项目或研究经历,特别是端到端语音生成、DiT、tokenizer等方向
- 展示顶会论文发表经历,如ICASSP、INTERSPEECH、ICLR等,体现科研能力
- 强调工程实操能力,如大规模模型训练、分布式训练、PyTorch框架等
- 列举独立科研项目,体现复杂问题拆解和算法创新能力
- 熟悉主流的端到端语音生成模型(如VALL-E、NaturalSpeech系列)和扩散模型(DiT、Stable Diffusion),理解其架构和原理
- 补充音频tokenizer知识,如EnCodec、SoundStream等,了解码本利用率和语义解耦技术
面试指南
- 回答技术问题时可遵循“原理-方法-实践”的结构:先阐述基础理论,再说明你的创新点或方案,最后用实验结果或案例支撑
- 对于开放性研究问题,可以展示结构化思考,例如从问题分解、现有方案对比、潜在解决方案到验证计划
- 在描述项目经历时,使用STAR法则:情境、任务、行动、结果,突出你的独立贡献和成果
- 你如何看待LLM与扩散模型在语音生成中的结合?你认为最关键的挑战是什么?
- 请介绍你之前参与的语音生成或音频生成项目,你在其中解决了什么核心问题?
- 如何设计一个通用的音频tokenizer?你需要权衡哪些指标?
- 在多人多轮对话场景中,如何保证音色一致性和韵律连贯性?
- 如何评估端到端语音生成模型的质量?除了MOS,你还会用什么方法?
职位点评
78
综合评分
顶尖AI研究岗,前沿语音生成技术,高薪高成长,但工作强度可能大
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
该职位最适合以技术成长和学术成就为核心驱动力,对前沿AI研究充满热情,能接受高强度工作的博士毕业生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利82
成长发展95
工作生活45
使命价值80
薪资福利
82较高
该职位薪资竞争力强,但JD未披露具体数字,福利未提及。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
岗位处于AI语音生成前沿,技术挑战大,可快速积累高价值技能和学术成果。
技术前沿前沿/新兴技术
技术栈LLM、DiT、MTP、Diffusion、TTS、Audio Tokenizer、PyTorch
成长机会星火X顶尖AI人才计划
业务类型profit_center
工作生活
45较低
该职位工作地点未明确,工作时间也未说明,但研究岗通常压力较大,弹性有限。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
语音生成技术有广泛的应用前景,能改善人机交互体验,创新价值高。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs