iFLYTEK logo
科大讯飞
【星火X计划】端到端语音底座大模型研究(J13899)

【星火X计划】端到端语音底座大模型研究(J13899)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市 / 上海市
无经验要求
全职员工
仅现场办公
博士
机器学习工程
Deepspeed
Megatron
Pytorch
大模型
流式建模
全双工交互
端到端语音
语音同传翻译
长上下文语音识别

AI 估算 · 30k–60k

顶尖AI博士研究岗,语音大模型前沿方向,市场稀缺,竞争力强。

职位详情

关于这个职位

这是科大讯飞面向顶尖博士的星火X计划,聚焦端到端语音大模型研究,旨在突破传统级联架构的瓶颈,构建语音直达语义理解的统一大模型

你将参与端到端实时语音交互、同传翻译、长上下文语音识别等前沿课题,推动下一代人机语音交互技术落地
适合有深厚深度学习功底、热爱科研创新的博士毕业生

最低要求

-27届博士毕业生,人工智能、计算机科学、深度学习、信号处理、自然语言处理、电子信息等相关专业,具备良好的科研素养与前沿研究视野

理论功底扎实,掌握深度学习与大模型核心基础理论,熟悉语音识别、语音翻译、语音交互或语音—语言多模态建模的核心原理与前沿进展,了解大模型预训练、微调、推理全链路技术体系
具备端到端语音大模型、流式建模、全双工交互相关研究经验者优先
具备优秀的独立科研攻关与复杂问题拆解能力,能够精准定位端到端语音建模中的核心技术瓶颈,独立完成原创算法方案设计、原理迭代与大规模实验验证,具备较强的问题复盘与技术优化思维
拥有扎实的数理推导、算法建模与实验设计能力,可独立完成语音表征学习、流式/全双工建模、同传决策、超长序列建模等方向的算法创新与消融实验
有 ICASSP、INTERSPEECH、ACL、ICLR、NeurIPS、ICML 等顶会/顶刊语音、多模态、大模型相关论文发表或录用经历优先
具备良好的工程实操能力,熟练使用 PyTorch 及主流大模型训练框架(如 Megatron、DeepSpeed 等),熟悉大模型分布式训练、显存优化、推理加速等工程落地技术,具备大规模语音/多模态模型训练经验者优先
具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏

工作职责

【课题介绍】

本课题聚焦"端到端语音大模型"这一下一代人机语音交互的核心底座,突破当前"识别—理解—对话"级联架构在延迟、误差累积、副语言信息丢失上的固有瓶颈,构建以语音为中心、直接从声学信号完成语义理解与交互决策的统一大模型体系
课题以端到端实时语音交互大模型框架为统一建模底座,向下支撑端到端语音同传翻译与长上下文语音识别两大专项能力攻坚,形成"一个底座 + 两项深水区能力"的技术布局
传统语音交互采用 ASR → LLM → TTS 的级联管线,存在三大结构性缺陷:一是多模块串行带来的高首包延迟与误差逐级放大
二是识别环节将语音压缩为文本,副语言信息(情感、语气、说话人身份、环境声)在入口即被丢弃,下游无法感知
三是半双工的"一问一答"范式无法支持人类对话中的自然打断、抢话、边听边想
本课题面向端到端范式,让大模型直接在语音表征上完成理解与决策,在保留副语言信息的同时,实现低延迟、全双工、可打断的类人交互体验,并在此底座上攻坚同传翻译与超长音频识别两个具备独立技术难度的任务方向
方向一:端到端实时语音交互大模型框架(统一底座)
构建语音输入直达语义理解的端到端大模型,覆盖实时流式建模、全双工交互控制、端到端语音—语义联合表征三大技术点
重点解决多模态统一底座降智问题、流式增量编码与低延迟响应、全双工场景下的双讲(double-talk)/打断/回声处理、说话节奏与轮次控制、副语言信息(情感/语气/环境)的显式建模与利用等问题
语音输出能力复用课题二(语音生成大模型),本方向聚焦"理解与决策之脑"
方向二:端到端语音同传翻译技术
面向流式同声传译(streaming simultaneous translation)场景,以语音到文本翻译(S2TT)为核心,攻坚"边听边译"的读写决策(read/write policy)——在译文质量与翻译延迟之间寻找最优平衡
解决跨语言语义在不完整上下文下的增量对齐、语序差异语言(如中英、中日)的等待策略、专有名词与领域术语的流式一致性等难题
目标语言的语音合成复用课题二能力
方向三:长上下文与鸡尾酒会语音识别技术
面向小时级、会议级超长音频的识别场景,突破传统 ASR 以短句为单位、缺乏长程记忆的局限
重点研究超长音频的上下文一致性建模、跨轮次的记忆与指代消解、说话人日志(speaker diarization)与识别的联合建模、超长序列下的流式增量解码不退化、多说话人语音识别等问题,在长音频、多说话人、强噪声等复杂场景下保持识别精度与语义连贯性
【课题挑战】
端到端语音—语义联合表征与预训练难题
语音信号相比文本存在采样率高、序列长、信息稀疏的特点,如何设计既保留副语言信息、又与语言模型语义空间对齐的语音表征,并在有限的语音—文本配对数据下完成大规模预训练,避免灾难性遗忘文本大模型的通用智能,是端到端范式的核心底层挑战
低延迟流式建模与全双工交互控制
全双工要求模型在持续听的同时持续决策"说/停/让",需在流式增量编码约束下实现低首包延迟
同时要在真实声学环境中鲁棒处理双讲、打断、回声与背景噪声,设计稳定的轮次控制与打断检测机制,规避响应抖动与语义截断
同传翻译的读写决策与质量—延迟平衡
流式同传需在信息不完整时决策"再等还是先译",语序差异大的语言尤为困难
需设计自适应的等待/输出策略,在保证译文准确性、术语一致性的前提下将翻译延迟压至最低,并解决增量解码中的译文回退与修正问题
超长音频的上下文一致性与流式增量解码退化难题
小时级音频带来长程依赖、说话人切换、跨轮指代等复杂性,传统缓存与解码机制随长度膨胀且精度衰减
需研究超长序列的记忆压缩与复用、识别与说话人日志的联合建模,保证长时流式解码不退化、语义连贯不断裂
端到端语音模型的评测体系缺失
现有评测多针对单一任务(ASR词错率、翻译BLEU),缺乏对交互延迟、全双工自然度、打断处理、副语言理解、超长上下文一致性的统一量化标准
需搭建覆盖理解精度、交互体验、延迟开销、鲁棒性的全维度自动化评测平台,支撑算法有效性与稳定性验证

优先资格

具备端到端语音大模型、流式建模、全双工交互相关研究经验者优先

有 ICASSP、INTERSPEECH、ACL、ICLR、NeurIPS、ICML 等顶会/顶刊语音、多模态、大模型相关论文发表或录用经历优先
具备大规模语音/多模态模型训练经验者优先

AI 洞察

优缺点分析

优点

  • 前沿技术方向,端到端语音大模型是行业热点,科研价值高
  • 公司平台大,资源充足,有工业级数据和算力支持
  • 顶尖人才计划,培养体系完善,成长空间大
  • 可发表高水平论文,积累学术影响力
  • 跨团队协作要求高,需与工程、业务团队紧密配合,节奏快
  • 多城市可选,但可能涉及频繁出差或调配
  • 适合对语音AI有强烈兴趣、科研能力突出、能在高压下独立攻关的博士毕业生

缺点 / 挑战

  • 课题难度高,需要攻克多个世界级技术难题,压力较大

角色解读

  • 在科大讯飞顶尖人才计划中,可快速成长为语音大模型方向的核心科学家
  • 有机会参与公司下一代语音交互产品研发,技术成果直接落地
  • 未来可向技术专家或研发管理方向发展,成为行业领军人物
  • 研究端到端语音大模型框架,突破级联架构瓶颈,实现语音直达语义理解
  • 攻坚全双工交互控制、流式增量编码、副语言信息建模等核心技术
  • 推进端到端语音同传翻译和长上下文语音识别的算法创新与工程落地
  • 搭建评测体系,验证模型在延迟、鲁棒性、交互体验等方面的表现
  • 扎实的深度学习和大模型理论基础,熟悉语音/多模态建模原理
  • 精通PyTorch及主流大模型训练框架(Megatron、DeepSpeed),具备工程实操能力
  • 较强的数理推导与算法建模能力,能独立完成实验设计与消融分析
  • 有顶会论文发表或语音大模型研究经验者更受青睐

申请策略

  • 提前了解科大讯飞在语音交互领域的业务布局,在面试中展示行业洞察
  • 针对课题方向准备技术方案思路,体现独立研究能力
  • 突出语音/多模态大模型相关研究经历,尤其是端到端或流式建模项目
  • 强调顶会论文发表经历,展示学术创新能力
  • 详细描述分布式训练实践,体现工程落地能力
  • 展示解决复杂问题的案例,如延迟优化、全双工交互等
  • 熟悉端到端语音框架(如ESPnet、NeMo)和流式建模技术
  • 了解全双工交互、同传翻译的最新论文,跟进SOTA

面试指南

  • 从问题背景出发,分析现有方法的不足,提出创新方案,并说明验证思路
  • 结合实际项目经验,展示技术难点和解决过程
  • 突出理论基础和实验设计能力,体现对前沿技术的理解
  • 如何设计端到端语音大模型的联合表征?
  • 在全双工场景下,如何处理打断和回声问题?
  • 流式同传翻译中,读写决策如何平衡质量和延迟?
  • 如何解决长音频识别中的上下文一致性问题?
  • 你有何大规模模型训练经验?如何优化显存和速度?

职位点评

77
综合评分

顶级AI博士研究岗,技术前沿,成长空间大,但工作强度与WLB不确定。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求前沿技术、渴望科研突破和快速成长的博士人才,对工作灵活性要求不高者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活50
使命价值85

薪资福利

70中等

上市公司平台,薪资待遇有竞争力,但JD未披露具体薪资,福利信息不明确。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

95较高

端到端语音大模型是前沿技术方向,课题挑战大,成长空间极高,顶尖人才计划提供良好发展平台。

技术前沿前沿/新兴技术
技术栈端到端语音、大模型、流式建模、全双工交互、语音同传翻译、长上下文语音识别、PyTorch、Megatron、DeepSpeed
业务类型ambiguous

工作生活

50较低

工作地点多选,需现场办公,未提及弹性工作安排,WLB不明确。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

技术突破填补行业空白,社会影响力较高,创新价值显著。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
Watch Jobs