
科大讯飞
【星火X计划】实时音视频一体化生成关键技术研究(J13902)
【星火X计划】实时音视频一体化生成关键技术研究(J13902)
发布于 大约 8 小时前普通员工/个人贡献者
合肥市
无经验要求
全职员工
仅现场办公
博士
研究与开发 (研发)
Dit
Pytorch
多模态生成
扩散模型
数字人
模型蒸馏
流式推理
语音合成
音视频生成
AI 估算 · 30k–50k
顶尖AI人才计划,博士高薪,合肥竞争力强,综合市场水平估算。
职位详情
关于这个职位
该职位隶属于科大讯飞星火X顶尖AI人才计划,专注于实时音视频一体化数字人生成技术研究
你将参与构建统一音视频生成模型,解决数字人在实时交互中的多模态一致性与长时稳定性问题,涉及语音、表情、动作和视频的协同建模
适合具备扎实科研背景、对生成模型和数字人方向充满热情的博士毕业生
最低要求
-27届博士毕业生,人工智能、计算机视觉、语音信号处理、机器学习、计算机图形学、多媒体、电子信息等相关专业,具备良好的科研能力和前沿技术敏感度
熟悉视频生成、音频生成、多模态生成、扩散模型、DiT/mmDiT、Flow Matching、VAE/Codec、Transformer 等技术
有数字人、talking-head、portrait animation、human video generation 或音视频联合生成经验者优先
熟悉语音合成、Audio Codec、声学建模、韵律建模、音色克隆、语音情绪控制、空间音频或背景音生成等方向
具备语音和视觉生成交叉背景者优先
具备长时序建模和流式推理经验,了解 causal attention、chunk-based generation、状态缓存复用、跨片段一致性建模、低步数采样、实时音视频系统者优先
具备后训练和生成模型优化经验,熟悉偏好对齐、奖励模型、DPO/RLHF、模型蒸馏、量化压缩、推理加速等方法,能够围绕数字人生成效果进行系统性优化
熟悉视频生成模型训练工具链,掌握 PyTorch 及 Diffuser 等扩散/DiT 视频生成训练框架
熟悉DeepSpeed、FSDP等大规模分布式训练框架者优先
具备扎实的实验设计和评测能力,能够围绕音频质量、唇形同步、表情自然度、动作真实感、身份一致性、声场一致性、背景稳定性、长时稳定性和端到端延迟建立评测体系
有 CVPR、ICCV、ECCV、NeurIPS、ICLR、ICASSP、INTERSPEECH、SIGGRAPH 等论文或高质量开源经验者优先
工作职责
岗位职责:【课题介绍】
本课题面向实时交互场景的音视频一体化数字人生成技术,围绕数字人的语音、表情动作、声场环境和视频画面进行统一建模,构建具备高拟人度、高可控性、高音频质量、长时一致性和低延迟流式生成能力的数字人生成基座
当前数字人生成多采用“文本/语义理解、TTS、唇驱、表情动作驱动、视频渲染”级联链路,工程上易落地,但在真实交互中容易出现多模态割裂问题:语音与口型同步但情绪、表情和动作不一致
人物与背景画面的光照、空间和运动关系不稳定
声场、背景音、环境氛围与视频画面缺乏统一建模
长时生成中人物身份、音色、动作风格和画面细节逐步漂移
同时级联链路带来较高端到端延迟,难以支撑自然连续的实时交互体验
课题拟研究音频与视频原生联合生成模型,探索纯 DiT 或类 DiT 统一生成架构下的语音、人物动作与视频画面协同建模方法
重点提升一体化生成中的语音自然度、音色稳定性、韵律情绪表达、背景音画一致性和声场空间一致性,解决统一音视频生成架构下语音合成稳定性不足、音频细节易退化的问题
突破长时生成中的人物身份保持、动作风格延续、背景画面稳定、音画空间一致和跨片段无缝衔接难题
面向在线交互场景,研究流式生成、因果建模、低延迟推理、后训练对齐、蒸馏压缩和端侧/云侧协同部署等关键技术,并为后续与交互理解模型端到端融合奠定基础
【课题挑战】
音视频一体化架构下的高一致性生成问题
数字人生成不仅需要语音和口型同步,还需要语音韵律、表情动作、人物姿态、镜头运动、背景画面、环境声和空间声场在统一时空内保持一致
如何在统一生成架构中同时建模人物表达、画面动态、背景环境和声音空间关系,避免“音频像后贴、画面像拼接、动作像模板”的割裂感,是课题的核心挑战
纯 DiT/类DiT框架下的高质量语音生成稳定性问题
在音视频一体化生成模型中,语音不应只是视频生成的附属条件,而应作为核心生成目标之一
纯 DiT 或类 DiT 统一架构在建模视觉动态方面具备优势,但在语音音色保持、韵律自然度、细粒度音频纹理、情绪表达、背景音融合和长时稳定性方面仍存在挑战
需要研究适配统一音视频模型的音频表征、音频 tokenizer / codec、跨模态注意力机制、损失设计和训练策略,提升一体化模型中的语音合成质量与稳定性
长时流式生成中的身份、音色、动作与背景一致性问题
实时数字人需要连续生成较长时间内容,模型容易在分钟级生成中出现人物身份漂移、音色变化、表情风格不连续、动作循环、背景闪烁、光照变化、声场跳变、片段边界不平滑等问题
课题需要研究长时记忆、状态缓存、跨 chunk 一致性约束、音画同步校正和流式生成状态管理,实现长时连续输出下的人物、声音、动作和环境高一致性
视频生成后训练、蒸馏压缩与低延迟部署问题
交互场景对首帧延迟、持续生成速度、音画同步和响应自然度要求极高,单纯依赖大模型离线生成难以满足线上部署需求
课题需研究面向数字人生成的后训练技术,包括偏好对齐、质量奖励模型、同步性奖励、人物一致性奖励、交互自然度评测与优化
同时探索低步数采样、模型蒸馏、结构剪枝、量化压缩、缓存复用和推理调度等方法,在保证音频质量、画面质量和长时一致性的前提下,实现低延迟流式生成
AI 洞察
优缺点分析
优点
- 科大讯飞人工智能领军企业,资源丰富,平台大,研究氛围好
- 顶尖人才计划,薪资待遇优厚,发展空间广阔
- 与业务结合紧密,研究成果可直接赋能智能客服、数字人等多个场景
- 课题难度大,涉及多模态联合建模,需要跨领域知识,学习曲线陡峭
- 研究型岗位对科研能力要求高,需要独立发现问题、设计实验并解决
- 数字人技术竞争激烈,需要不断跟进最新文献和保持技术敏感度
缺点 / 挑战
- 前沿研究课题,挑战性与创新性高,容易产出高水平论文和专利
- 适合对生成式AI有强烈兴趣、具备扎实科研功底、乐于挑战前沿难题的博士毕业生
角色解读
- 成为数字人生成方向的核心算法专家,引领音视频一体化技术演进
- 有机会将研究成果落地到公司多个产品线,快速成长为技术团队负责人或架构师
- 依托科大讯飞平台,可向技术管理或高阶专家职位发展
- 研究音视频一体化数字人生成技术,聚焦统一建模语音、表情、动作和视频
- 探索纯DiT/类DiT架构下的多模态联合生成,解决音画一致性和长时稳定性问题
- 设计后训练、蒸馏压缩和低延迟推理方案,推进技术落地到实时交互场景
- 建立面向数字人质量的评测体系,包括音频质量、唇形同步、身份一致性等
- 扎实的机器学习与深度学习基础,熟悉扩散模型、DiT、Flow Matching等生成模型
- 掌握音频生成与语音合成技术,如TTS、Audio Codec、韵律建模等
- 熟悉视频生成或多模态生成,有数字人或talking-head经验者佳
- 具备分布式训练(DeepSpeed/FSDP)和模型优化(蒸馏/量化)能力
申请策略
- 研究科大讯飞在数字人和AI生成方向的产品布局,在面试中展示与之匹配的理解
- 准备一个完整的研究项目介绍,体现系统思考和问题解决能力
- 突出科研项目中与生成模型相关的经历,特别是扩散模型、DiT、语音合成等
- 展示相关论文发表或开源项目,体现科研产出能力
- 强调动手实现能力,如PyTorch、分布式训练调优经验
- 如果有数字人、talking-head等项目,详细描述技术方案和效果
- 深入学习DiT、Flow Matching、多模态联合建模的最新论文和代码
- 补充语音合成和音频Codec知识,了解当前SOTA方法
面试指南
- 采用“问题-方案-效果”的结构,清晰阐述背景、方法和结果
- 对于开放性设计题,先拆解问题,再基于已有知识提出多方案对比和取舍
- 遇到不熟悉的问题,可以诚实说明,并展示自己的思考路径和学习能力
- 介绍一下你在生成模型方面的研究经历?遇到过哪些挑战?
- 如何解决音视频一体化生成中的多模态一致性问题?
- 说说你对纯DiT架构在语音生成中的理解?有哪些潜在问题?
- 如何设计实验评估数字人的长时一致性?
- 对于低延迟流式生成,你会采用哪些技术方案?
职位点评
78
综合评分
顶尖AI研究岗,聚焦音视频生成前沿,成长性强,但工作强度未明。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求前沿技术研究和科研突破的博士毕业生,对薪资和成长有较高期待。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活50
使命价值85
薪资福利
75中等
该职位为顶尖人才计划,薪资水平通常较高,但具体福利未在JD中披露。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
95较高
课题处于AI生成前沿,涉及音视频一体化等新兴方向,技术挑战大,研究价值高。
技术前沿前沿/新兴技术
技术栈DiT、Flow Matching、多模态生成、语音合成、扩散模型
业务类型ambiguous
工作生活
50较低
职位要求现场办公,JD未提及弹性工作或加班情况,合肥生活节奏相对适中,但研究工作强度可能较大。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
研究数字人生成技术,旨在提升人机交互体验,具有技术创新和业务赋能价值,对AI行业有推动作用。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs