iFLYTEK logo
科大讯飞
【星火X计划】面向复杂场景的全双工多模态交互系统研发(J13806)

【星火X计划】面向复杂场景的全双工多模态交互系统研发(J13806)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市
无经验要求
全职员工
仅现场办公
博士
机器学习工程
Megatron
Pytorch
全双工交互
多模态
大模型
注意力机制
深度学习
端侧部署
视觉理解

AI 估算 · 25k–40k

顶尖AI博士计划,前沿技术,合肥薪资中等偏上,月薪2.5-4万。

职位详情

关于这个职位

该职位是科大讯飞“星火X顶尖AI人才计划”下的研发岗,专注于全双工多模态交互系统的研发,致力于解决智能座舱和机器人场景中误唤醒、无法自然打断等问题,涉及多模态大模型、语音视觉融合等前沿技术

作为博士毕业生,你将参与核心算法攻关,推动技术商业化落地

最低要求

-27届博士毕业生,人工智能、计算机科学、深度学习、应用数学、自然语言处理、电子信息等相关专业,具备良好的科研素养与前沿研究视野

理论功底扎实,精通深度学习与大模型核心基础理论,熟悉线性注意力、稀疏注意力的核心原理与技术优劣,掌握大模型预训练、微调、推理全链路技术体系,了解大规模模型训练的各类并行调度优化方案
具备优秀的独立科研攻关与复杂问题拆解能力,能够精准挖掘多模态大模型预训练过程中的核心技术瓶颈,独立完成原创算法方案设计、原理迭代与大规模集群实验验证,具备较强的问题复盘与技术优化思维
拥有扎实的数理推导、算法建模与实验设计能力,可独立完成超长序列建模、注意力机制创新、消融实验设计与多维度性能对标分析
具备良好的工程实操能力,熟练使用PyTorch、Megatron、TorchTitan等主流深度学习及大模型训练工具与框架,熟悉大模型分布式训练、显存优化、算力调度等工程落地技术
具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏

工作职责

端到端多模态流式数据融合与极致低时延的冲突:全双工交互要求响应时延低于500ms(甚至达到200-300ms的人类自然反应水平)

然而,多模态(视觉眼动、唇语、多通道音频)流式数据的输入与对齐需要极高的计算开销
如何在保障多模态特征深度融合的前提下,实现极低延迟的流式推理与决策,是首要挑战
多人复杂场景下“人-人”与“人-机”意图边界的精准判定:在无唤醒词的连续双工状态下,存在大量的“人-人闲聊”、“讲电话”与“人-机对话”交织的场景
系统需利用视觉(视线朝向、唇动)与声学(声纹、语气、语义)的多维信息,在毫秒级内精准断定用户是在与旁人说话还是在对系统下达指令,避免“误唤醒”和“乱接话”
复杂动态声学环境下的声学鲁棒性:针对座舱非平稳噪声环境(风噪、胎噪、雨打车顶声、车内音乐回声及后排儿童嘈杂声)以及机器人移动场景各类周边环境噪声,在全双工过程中,不仅要实现高质量的噪声消除,还要考虑大音量播放音乐或多人同时发声时,能够精准提取并识别目标用户的语音、声纹、语义特征,实现高噪场景的精准交互
端侧受限算力下的多模态大模型部署与优化:多模态大模型参数量大(太小可能效果不行)、计算复杂度高
而在端侧芯片算力、内存受限且需兼顾系统稳定性的环境下,如何进行模型裁剪、量化压缩以及异构算力的高效调度,以极低功耗实现端侧常驻运行,是工程落地上面临的巨大挑战

优先资格

具备多模态大模型预训练及相关前沿研究经验者优先

有ICLR、NeurIPS、ICML等顶会长序列建模、注意力机制相关论文发表或录用经历优先

AI 洞察

优缺点分析

优点

  • 科大讯飞平台资源丰富,课题具有商业落地前景,可参与行业首发的创新项目
  • 顶尖人才计划提供良好的科研环境和成长空间,适合博士发挥研究能力
  • 涉及领域宽泛,要求跨学科知识,需持续学习与突破
  • 端侧部署受限于算力,工程实现复杂,需要耐心与细致
  • 适合对多模态交互、大模型应用有强烈兴趣,具备扎实科研功底和工程能力的博士毕业生,能够适应高强度前沿研发

缺点 / 挑战

  • 前沿技术挑战,涉及多模态大模型、端侧部署等热点方向,技能积累价值高
  • 课题技术难度大,需同时应对低时延、鲁棒性等多重约束,研发压力较高

角色解读

  • 在科大讯飞顶尖人才计划中快速成长为技术专家,主导核心算法方向
  • 向技术管理方向发展,带领团队推进全双工交互技术的产品化落地
  • 依托产学研积累,可向工业界或学术界更高平台发展,成为AI领域领军人才
  • 研发全双工多模态交互系统,整合语音、视觉、唇动等多维信息,实现免唤醒的拟人化交互
  • 攻克端到端多模态流式融合与低时延推理的难题,优化注意力机制和模型架构
  • 解决复杂声学环境下的鲁棒性问题,提升高噪声场景的语音识别与意图判定准确性
  • 负责多模态大模型在端侧算力平台的压缩、量化与部署,确保实时性能
  • 扎实的深度学习与大模型理论基础,熟悉线性/稀疏注意力、预训练、微调和推理全链路
  • 精通PyTorch、Megatron等训练框架,具备分布式训练和显存优化的工程经验
  • 优秀的数学建模和实验设计能力,能独立完成算法创新与消融实验
  • 熟悉多模态数据处理和端侧推理优化,具备跨团队协作与抗压能力

申请策略

  • 了解科大讯飞在智能座舱、机器人领域的布局,结合课题价值准备回答
  • 在简历中明确标注博士毕业年份和符合24-27届要求,突出科研潜力
  • 突出多模态大模型预训练或相关研究项目,展示具体贡献和技术创新
  • 强调在注意力机制、超长序列建模方面的研究成果,如有顶会论文务必列出
  • 展示分布式训练、模型优化等工程实践,证明动手能力
  • 列出参加过的学术竞赛或开源项目,体现团队协作和问题解决能力
  • 深入学习PyTorch、Megatron等框架的分布式训练技巧,尝试复现经典大模型
  • 研究端侧推理优化技术,如量化、剪枝、知识蒸馏等,补充工程经验

面试指南

  • 采用STAR法则,清晰阐述项目背景、任务、行动和结果,突出个人贡献
  • 对于开放性问题,先拆解问题,再提出解决方案,最后说明取舍和验证方法
  • 结合课题挑战中的关键词,展示对技术难点的理解和应对思路
  • 请介绍你参与过的多模态或大模型项目,遇到的难点及解决方法
  • 如何设计一个低时延的全双工交互系统?请说明关键模块
  • 在多人嘈杂环境中,如何区分人-人和人-机对话?请谈谈你的思路
  • 端侧部署大模型时,你会如何权衡模型性能与资源消耗?
  • 请解释你发表论文中的创新点,并说明其在实际场景中的价值

职位点评

76
综合评分

顶尖AI计划,前沿多模态技术,发展空间大,但WLB未明确,适合拼搏型人才。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术突破和职业成长、愿意在高强度研发环境中挑战前沿课题的博士毕业生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活50
使命价值85

薪资福利

70中等

薪资未明确披露,但作为顶尖人才计划,预期薪酬在合肥具有竞争力,福利体系完整。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

92较高

前沿技术方向,课题挑战性高,公司投入大,个人成长空间极佳。

技术前沿前沿/新兴技术
技术栈多模态、全双工、大模型、注意力机制、端侧部署、PyTorch、Megatron
成长机会顶尖AI人才计划、抢占下一代交互技术制高点、技术引领价值
业务类型profit_center

工作生活

50较低

仅现场办公,工作地点在合肥,未提及弹性工作或WLB,可能面临高强度研发压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

课题具有技术引领和商业价值,能推动人机交互变革,社会意义与行业前景好。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号重塑人机交互、打破当前交互体验同质化的瓶颈、树立全新的人机交互标杆
创新程度开拓性创新(行业首创)
Watch Jobs