iFLYTEK logo
科大讯飞
【星火X计划】原生多模态通用大模型算法研究(J13798)

【星火X计划】原生多模态通用大模型算法研究(J13798)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市 / 北京市
初级经验
全职员工
仅现场办公
硕士
机器学习工程
Pytorch
Vision Transformer
分布式训练
图像理解
多模态学习
大模型
数据治理
模型评测
视频理解

AI 估算 · 25k–50k

大模型算法研究岗,技术要求高,顶尖人才计划,薪资竞争力强,合肥北京两地生活成本差异,取中高水平。

职位详情

关于这个职位

本职位是科大讯飞星火X顶尖AI人才计划下的原生多模态通用大模型算法研究岗,聚焦多模态模型架构、数据治理、预训练与对齐、多模态理解与推理、高分辨率图像和长视频建模、大规模分布式训练优化及模型评测等核心方向,需要开展系统性研究并构建完整的多模态模型技术方案

适合对多模态大模型有深入研究和实践经验的硕博人才

最低要求

-27届硕士及以上学历,人工智能、计算机科学与技术、计算机视觉、电子信息、自动化、应用数学等相关专业,其他专业但具备突出研究和动手能力者同样欢迎

具备扎实的机器学习、深度学习和大模型基础,熟悉 Transformer、Vision Transformer、视觉语言模型等基本架构,了解多模态模型的主要训练流程与技术范式
熟练掌握 Python,具备良好的 C/C++ 编程能力,熟悉 PyTorch 框架
具有 Transformers、Megatron-LM、DeepSpeed、Colossal-AI 等框架使用或二次开发经验者优先
熟悉多模态模型相关技术,包括但不限于视觉编码器、模态连接器、图文对比学习、多模态位置编码、动态分辨率、视觉指令微调、多模态偏好对齐及强化学习等
具有相关科研或项目经历者优先
具有多模态数据构建与治理经验,熟悉图文数据过滤、去重、质量评估、数据合成、任务配比或动态采样等方法者优先
具备良好的沟通协作能力,能够与数据、预训练、工程、推理及业务团队协同完成算法落地、模型迭代和应用适配
具有较强的责任心、执行力和复杂问题解决能力
在 NeurIPS、ICLR、ICML、CVPR、ICCV、ECCV等顶级会议或相关高水平期刊发表过多模态学习、计算机视觉、自然语言处理或大模型相关论文者优先

工作职责

【课题介绍】

本课题聚焦通用原生多模态大模型研发中的核心技术瓶颈,围绕原生多模态模型架构、多模态数据智能治理、高效预训练与对齐、多模态理解与推理、高分辨率图像和长视频建模、大规模分布式训练优化及模型评测等核心方向,构建具备统一感知、深度理解、复杂推理和可靠生成能力的通用多模态模型体系
针对多模态模型训练过程中存在的模态表征差异大、图文语义对齐困难、视觉信息压缩损失、多模态数据质量参差、不同模态与任务训练失衡、高分辨率及长视频计算成本高、细粒度感知能力不足、多模态幻觉突出等问题,开展系统性研究
通过协同优化模型架构、视觉编码器、模态连接模块、预训练目标、数据配比、损失权重、课程学习及分布式训练策略,建立覆盖数据治理、模型训练、能力评测和工业级落地的完整技术方案
课题将支撑通用多模态基座模型的高效、稳定训练,建设标准化、自动化、可迭代的多模态能力评测体系,形成“数据构建—模型训练—能力评测—问题归因—算法迭代”的完整闭环,持续提升模型在通用视觉理解、视频理解、文档解析、视觉推理、内容生成及多模态智能体等方向的能力
【课题挑战】
原生多模态模型架构研究挑战
不同模态在信息密度、时空结构、序列长度及语义粒度方面存在显著差异,传统的“视觉编码器+连接模块+语言模型”架构容易出现视觉信息压缩过度、模态交互不足及细粒度信息丢失等问题
需要研究高效视觉与音频编码器、模态连接机制、统一自注意力架构、多模态位置编码、动态分辨率建模及统一理解生成架构,探索模型深度、宽度、视觉词元数量与语言模型规模之间的最优配置,构建兼顾模型能力、训练效率和推理成本的原生多模态模型架构
多模态数据构建与智能治理挑战
互联网多模态数据普遍存在图文错配、描述信息不足、内容重复、噪声较多、领域分布不均、时效性不足及版权安全风险等问题
视频、文档、图表、OCR 和专业领域数据还面临高质量标注稀缺、语义粒度不一致及自动化处理成本高等挑战
需要研究多模态数据过滤、去重、语义匹配、质量评估、知识增强、难例挖掘及合成数据生成方法,建设覆盖图文对、交错图文、视频文本、文档图表及多轮视觉对话等数据形态的自动化治理体系,从数据源头提升模型训练效率与能力上限
多模态预训练与模态均衡挑战
多模态预训练同时包含视觉识别、图文对齐、语言建模、视觉问答、定位、生成及多轮交互等多类目标
不同任务的数据规模、序列长度、损失量级和学习难度差异较大,容易出现语言模态占据主导、视觉能力学习不足、部分任务梯度冲突及模型能力相互干扰等问题
需要研究统一多模态预训练目标、任务采样、课程学习、梯度平衡及损失归一化方法,合理设计词元级、样本级和任务级权重,解决长短样本、不同模态及不同任务之间的训练失衡问题,实现多模态能力的协调学习与稳定提升
多模态理解、推理与幻觉抑制挑战
多模态模型在细粒度目标识别、空间关系理解、时序事件分析、文档图表解析及复杂视觉推理等任务中,容易出现感知错误、推理链断裂、视觉证据利用不足及生成内容与输入不一致等问题
需要研究细粒度视觉表征、目标定位与指代消解、空间和时序建模、证据约束推理、视觉思维链及事实一致性校验方法,提升模型基于视觉证据进行复杂推理的能力,降低对象、属性、数量、位置和事件关系等方面的多模态幻觉
多模态能力评测与迭代闭环挑战
建设覆盖通用视觉理解、OCR、文档与图表解析、空间关系、视觉定位、视频理解、复杂推理、内容生成及多模态智能体等方向的综合评测体系
通过训练过程监控、阶段性能力评测、数据污染检测、错误样本聚类及模型行为归因,准确区分感知错误、知识缺失、推理错误和语言表达错误,定位模型能力短板,支撑多模态数据、模型架构和训练算法持续迭代
【课题价值】
提升通用多模态理解与推理能力
推动模型从基础图像识别和图文问答,向细粒度感知、复杂视觉推理、长视频理解及真实环境交互演进,持续提升模型理解和处理现实世界多模态信息的能力
构建高质量多模态数据与算法体系
形成标准化、可复用、可扩展的多模态数据治理方案、训练范式与评测体系,缓解图文错配、数据噪声、任务失衡和视觉信息利用不足等问题,为通用多模态基座模型持续迭代提供核心支撑
降低多模态模型训练与推理成本
通过视觉词元压缩、动态分辨率、数据流水线优化及多维并行训练等技术,降低高分辨率图像和长视频带来的计算、显存、通信及存储开销,提高 GPU 集群有效利用率和模型推理效率
支撑多模态模型规模化应用
提升模型在文档理解、图表分析、内容创作、视频分析、视觉搜索、人机交互及多模态智能体等场景中的可用性和可靠性,为多模态模型的规模化落地提供技术基础
构建核心技术竞争力与学术影响力
形成自主可控的多模态大模型技术体系,产出高水平学术论文、原创算法模块、评测基准及开源工具,提升公司在通用多模态模型领域的技术影响力,支撑下一代多模态基座模型持续演进

优先资格

具有 Transformers、Megatron-LM、DeepSpeed、Colossal-AI 等框架使用或二次开发经验者优先

具有相关科研或项目经历者优先
具有多模态数据构建与治理经验,熟悉图文数据过滤、去重、质量评估、数据合成、任务配比或动态采样等方法者优先
在 NeurIPS、ICLR、ICML、CVPR、ICCV、ECCV等顶级会议或相关高水平期刊发表过多模态学习、计算机视觉、自然语言处理或大模型相关论文者优先

AI 洞察

优缺点分析

优点

  • 属于科大讯飞星火X顶尖人才计划,公司资源倾斜,平台大,能接触到工业级大规模模型训练
  • 研究方向前沿,覆盖多模态大模型全链路,技能积累价值高,职业竞争力强
  • 工作内容包括学术研究和工程落地,既能发论文又能做产品,发展空间大
  • 研究课题难度大,需要同时掌握模型架构、数据、训练、评测等多方面知识,学习曲线陡峭
  • 大模型训练对计算资源依赖大,可能面临长时间调试和高压工作,需要较强抗压能力
  • 作为顶尖人才计划,竞争激烈,绩效要求高,需要持续产出创新成果
  • 适合对多模态大模型有强烈研究兴趣、具备扎实算法功底和高自驱力的硕博人才,尤其是有顶会论文或大规模训练经验的人

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从研究员成长为多模态大模型方向的专家,主导或参与核心模型的设计与迭代
  • 可向技术专家或技术管理方向发展,带领团队攻克模型研发中的关键难题
  • 有大量机会发表高水平学术论文、参与开源项目,提升学术和行业影响力
  • 研究原生多模态大模型的核心技术,包括模型架构设计、视觉编码器、模态连接机制和统一理解生成架构
  • 构建多模态数据治理体系,负责数据过滤、去重、质量评估和合成数据生成,从数据源头提升模型训练效果
  • 优化多模态预训练和微调流程,解决模态表征差异、任务训练失衡、多模态幻觉等问题,并参与大规模分布式训练优化
  • 建设多模态能力评测体系,通过训练监控、错误归因和迭代闭环持续提升模型能力
  • 扎实的机器学习和深度学习基础,熟悉Transformer、Vision Transformer等主流架构
  • 熟练掌握Python和PyTorch,具备C/C++编程能力,有分布式训练框架(如Megatron-LM、DeepSpeed)使用经验更佳
  • 熟悉多模态关键技术,如视觉编码器、图文对比学习、视觉指令微调、多模态偏好对齐等
  • 具备多模态数据处理与治理经验,了解数据清洗、去重、质量评估和任务配比等方法

申请策略

  • 了解科大讯飞多模态大模型(如讯飞星火)的技术路线和公开成果,面试时展现业务理解
  • 强调对多模态模型痛点的思考和解决思路,展示系统性研究能力
  • 重点突出多模态相关研究或项目经历,如参与过视觉语言模型训练、数据清洗或模型微调
  • 强调分布式训练框架的使用经验,如Megatron-LM、DeepSpeed,以及大规模集群训练的经历
  • 列出已发表的顶会论文或高质量开源项目,展示学术研究能力
  • 突出解决复杂问题的具体案例,例如如何降低幻觉、平衡多模态训练等
  • 提前补充多模态前沿技术,如视觉指令微调、多模态RLHF、MLLM架构等
  • 熟悉分布式训练框架的原理和使用,了解数据并行、张量并行、流水线并行等策略

面试指南

  • 采用STAR法则:情境-任务-行动-结果,清晰展示你的研究/项目经历
  • 对于算法问题,先分析问题根源,再给出可行的技术路线,最后说明实验验证方案
  • 结合具体数据或案例来回答,体现你的实操能力和解决问题的深度
  • 请详细介绍一下你参与过的多模态大模型项目,包括模型架构、训练流程和遇到的挑战
  • 多模态训练中如何解决模态表征差异大和任务训练失衡的问题?你有何解决方案?
  • 如何降低多模态模型的幻觉现象?请结合具体研究方向谈谈思路
  • 你使用过哪些分布式训练框架?在训练大模型时如何优化显存和通信开销?
  • 如果让你构建一个多模态数据治理流程,你会如何设计数据清洗和质量评估标准?

职位点评

69
综合评分

顶尖人才计划,大模型研究前沿,成长空间大,但工作强度可能较高,薪资未明。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
该职位最适合追求技术成长和前沿研究、渴望在AI领域有所作为的求职者,对薪资和WLB要求不高但看重发展平台。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展88
工作生活45
使命价值78

薪资福利

60中等

JD未披露具体薪资和福利,但作为上市公司顶尖人才计划,预计薪酬有一定竞争力,具体需面议。

薪资信号未披露(AI估算:25K-50K/月)

成长发展

88较高

该职位位于大模型技术最前沿,研究内容覆盖算法、数据、工程全链路,且属于公司顶尖人才计划,成长资源丰富,发展空间大。

技术前沿前沿/新兴技术
技术栈Python、PyTorch、Transformer、Vision Transformer、Megatron-LM、DeepSpeed、Colossal-AI、多模态学习、分布式训练
业务类型ambiguous

工作生活

45较低

JD未提及远程办公或弹性工作制,工作地点在合肥和北京,且大模型研究岗通常任务重,工作与生活平衡可能一般。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

78中等

多模态大模型是人工智能的核心方向,行业前景广阔,该职位致力于构建通用多模态模型体系,有较高的技术价值和社会影响。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs