
科大讯飞
【星火X计划】原生多模态通用大模型算法研究(J13980)
【星火X计划】原生多模态通用大模型算法研究(J13980)
发布于 大约 8 小时前实习/见习
合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Pytorch
Vision Transformer
分布式训练
多模态学习
大模型
强化学习
数据治理
视觉语言模型
AI 估算 · 5k–12k
顶尖AI人才计划的实习岗位,综合合肥与北京的薪酬水平及算法研究岗位的市场行情,月薪范围在5k-12k。
职位详情
关于这个职位
加入科大讯飞星火X顶尖AI人才计划,聚焦原生多模态大模型前沿研究,围绕模型架构、数据治理、预训练与评测等方向进行技术攻关
你将参与解决多模态对齐、幻觉抑制等核心难题,推动模型在视觉理解、视频分析等场景落地,并有充足机会发表高水平论文
最低要求
届及以后在读硕士及以上学历,人工智能、计算机科学与技术、计算机视觉、电子信息、自动化、应用数学等相关专业,其他专业但具备突出研究和动手能力者同样欢迎
具备扎实的机器学习、深度学习和大模型基础,熟悉 Transformer、Vision Transformer、视觉语言模型等基本架构,了解多模态模型的主要训练流程与技术范式
熟练掌握 Python,具备良好的 C/C++ 编程能力,熟悉 PyTorch 框架
熟悉多模态模型相关技术,包括但不限于视觉编码器、模态连接器、图文对比学习、多模态位置编码、动态分辨率、视觉指令微调、多模态偏好对齐及强化学习等
具备良好的沟通协作能力,能够与数据、预训练、工程、推理及业务团队协同完成算法落地、模型迭代和应用适配
具有较强的责任心、执行力和复杂问题解决能力
工作职责
【课题介绍】
本课题聚焦通用原生多模态大模型研发中的核心技术瓶颈,围绕原生多模态模型架构、多模态数据智能治理、高效预训练与对齐、多模态理解与推理、高分辨率图像和长视频建模、大规模分布式训练优化及模型评测等核心方向,构建具备统一感知、深度理解、复杂推理和可靠生成能力的通用多模态模型体系
针对多模态模型训练过程中存在的模态表征差异大、图文语义对齐困难、视觉信息压缩损失、多模态数据质量参差、不同模态与任务训练失衡、高分辨率及长视频计算成本高、细粒度感知能力不足、多模态幻觉突出等问题,开展系统性研究
通过协同优化模型架构、视觉编码器、模态连接模块、预训练目标、数据配比、损失权重、课程学习及分布式训练策略,建立覆盖数据治理、模型训练、能力评测和工业级落地的完整技术方案
课题将支撑通用多模态基座模型的高效、稳定训练,建设标准化、自动化、可迭代的多模态能力评测体系,形成“数据构建—模型训练—能力评测—问题归因—算法迭代”的完整闭环,持续提升模型在通用视觉理解、视频理解、文档解析、视觉推理、内容生成及多模态智能体等方向的能力
【课题挑战】
原生多模态模型架构研究挑战
不同模态在信息密度、时空结构、序列长度及语义粒度方面存在显著差异,传统的“视觉编码器+连接模块+语言模型”架构容易出现视觉信息压缩过度、模态交互不足及细粒度信息丢失等问题
需要研究高效视觉与音频编码器、模态连接机制、统一自注意力架构、多模态位置编码、动态分辨率建模及统一理解生成架构,探索模型深度、宽度、视觉词元数量与语言模型规模之间的最优配置,构建兼顾模型能力、训练效率和推理成本的原生多模态模型架构
多模态数据构建与智能治理挑战
互联网多模态数据普遍存在图文错配、描述信息不足、内容重复、噪声较多、领域分布不均、时效性不足及版权安全风险等问题
视频、文档、图表、OCR 和专业领域数据还面临高质量标注稀缺、语义粒度不一致及自动化处理成本高等挑战
需要研究多模态数据过滤、去重、语义匹配、质量评估、知识增强、难例挖掘及合成数据生成方法,建设覆盖图文对、交错图文、视频文本、文档图表及多轮视觉对话等数据形态的自动化治理体系,从数据源头提升模型训练效率与能力上限
多模态预训练与模态均衡挑战
多模态预训练同时包含视觉识别、图文对齐、语言建模、视觉问答、定位、生成及多轮交互等多类目标
不同任务的数据规模、序列长度、损失量级和学习难度差异较大,容易出现语言模态占据主导、视觉能力学习不足、部分任务梯度冲突及模型能力相互干扰等问题
需要研究统一多模态预训练目标、任务采样、课程学习、梯度平衡及损失归一化方法,合理设计词元级、样本级和任务级权重,解决长短样本、不同模态及不同任务之间的训练失衡问题,实现多模态能力的协调学习与稳定提升
多模态理解、推理与幻觉抑制挑战
多模态模型在细粒度目标识别、空间关系理解、时序事件分析、文档图表解析及复杂视觉推理等任务中,容易出现感知错误、推理链断裂、视觉证据利用不足及生成内容与输入不一致等问题
需要研究细粒度视觉表征、目标定位与指代消解、空间和时序建模、证据约束推理、视觉思维链及事实一致性校验方法,提升模型基于视觉证据进行复杂推理的能力,降低对象、属性、数量、位置和事件关系等方面的多模态幻觉
多模态能力评测与迭代闭环挑战
建设覆盖通用视觉理解、OCR、文档与图表解析、空间关系、视觉定位、视频理解、复杂推理、内容生成及多模态智能体等方向的综合评测体系
通过训练过程监控、阶段性能力评测、数据污染检测、错误样本聚类及模型行为归因,准确区分感知错误、知识缺失、推理错误和语言表达错误,定位模型能力短板,支撑多模态数据、模型架构和训练算法持续迭代
【课题价值】
提升通用多模态理解与推理能力
推动模型从基础图像识别和图文问答,向细粒度感知、复杂视觉推理、长视频理解及真实环境交互演进,持续提升模型理解和处理现实世界多模态信息的能力
构建高质量多模态数据与算法体系
形成标准化、可复用、可扩展的多模态数据治理方案、训练范式与评测体系,缓解图文错配、数据噪声、任务失衡和视觉信息利用不足等问题,为通用多模态基座模型持续迭代提供核心支撑
降低多模态模型训练与推理成本
通过视觉词元压缩、动态分辨率、数据流水线优化及多维并行训练等技术,降低高分辨率图像和长视频带来的计算、显存、通信及存储开销,提高 GPU 集群有效利用率和模型推理效率
支撑多模态模型规模化应用
提升模型在文档理解、图表分析、内容创作、视频分析、视觉搜索、人机交互及多模态智能体等场景中的可用性和可靠性,为多模态模型的规模化落地提供技术基础
构建核心技术竞争力与学术影响力
形成自主可控的多模态大模型技术体系,产出高水平学术论文、原创算法模块、评测基准及开源工具,提升公司在通用多模态模型领域的技术影响力,支撑下一代多模态基座模型持续演进
优先资格
具有 Transformers、Megatron-LM、DeepSpeed、Colossal-AI 等框架使用或二次开发经验者优先
具有相关科研或项目经历者优先
具有多模态数据构建与治理经验,熟悉图文数据过滤、去重、质量评估、数据合成、任务配比或动态采样等方法者优先
在 NeurIPS、ICLR、ICML、CVPR、ICCV、ECCV等顶级会议或相关高水平期刊发表过多模态学习、计算机视觉、自然语言处理或大模型相关论文者优先
AI 洞察
优缺点分析
优点
- 依托科大讯飞的平台和资源,与顶尖AI研究团队合作,学习氛围浓厚
- 提供合肥和北京两个可选工作地点,兼顾地域灵活性,适合不同求职者
- 课题兼具学术与工业价值,有发表权威论文和将成果落地到实际业务的机会
- 对技术栈要求高,需掌握分布式训练、模型调优等复杂工程技能,学习曲线较陡
- 作为实习岗位可能需要适应高强度研发节奏,工作精力投入大
缺点 / 挑战
- 课题技术前沿,挑战性高,含金量大,能显著提升个人技术品牌和行业影响力
- 多模态训练中的技术难题众多,科研压力较大,需要较强的抗压能力和问题解决能力
- 适合对多模态大模型有浓厚兴趣、具备扎实算法基础和科研自驱力的在读硕博生,特别是渴望挑战前沿课题并积累顶级工业研究经验的人
角色解读
- 通过星火X计划深度参与工业级大模型研发,快速积累多模态领域的前沿技术与工程经验
- 有机会产出高水平论文和专利,成长为多模态算法专家或研究科学家
- 未来可晋升为技术负责人或转向大模型产品化方向,拓展职业发展空间
- 参与原生多模态大模型的核心算法研究,包括模型架构设计、视觉编码器优化、模态对齐与融合等关键方向
- 负责多模态数据的治理与构建,研究数据过滤、去重、质量评估、合成数据等方法,提升训练数据质量
- 探索高效预训练与对齐技术,解决多模态训练中的模态失衡、梯度冲突等问题,优化训练策略
- 搭建多模态能力评测体系,通过错误分析和行为归因驱动模型迭代,并参与工业级应用落地
- 扎实的机器学习/深度学习基础,深入理解Transformer、ViT等架构,掌握多模态模型训练范式
- 精通Python和PyTorch,具备C/C++编程能力,熟悉分布式训练框架如DeepSpeed、Megatron-LM
- 熟悉多模态相关技术,如图文对比学习、视觉指令微调、多模态对齐与强化学习等,有实际项目经验
- 具备科研能力,能够阅读前沿论文、设计实验并分析结果,有顶级会议论文发表经历更佳
申请策略
- 申请时可在简历或求职信中阐述对原生多模态架构的理解和思考,体现研究热情
- 提前了解科大讯飞在多模态领域的产品和布局,面试时结合业务场景展示个人见解
- 重点展示多模态相关的项目经历,如视觉语言模型预训练、图文检索或视频理解等
- 突出顶会论文或开源项目贡献,量化成果如提升的准确率或效率
- 强调分布式训练和大规模模型优化的工程实践,说明使用的框架和具体方案
- 在技能清单中明确写出PyTorch、Megatron-LM、DeepSpeed等工具的应用经验
- 系统学习多模态前沿论文,如CLIP、LLaVA、Flamingo等,深入理解架构和训练方法
- 动手实践一个多模态小模型的预训练或微调,熟悉数据处理、分布式训练和评估流程
面试指南
- 采用STAR法则:清晰描述项目背景、任务目标、具体行动和量化结果,突出个人贡献
- 先拆解问题成因,再给出技术方案,最后说明效果评估和迭代方法,展现系统性思维
- 结合前沿论文和工作经验,展示对技术趋势的理解,并联系实际落地场景
- 请介绍你参与过的多模态项目,使用了什么模型架构,遇到的最大挑战是什么?
- 如何解决多模态训练中不同模态之间的训练失衡问题?请举例说明
- 你如何看待原生多模态架构?与常见的'编码器-连接器-语言模型'架构相比,优劣势是什么?
- 如何减少多模态模型中的幻觉现象?有哪些可行的技术手段?
- 设计一个多模态数据清洗和质量评估的流程,你会如何规划?
职位点评
68
综合评分
顶尖AI人才计划,主攻多模态大模型前沿研究,技术含金量高,但实习薪资和WLB一般。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
该职位最适合追求技术快速成长和前沿研究体验,同时对薪资和WLB要求不高的在读硕博生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活45
使命价值75
薪资福利
60中等
该职位为实习岗位,薪资未在JD中披露,薪酬竞争力未知,总体补偿性一般。
薪资信号未披露(AI估算:5K-12K/月)
成长发展
85较高
作为顶尖AI人才计划,提供前沿多模态研究课题和工业级平台,技术成长机会显著,发展性动机满足度高。
技术前沿前沿/新兴技术
技术栈多模态、Transformer、Vision Transformer、PyTorch、Python、分布式训练、视觉语言模型、强化学习、数据治理、Megatron-LM、DeepSpeed
业务类型profit_center
工作生活
45较低
工作地点在合肥或北京,需要现场办公,未提及弹性工作或WLB,科研强度可能较大,生活方式满足度有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
多模态大模型是当前AI热点,对推动技术进步有正面影响,课题具有较高的科技和社会价值,意义感较强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs