
科大讯飞
AI研究算法工程师-多模态理解方向(J13372)
AI研究算法工程师-多模态理解方向(J13372)
发布于 大约 4 小时前普通员工/个人贡献者
合肥市
初级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Claude Code
Rl
Sft
多模态理解
数据处理
智能体
模型评估
计算机视觉
预训练
AI 估算 · 20k–35k
AI研究岗,多模态方向热门,校招薪资有竞争力,合肥生活成本较低。
职位详情
关于这个职位
该职位是科大讯飞AI研究院的校招岗位,专注于多模态大模型的前沿研究与开发
你将跟踪业界最新动态,研究高效视觉编码和预训练方法,构建评测体系和数据流程,提升模型在多模态理解、代码智能体等场景的能力
适合对通用人工智能有强烈热情、具备深度学习研究背景的应届硕博
最低要求
有强烈科研热忱与长远科研信念,对通用人工智能充满探索欲,能形成独有的模型行为认知,主动挖掘、攻坚全新研究问题
具备严谨的科研素养,逻辑思维突出,拥有良好研究审美,深耕深度学习领域并在至少一条细分方向形成体系化、深度独立见解
专业技术与工程能力过硬,编程功底扎实,熟练运用各类前沿 AI 工具赋能研发,高效推进实验与落地工作
秉持务实踏实的做事态度,重视数据核心价值,愿意沉下心完善数据与模型相关基础工作,独立快速吃透新兴研究赛道
具备开放包容的协作意识,认同协同共进的团队文化,沟通顺畅、敢于理性质疑,待人平等,拥有全局大局观
广泛且深入跟进行业前沿动态,拥有自主思考与笃定的研究思路,主动探索创新解法,持续推进预训练相关基础研究突破
工作职责
紧跟多模态业界研究动态,研究高效视觉编码模型结构,探索原生多模理解预训练、后训练方法(SFT、RL)
构建多模态理解评测体系,全方位评测模型多模态能力边界,为模型训练提供有效指导
构建人工耦合的多模数据清洗或者合成流程,负责高质量SFT、强化学习多模态理解数据体系构建,通过优质数据持续提升模型能力上限
针对代码智能体、通用智能体场景所用到的多模态理解能力进行加强,提升底座模型的代码和智能体处理能力
基于多模模型探索多模态智能体前瞻研究,包括但不限于Computer Use、Browse Use等
优先资格
研究生阶段具备多模态理解、多模生成、多模态编码等任意研究方向研究基础
以第一作者在CVPR、ICLR、ECCV等AI顶会发表多模大模型等相关论文,若引用达到100以上具备更高优先级
深度使用Claude Code、Codex等AI编程工具,对多模态大模型能力边界、优化方向有真实实践认知
参与过算法、代码、奥数类权威竞赛并取得优异名次,具备扎实的算法与代码功底
在顶尖 AI 公司或实验室的核心团队有过长期实习经历,并有重要研究成果落地到基模大模型
AI 洞察
优缺点分析
优点
- 科大讯飞是AI龙头企业,多模态方向处于行业前沿,研究资源丰富
- 岗位涉及从预训练到智能体的完整链路,技术深度和广度兼备
- 校招进入核心研究院,有顶级会议发表机会,职业起点高
- 合肥生活成本低、房价友好,适合长期发展
- 研究岗对创新能力和自驱力要求极高,需要持续跟踪前沿并快速实验
- 数据工作繁重,可能需要大量时间投入在清洗、合成等基础任务上
- 竞争激烈,校招面向优秀硕博,需有扎实成果才能脱颖而出
- 适合对多模态和通用人工智能有强烈研究热情、具备扎实深度学习基础、愿意沉下心做数据和模型细节的优秀硕博毕业生
缺点 / 挑战
暂无明显挑战项
角色解读
- 从研究员成长为多模态方向的专家,主导核心算法创新
- 向技术Leader方向发展,带领团队攻克前沿难题
- 向通用人工智能架构师演进,构建跨模态统一模型
- 跟踪多模态领域最新研究动态,设计并实验新型视觉编码结构和预训练方法
- 构建多模态评测体系,系统评估模型能力边界,为训练提供反馈
- 开发数据清洗与合成流程,构建高质量SFT和强化学习数据集以提升模型性能
- 针对代码智能体和通用智能体场景增强多模态理解能力,并探索Computer Use等前瞻方向
- 扎实的深度学习理论基础,熟悉Transformer、ViT等主流模型
- 熟练使用PyTorch、TensorFlow等框架,具备大规模分布式训练经验
- 良好的编程能力(Python/C++),能高效实现研究原型
- 熟悉多模态数据处理、评测方法,了解SFT/RL训练范式
申请策略
- 关注科大讯飞AI研究院的技术博客和公开演讲,了解团队研究方向
- 在面试中展现对通用人工智能的认知深度和独立研究思考
- 突出多模态相关的研究经历,包括发表的论文、开源项目或竞赛成绩
- 详细描述在视觉编码、预训练或SFT/RL方面的具体工作和技术细节
- 展示使用AI工具(如Claude Code)提升研发效率的实践案例
- 强调数据处理和评测体系构建的经验,体现扎实工程能力
- 补充多模态大模型最新论文(如LLaVA、Qwen-VL)的复现和理解
- 学习强化学习在语言/视觉模型中的应用(如RLHF、DPO)
面试指南
- 用STAR法则:背景、任务、行动、结果,清晰展示项目贡献
- 对于开放性问题,先阐述基本原理,再结合自身经验给出具体方案
- 展示批判性思维:不仅说明做法,也要分析局限性并提出改进
- 请介绍你参与过的一个多模态项目,包括模型设计、训练过程和结果
- 如何设计一个多模态评测体系?你关注的指标有哪些?
- 谈谈对SFT和RL在多模态理解中作用的看法,以及它们的优缺点
- 如果让你提升一个多模态模型在智能体场景下的表现,你会怎么做?
- 你如何跟踪AI前沿动态?最近感兴趣的一篇论文是什么?
职位点评
85
综合评分
前沿多模态研究岗,成长空间极大,薪资较高,但WLB一般。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合追求技术成长和科研成就、对通用人工智能有使命感、能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活70
使命价值90
薪资福利
80较高
薪资处于校招高端水平,但未在JD中明确;大厂福利较全,稳定性高。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
95较高
前沿研究岗,技术栈先进,有论文发表和晋升通道,成长空间极大。
技术前沿前沿/新兴技术
技术栈多模态理解、视觉编码、预训练、SFT、RL、智能体、Computer Use
业务类型ambiguous
工作生活
70中等
合肥工作,生活成本低,但未提及弹性工作,研究院通常强度较高。
工作模式未明确
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
90较高
通用人工智能方向意义感强,科大讯飞在国内AI领域影响力大,研究具有社会价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号对通用人工智能充满探索欲
创新程度开拓性创新(行业首创)
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs