iFLYTEK logo
科大讯飞
【星火X计划】基于多模态大模型的类人辅学系统研发(J13982)

【星火X计划】基于多模态大模型的类人辅学系统研发(J13982)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市
无经验要求
全职员工
仅现场办公
博士
机器学习工程
Deepspeed
K12教育
Mllm
Pytorch
Vllm
多模态大模型
视觉推理
Ai辅学
Multimodal Cot

AI 估算 · 30k–60k

顶尖AI博士人才计划,技术门槛高,合肥薪资竞争力强,整体偏高。

职位详情

关于这个职位

该职位是科大讯飞星火X顶尖AI人才计划,聚焦多模态大模型在K12教育场景的应用研发

你将参与攻克复杂图文感知、多模态推理、幻觉抑制等核心难题,推动高精度AI辅学系统落地
适合具备扎实科研能力和多模态大模型经验的博士毕业生

最低要求

-27届博士毕业生,人工智能、计算机科学、计算机视觉、自然语言处理、多模态学习、深度学习等相关专业,具备良好的科研素养与前沿研究视野

理论功底扎实,精通多模态大模型(MLLM)与大语言模型基础理论,熟悉主流视觉模型与多模态架构(如LLaVA、Qwen-VL等)
具备优秀的独立科研攻关与复杂问题拆解能力,能够准确挖掘多模态大模型在高精度场景下“感知-推理”协同受限的技术瓶颈,独立完成原创算法方案设计、数据合成管线搭建与大规模模型训练验证
拥有扎实的数理推导、算法建模与实验设计能力
具备良好的工程实操能力,熟练使用PyTorch及主流大模型训练/推理框架(如Megatron、DeepSpeed、vLLM等),熟悉多模态分布式训练、显存优化及推理加速方案
具备良好的跨团队协作能力,可协同预训练、数据构建、工程加速及业务落地团队推进多模态推理优化技术的迭代,抗压能力强,能够紧跟工业级前沿算法研发节奏

工作职责

复杂图文的细粒度感知与特征提取难题:打破常规多模态架构的表征瓶颈,探索动态分辨率、视觉Token自适应筛选与无损压缩机制,实现高精度感知与视觉特征和文本逻辑的精细对齐

多模态多步推理与幻觉抑制难题:探索多模态思维链(Multimodal CoT)与跨模态溯源(Grounding)机制,保障推理每一步准确对应视觉输入
语言先验偏见与“视觉忽视”难题:研究跨模态特征的均衡融合与去偏策略,建立强制视觉依赖机制
多模态过程监督难题:探索代码化图文生成、模型自动化标注等数据合成方法,构建多模态过程奖励模型
多模题图片准确复刻难题:探索基于coding能力的绘图模型,实现题干图形的准确复刻,提升图形化讲解准确性

优先资格

对多模态复杂推理(Visual Reasoning)、图片思维链(Multimodal CoT)、细粒度感知及多模态强化学习有深入研究者优先

有CVPR、ICLR、NeurIPS、ACL、ICCV等顶会在多模态大模型、视觉推理、强化学习对齐等相关方向论文发表或录用经历优先
具备多模态基座模型预训练或SFT微调经验者优先

AI 洞察

优缺点分析

优点

  • 科大讯飞在AI领域有深厚积累,平台资源丰富,数据与场景优势明显
  • 顶尖人才计划提供有竞争力的薪酬和明确的培养路径
  • 研究成果可直接落地教育业务,社会价值与商业价值兼备
  • 对科研能力要求极高,需持续产出创新成果并保持前沿敏感度
  • 需在快速迭代的工业级研发节奏中保持高质量输出,抗压能力要求高

缺点 / 挑战

  • 课题极具挑战性和创新性,技术成长空间大,可接触前沿多模态技术
  • 课题难度大,需攻克感知、推理等多重技术难题,工作强度可能较高
  • 适合有扎实多模态大模型研究背景、热爱技术挑战、追求科研突破并愿意接受高强度工作的博士毕业生

角色解读

  • 在顶尖AI平台积累多模态前沿技术经验,成为该领域的专家
  • 可向技术专家或架构师方向发展,主导高影响力项目
  • 有发表顶会论文和申请专利的机会,提升学术和行业影响力
  • 负责多模态大模型在K12教育场景的算法研发,包括复杂图文感知、多模态推理增强等核心模块
  • 设计并实现端到端的多模态感知与推理架构,解决高精度辅学任务中的技术瓶颈
  • 构建数据合成管线,生成多模态过程标注数据,训练过程奖励模型以优化推理质量
  • 与工程和业务团队协作,推动模型在真实教育产品中的落地与迭代
  • 精通多模态大模型理论,熟悉LLaVA、Qwen-VL等主流架构及训练方法
  • 扎实的深度学习基础和PyTorch编程能力,熟悉分布式训练框架(如DeepSpeed、Megatron)
  • 具备独立科研能力,能进行算法方案设计、实验验证和问题拆解
  • 良好的跨团队协作能力,能推动研究到工程的转化

申请策略

  • 提前了解科大讯飞星火大模型的发展战略及教育业务布局,在面试中展现对落地场景的理解
  • 强调你对K12教育领域痛点的认识,以及如何用技术解决真实问题
  • 突出多模态大模型相关项目或论文,特别是视觉推理、Multimodal CoT等方向
  • 强调工程实现能力,如PyTorch、分布式训练、模型加速等具体经验
  • 展示独立科研能力,如主导过复杂算法设计或完整的数据管线搭建
  • 如有顶会论文务必置于显眼位置,并说明个人贡献
  • 深入研究主流多模态架构(如LLaVA、Qwen-VL)的代码实现和训练细节
  • 掌握DeepSpeed、Megatron等分布式训练技巧,熟悉vLLM等推理加速方案

面试指南

  • 使用STAR法描述项目,清晰阐述背景、任务、行动和结果,突出个人贡献
  • 从感知和推理两个层面拆解问题,结合具体技术方案(如动态分辨率、CoT、过程监督)进行阐述
  • 对比现有方法的优劣,说明你的创新点和实验验证依据
  • 请介绍你多模态大模型相关的研究工作,尤其是如何解决感知与推理的协同问题
  • 针对复杂图表中微小目标感知,你有哪些技术思路?
  • 多模态思维链与纯文本思维链有何不同?训练时如何监督多模态推理过程?
  • 如何设计实验验证模型在97%精度要求下的表现?
  • 在资源受限的工业场景中,如何平衡模型性能和推理速度?

职位点评

76
综合评分

顶尖AI人才计划,前沿多模态大模型研发,高薪高成长但工作强度大。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
该职位最适合追求技术前沿和科研突破、愿意投入高强度工作的博士毕业生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活50
使命价值70

薪资福利

75中等

该职位提供有竞争力的薪资和福利,且公司平台稳定,满足补偿性动机。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

95较高

课题处于多模态大模型前沿,技术挑战大,成长空间极高,完美契合发展性动机。

技术前沿前沿/新兴技术
技术栈MLLM、视觉推理、Multimodal CoT、PyTorch、DeepSpeed、vLLM
业务类型profit_center

工作生活

50较低

工作地点固定在合肥,研发强度大,且JD暗示需抗压跟进前沿节奏,生活化动机满足有限。

工作模式仅现场办公
办公地点科技园/产业园
加班情况JD含高强度暗示词

使命价值

70中等

AI教育应用有积极社会价值,但核心仍是商业落地,意义感动机有一定满足。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号解决大模型在严肃教育场景中...的痛点
创新程度开拓性创新(行业首创)
Watch Jobs