iFLYTEK logo
科大讯飞
【星火X计划】超长上下文大模型结构建模技术研究(J13794)

【星火X计划】超长上下文大模型结构建模技术研究(J13794)

发布于 大约 14 小时前

普通员工/个人贡献者

合肥市 / 北京市
无经验要求
全职员工
仅现场办公
硕士
机器学习工程
Kv缓存
Megatron-Lm
Pytorch
大模型
注意力机制
深度学习
稀疏注意力
线性注意力
超长上下文

AI 估算 · 25k–45k

顶尖AI研究岗,大模型方向人才稀缺,薪酬竞争力强;但不同城市差异大,综合合肥与北京水平估算。

职位详情

关于这个职位

科大讯飞星火X顶尖AI人才计划,面向超长上下文大模型核心难题,研究线性-稀疏混合注意力架构,突破千万级序列建模的算力、精度与外推瓶颈

你将参与前沿课题研究,产出顶会论文并落地实际大模型训练与部署
适合有扎实深度学习基础、热爱科研挑战的硕博人才

最低要求

-27届硕士及以上学历,计算机科学与技术、人工智能、电子信息、数学、自动化、高性能计算等相关专业,其他专业但具备突出研究和动手能力者同样欢迎

具备扎实的机器学习、深度学习及大模型基础,熟悉 Transformer 架构、各类注意力机制核心原理与技术优劣,掌握大模型预训练、微调、推理全链路技术体系,了解大规模模型训练的各类并行调度优化方案
具备基座大模型预训练及相关前沿研究经验者优先
熟练掌握 Python,具备良好的 C/C++ 编程能力,熟悉 PyTorch 框架
具有 Megatron-LM、TorchTitan等大模型训练框架使用或二次开发经验者优先
具备良好的科研建模、理论分析、算法设计和实验验证能力,能够搭建预训练实验基线,跟踪并复现业界前沿方案,分析关键瓶颈并提出具有创新性的解决思路
在 NeurIPS、ICLR、ICML、ACL 等顶级会议或相关高水平期刊发表过大模型预训练、稀疏模型、深度学习优化等方向论文者优先
具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏

工作职责

开展千万级超长上下文大模型结构建模研究,针对线性注意力和稀疏注意力的缺陷,设计线性-稀疏混合自适应建模架构

构建轻量化时序位置编码与自适应校正机制,解决千万级上下文的位置偏移与外推失效问题
设计层级化次线性KV缓存淘汰与压缩策略,解决超长序列推理缓存爆炸问题
搭建超长上下文模型评测体系,支撑千万级长文本大模型的高效训练与部署
攻克课题挑战中列出的五大核心难题,包括混合架构融合、位置外推、缓存优化、预训练适配和评测体系建设

优先资格

具备基座大模型预训练及相关前沿研究经验者优先

具有 Megatron-LM、TorchTitan 等大模型训练框架使用或二次开发经验者优先
在 NeurIPS、ICLR、ICML、ACL 等顶级会议或相关高水平期刊发表过大模型预训练、稀疏模型、深度学习优化等方向论文者优先

AI 洞察

优缺点分析

优点

  • 前沿研究方向,超长上下文是当前大模型竞争的关键领域,技术价值高
  • 科大讯飞作为上市AI公司,平台大、资源足,有顶会发表和工业落地双重机会
  • 星火X顶尖人才计划有专项培养,成长空间和薪酬回报具有竞争力
  • 两地办公可能面临城市调整,需适应不同城市的生活环境

缺点 / 挑战

  • 研究课题难度大,需突破现有技术瓶颈,对理论功底和创新能力要求高
  • 工作压力较大,需适应快速迭代的工业级研发节奏,且可能涉及跨团队协调
  • 适合对深度学习研究有热情、喜欢挑战技术难题、并希望在大模型领域深耕的硕博人才

角色解读

  • 从研究员到核心技术专家,成为超长上下文大模型方向的领军人物
  • 可转向大模型预训练团队的技术负责人,或聚焦注意力机制研究的学术方向
  • 在科大讯飞内部有机会参与星火大模型的深度迭代,积累工业级实战经验
  • 研究超长上下文大模型的核心结构,设计线性-稀疏混合注意力机制,突破传统Transformer算力瓶颈
  • 解决千万级序列下的位置编码、外推能力和KV缓存优化问题,保障模型在极长文本场景的稳定性和效率
  • 搭建评测体系和预训练基线,复现业界前沿方案并进行创新改进,产出高水平论文和技术沉淀
  • 扎实的机器学习/深度学习基础,深入理解Transformer和各类注意力机制
  • 熟练使用Python和C/C++,熟悉PyTorch,掌握大模型预训练/微调/推理全链路
  • 有科研经验,能独立设计算法、做实验验证,并具备跨团队协作和抗压能力

申请策略

  • 研究科大讯飞星火大模型的技术方向,在面试中展现对业务结合的理解
  • 强调自己的科研潜力和创新思维,而非仅罗列技能,因为该岗位偏向研究
  • 突出科研经历,尤其是Transformer/注意力机制相关的论文或项目
  • 强调大模型预训练或稀疏模型的实际经验,包括使用的框架和具体成果
  • 展示编程能力和工程能力,如PyTorch、Megatron-LM等工具的实际应用
  • 如有顶会论文、比赛获奖或开源贡献,务必重点标注
  • 提前学习最新注意力机制论文(如线性注意力、稀疏注意力),并尝试复现
  • 熟悉Megatron-LM等大模型训练框架,了解分布式并行策略

面试指南

  • 对于技术对比题,先给出定义,再分维度优劣,最后落到本课题的融合思路
  • 对于开放设计题,从问题分析、方案逻辑、关键难点、可行性验证四个步骤展开
  • 对于项目经历题,用STAR法则:背景、任务、行动、结果,突出个人贡献和思考
  • 线性注意力和稀疏注意力各自的优缺点是什么?如何设计混合方案?
  • 如何解决千万级序列下位置编码失效的问题?
  • KV缓存为什么随序列膨胀?有哪些减负策略?
  • 请描述一个你独立完成的深度学习研究项目,遇到哪些瓶颈及如何解决?
  • 如何设计评测体系来验证超长上下文模型的能力?

职位点评

74
综合评分

前沿大模型研究岗,技术含金量高,发展空间大,但工作强度和办公灵活性需权衡。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合以技术成长和科研突破为核心动机,对工作地点灵活性要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活50
使命价值80

薪资福利

70中等

该职位薪资未披露,但作为顶尖人才计划通常薪酬具有竞争力,且公司为上市公司,福利体系完善,但具体待遇需面议。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

职位聚焦前沿大模型技术,研究挑战大,成长空间极高,有产出发顶尖论文和参与核心模型建设的机会。

技术前沿前沿/新兴技术
技术栈注意力机制、Transformer、线性注意力、稀疏注意力、KV缓存、PyTorch、Megatron-LM
业务类型ambiguous

工作生活

50较低

需在合肥或北京现场办公,工作模式未提及灵活安排,研究岗可能面临加班,生活方式偏传统,但未明确负面信号。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

大模型是高速增长赛道,研究超长上下文对AI发展有重要推动作用,社会价值和技术意义显著。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs