
科大讯飞
【星火X计划】超长上下文大模型结构建模技术研究(J13794)
【星火X计划】超长上下文大模型结构建模技术研究(J13794)
发布于 大约 14 小时前普通员工/个人贡献者
合肥市 / 北京市
无经验要求
全职员工
仅现场办公
硕士
机器学习工程
Kv缓存
Megatron-Lm
Pytorch
大模型
注意力机制
深度学习
稀疏注意力
线性注意力
超长上下文
AI 估算 · 25k–45k
顶尖AI研究岗,大模型方向人才稀缺,薪酬竞争力强;但不同城市差异大,综合合肥与北京水平估算。
职位详情
关于这个职位
科大讯飞星火X顶尖AI人才计划,面向超长上下文大模型核心难题,研究线性-稀疏混合注意力架构,突破千万级序列建模的算力、精度与外推瓶颈
你将参与前沿课题研究,产出顶会论文并落地实际大模型训练与部署
适合有扎实深度学习基础、热爱科研挑战的硕博人才
最低要求
-27届硕士及以上学历,计算机科学与技术、人工智能、电子信息、数学、自动化、高性能计算等相关专业,其他专业但具备突出研究和动手能力者同样欢迎
具备扎实的机器学习、深度学习及大模型基础,熟悉 Transformer 架构、各类注意力机制核心原理与技术优劣,掌握大模型预训练、微调、推理全链路技术体系,了解大规模模型训练的各类并行调度优化方案
具备基座大模型预训练及相关前沿研究经验者优先
熟练掌握 Python,具备良好的 C/C++ 编程能力,熟悉 PyTorch 框架
具有 Megatron-LM、TorchTitan等大模型训练框架使用或二次开发经验者优先
具备良好的科研建模、理论分析、算法设计和实验验证能力,能够搭建预训练实验基线,跟踪并复现业界前沿方案,分析关键瓶颈并提出具有创新性的解决思路
在 NeurIPS、ICLR、ICML、ACL 等顶级会议或相关高水平期刊发表过大模型预训练、稀疏模型、深度学习优化等方向论文者优先
具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏
工作职责
开展千万级超长上下文大模型结构建模研究,针对线性注意力和稀疏注意力的缺陷,设计线性-稀疏混合自适应建模架构
构建轻量化时序位置编码与自适应校正机制,解决千万级上下文的位置偏移与外推失效问题
设计层级化次线性KV缓存淘汰与压缩策略,解决超长序列推理缓存爆炸问题
搭建超长上下文模型评测体系,支撑千万级长文本大模型的高效训练与部署
攻克课题挑战中列出的五大核心难题,包括混合架构融合、位置外推、缓存优化、预训练适配和评测体系建设
优先资格
具备基座大模型预训练及相关前沿研究经验者优先
具有 Megatron-LM、TorchTitan 等大模型训练框架使用或二次开发经验者优先
在 NeurIPS、ICLR、ICML、ACL 等顶级会议或相关高水平期刊发表过大模型预训练、稀疏模型、深度学习优化等方向论文者优先
AI 洞察
优缺点分析
优点
- 前沿研究方向,超长上下文是当前大模型竞争的关键领域,技术价值高
- 科大讯飞作为上市AI公司,平台大、资源足,有顶会发表和工业落地双重机会
- 星火X顶尖人才计划有专项培养,成长空间和薪酬回报具有竞争力
- 两地办公可能面临城市调整,需适应不同城市的生活环境
缺点 / 挑战
- 研究课题难度大,需突破现有技术瓶颈,对理论功底和创新能力要求高
- 工作压力较大,需适应快速迭代的工业级研发节奏,且可能涉及跨团队协调
- 适合对深度学习研究有热情、喜欢挑战技术难题、并希望在大模型领域深耕的硕博人才
角色解读
- 从研究员到核心技术专家,成为超长上下文大模型方向的领军人物
- 可转向大模型预训练团队的技术负责人,或聚焦注意力机制研究的学术方向
- 在科大讯飞内部有机会参与星火大模型的深度迭代,积累工业级实战经验
- 研究超长上下文大模型的核心结构,设计线性-稀疏混合注意力机制,突破传统Transformer算力瓶颈
- 解决千万级序列下的位置编码、外推能力和KV缓存优化问题,保障模型在极长文本场景的稳定性和效率
- 搭建评测体系和预训练基线,复现业界前沿方案并进行创新改进,产出高水平论文和技术沉淀
- 扎实的机器学习/深度学习基础,深入理解Transformer和各类注意力机制
- 熟练使用Python和C/C++,熟悉PyTorch,掌握大模型预训练/微调/推理全链路
- 有科研经验,能独立设计算法、做实验验证,并具备跨团队协作和抗压能力
申请策略
- 研究科大讯飞星火大模型的技术方向,在面试中展现对业务结合的理解
- 强调自己的科研潜力和创新思维,而非仅罗列技能,因为该岗位偏向研究
- 突出科研经历,尤其是Transformer/注意力机制相关的论文或项目
- 强调大模型预训练或稀疏模型的实际经验,包括使用的框架和具体成果
- 展示编程能力和工程能力,如PyTorch、Megatron-LM等工具的实际应用
- 如有顶会论文、比赛获奖或开源贡献,务必重点标注
- 提前学习最新注意力机制论文(如线性注意力、稀疏注意力),并尝试复现
- 熟悉Megatron-LM等大模型训练框架,了解分布式并行策略
面试指南
- 对于技术对比题,先给出定义,再分维度优劣,最后落到本课题的融合思路
- 对于开放设计题,从问题分析、方案逻辑、关键难点、可行性验证四个步骤展开
- 对于项目经历题,用STAR法则:背景、任务、行动、结果,突出个人贡献和思考
- 线性注意力和稀疏注意力各自的优缺点是什么?如何设计混合方案?
- 如何解决千万级序列下位置编码失效的问题?
- KV缓存为什么随序列膨胀?有哪些减负策略?
- 请描述一个你独立完成的深度学习研究项目,遇到哪些瓶颈及如何解决?
- 如何设计评测体系来验证超长上下文模型的能力?
职位点评
74
综合评分
前沿大模型研究岗,技术含金量高,发展空间大,但工作强度和办公灵活性需权衡。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合以技术成长和科研突破为核心动机,对工作地点灵活性要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活50
使命价值80
薪资福利
70中等
该职位薪资未披露,但作为顶尖人才计划通常薪酬具有竞争力,且公司为上市公司,福利体系完善,但具体待遇需面议。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
90较高
职位聚焦前沿大模型技术,研究挑战大,成长空间极高,有产出发顶尖论文和参与核心模型建设的机会。
技术前沿前沿/新兴技术
技术栈注意力机制、Transformer、线性注意力、稀疏注意力、KV缓存、PyTorch、Megatron-LM
业务类型ambiguous
工作生活
50较低
需在合肥或北京现场办公,工作模式未提及灵活安排,研究岗可能面临加班,生活方式偏传统,但未明确负面信号。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
大模型是高速增长赛道,研究超长上下文对AI发展有重要推动作用,社会价值和技术意义显著。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs