iFLYTEK logo
科大讯飞
【星火X计划】面向大模型高效训推的算子研发与极致优化(J13984)

【星火X计划】面向大模型高效训推的算子研发与极致优化(J13984)

发布于 大约 8 小时前

实习/见习

合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Ascend C
Cuda
Kernel开发
Pytorch
大模型
算子优化
高性能计算

AI 估算 · 6k–12k

顶尖AI人才计划实习,技术要求高,薪酬高于普通实习,综合考虑北京、合肥两地市场水平。

职位详情

关于这个职位

这是科大讯飞星火X顶尖AI人才计划下的实习岗位,聚焦大模型训练推理中算子的极致性能优化

你将深入研究GPU/NPU硬件微架构,使用CUDA、Triton等开发高性能Kernel,解决算力利用率低的瓶颈,适合对AI基础设施底层技术有热情、乐于挑战极限的硕士生

最低要求

届及以后在读硕士及以上学历,人工智能、计算机科学、高性能计算、数学、电子信息等相关专业,其他专业但具备突出工程能力者同样欢迎

具备扎实的计算机架构基础,熟练使用linux操作系统
熟练使用Git、VSCode等,熟练使用Pytorch、numpy等框架
对GPU/NPU等AI加速芯片的体系结构有深入理解,熟悉CUDA/Ascend C/Triton/TileLang等至少一种编程模型,有实际的Kernel开发调优经验
较强的编程实现能力,熟练掌握C/C++,Python等语言,有底层性能优化项目经验
具备较强的独立思考能力,具备追求卓越,不断突破创新精神,不断通过效率分析提升算子效率

工作职责

关键算子极致优化:针对大模型核心算子,结合硬件微架构特征(向量单元、矩阵单元、缓存层次、张量切分等),实现高算力利用率的高性能Kernel开发

通算融合:结合超节点等互联架构,实现计算与通信高效融合,降低分布式整体并行开销
算子自动调优与编译优化:研发面向大模型的算子自动调优框架,融合Tiling策略搜索、内存层次优化与指令调度,减少算子实现的人工调优成本,提升跨模型架构的算子复用性

AI 洞察

优缺点分析

优点

  • 公司平台大,资源丰富,星火X计划提供顶尖人才培养体系,导师资源优质
  • 课题涉及算子自动调优、通算融合等新兴方向,技能积累具有长期稀缺性
  • 可选择合肥或北京办公,两地都有AI产业生态,发展机会多
  • 岗位要求深厚的技术功底,需要同时掌握硬件架构、并行计算和编程语言,学习曲线陡峭
  • 实习期间需要快速产出成果,对独立思考能力和问题解决能力要求很高
  • 适合对底层系统充满热情、享受性能极致优化、具备强自驱力和扎实编程基础的计算机相关专业在读硕士

缺点 / 挑战

  • 参与业界领先的大模型基础设施优化工作,技术含量高,接触最前沿的AI计算挑战
  • 优化工作充满不确定性,可能需要反复实验和调试,工作节奏快、压力较大

角色解读

  • 从算子优化实习生成长为AI基础设施领域的技术专家,深耕高并发、低延迟计算
  • 可向大模型训练推理框架、编译器、异构计算等方向深入发展,成为系统架构师
  • 依托科大讯飞星火X计划,有机会获得资深导师指导,参与核心项目,快速积累行业影响力
  • 针对大模型训练推理中的核心算子(如矩阵乘、注意力)进行极致性能优化,深入底层硬件微架构,设计高效Kernel
  • 结合超节点等互联架构,实现计算与通信融合,降低分布式并行开销
  • 研发算子自动调优框架,利用Tiling策略搜索、内存层次优化和指令调度,提升算子跨模型复用性
  • 通过性能分析工具定位瓶颈,持续迭代优化,逼近硬件理论算力极限
  • 扎实的计算机体系结构基础,理解CPU/GPU/NPU的微架构、缓存层次、向量化原理
  • 精通C/C++和Python,熟悉PyTorch、NumPy等常用框架,能快速实现和验证算法
  • 掌握CUDA、Ascend C、Triton或TileLang中的至少一种编程模型,有实际Kernel开发经验
  • 熟悉Linux开发环境,熟练使用Git、VSCode等工具,具备底层性能调优经验

申请策略

  • 关注科大讯飞星火X计划的宣讲会和线上分享,了解课题具体方向,在面试中展现与课题的匹配度
  • 准备一个关于算子优化的技术分享或Demo,体现动手能力
  • 突出高性能计算或Kernel开发项目经历,如CUDA/Triton实现的矩阵乘或Transformer算子优化,附上性能提升数据
  • 展示对硬件架构的深入理解,如内存带宽、指令流水线、访存优化等,可结合课程或论文体现
  • 强调C/C++编程能力,尤其是pointer操作、内存管理、并发编程等底层技能
  • 如有相关论文、竞赛或开源贡献(如对知名算子库的优化PR),务必列出,增加亮点
  • 提前系统学习CUDA编程模型,熟悉线程组织、共享内存、寄存器优化等,可动手实现几个常见算子
  • 了解大模型训练推理框架的算子层实现,如PyTorch自定义Op、ONNX Runtime等,理解算子如何被调用

面试指南

  • 采用STAR法则:情境-任务-行动-结果,突出量化的性能提升数据
  • 围绕硬件特性分析,先性能剖析,再针对瓶颈选择合适的优化策略(如内存复用、指令均衡)
  • 体现系统性思维:从算法复杂度到硬件执行,再到端到端系统影响
  • 描述一次你优化Kernel性能的过程,你如何定位瓶颈并提升效率?
  • 解释GPU的线程层次和内存层次,以及它们如何影响算子设计
  • 写出矩阵乘法的CUDA实现思路,并说明如何利用共享内存和tiling
  • 你如何理解大模型训练中通信和计算的相互影响?
  • 如果你负责优化一个GEMM算子,你会从哪些方面入手?

职位点评

72
综合评分

顶尖AI人才计划实习岗,技术前沿成长空间大,但工作强度可能较高,需现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
最适合追求技术成长、渴望在AI底层系统领域深度发展的求职者,能够接受一定的压力和工作不确定性。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展95
工作生活45
使命价值80

薪资福利

55较低

实习岗位薪资未明确,但顶尖人才计划可能提供高于平均的实习报酬,公司平台好,稳定性高,但薪资竞争力一般。

薪资信号未披露(AI估算:6K-12K/月)

成长发展

95较高

课题技术前沿,涉及大模型算子优化、自动调优等热点,能深度积累底层优化技能,成长空间巨大,且公司提供顶尖人才培养计划。

技术前沿前沿/新兴技术
技术栈大模型、算子优化、CUDA、Triton、NPU、Kernel、C/C++、Python、PyTorch
成长机会星火X顶尖AI人才计划、极致优化、突破创新
业务类型ambiguous

工作生活

45较低

要求现场办公,未提及弹性或远程,工作地点在合肥或北京,通常有通勤压力,且优化工作可能强度较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

工作意义重大,为AI大模型基础设施建设贡献力量,推动行业效率提升,具有较高的社会价值,行业前景向好。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号突破创新、极致优化
创新程度积极采用新技术
Watch Jobs