iFLYTEK logo
科大讯飞
AI研究算法工程师-高性能算子开发方向(J13373)

AI研究算法工程师-高性能算子开发方向(J13373)

发布于 大约 5 小时前

普通员工/个人贡献者

合肥市
无经验要求
全职员工
仅现场办公
硕士
研究与开发 (研发)
Ascend C
Cuda
Gpu
Npu
Tilelang
性能优化
算子开发

AI 估算 · 20k–30k

科大讯飞上市大厂,校招硕士薪资在合肥具有竞争力,高性能算子岗位技术难度高,薪资水平高于普通研发岗。

职位详情

关于这个职位

该职位是科大讯飞的AI研究算法工程师,专注于高性能算子开发,为AI训练和推理场景打造高效算力方案

你将与英伟达GPU、华为NPU等硬件深度协作,进行算子优化和通信研发,助力大模型业务落地
适合对底层性能优化有热情、编程功底扎实的应届硕士毕业生

最低要求

基础门槛

硕士及以上学历,专业不限
编程功底扎实,精通C++/C语言,具备良好的代码规范意识与数据结构、算法基础,熟悉操作系统核心原理
熟练使用Git等代码管理工具,养成规范的开发习惯
熟练掌握linux下开发能力
热爱性能优化,兼具技术视野与代码品质追求,具备良好的沟通能力、团队协作意识、责任心与自驱力,学习能力突出
技术必备
熟练掌握CUDA、Ascend C等编程原理,能够基于编程语言开展算子开发工作
掌握编译优化技术,清晰理解GPU/NPU架构的并行执行、内存层级与计算单元特性
熟练掌握TileLang、Triton等编译原理及使用,编写和优化核心算子
对硬件底层架构有清晰认知,能够结合硬件特性开展针对性优化

工作职责

算子开发与优化

围绕英伟达GPU、华为NPU、海光DCU等主流硬件架构,依托编程语言和计算架构,完成大模型核心计算和通信算子研发和优化
立足芯片存储层级、计算单元、指令集特性,开展针对性性能调优,确保算子性能精准匹配硬件能力,为业务提供高效算力支持
通信算子研发与调优
针对跨卡、跨机等多样化通信场景,设计、开发并优化通信算子,保障分布式训练、推理的高效通信链路
协同与优化
紧跟模型结构与算法迭代趋势,协同框架、算法团队,设计适配硬件特性的模型方案,挖掘硬件与算法的协同潜力
围绕真实训练、推理负载开展性能分析,为模型落地提供性能优化支撑,保障业务高效运行

优先资格

加分项

算子专长:有CUDA或Ascend C算子开发经验,熟悉LLM相关算子等算子库,深入理解AI加速卡硬架构和特性
竞赛背景:在高性能计算相关赛事取得较好成绩
框架经验:熟悉VLLM、SGlang框架,并能够灵活修改其功能者

AI 洞察

优缺点分析

优点

  • 身处AI算力核心赛道,接触前沿硬件和优化技术,技能积累价值高
  • 科大讯飞平台大,资源丰富,参与大模型底层建设,行业影响力强
  • 合肥生活成本相对较低,薪资在当地很有竞争力,性价比高
  • 技术门槛高,需要同时掌握硬件架构、编程语言和编译优化,学习曲线陡峭
  • 工作强度可能较大,涉及多硬件平台适配和性能调优,需持续投入
  • 适合对AI芯片和底层性能优化有浓厚兴趣、编程基础扎实、愿意深入硬件细节的应届硕士生

缺点 / 挑战

  • 作为校招生,需快速掌握复杂的算子开发工具和硬件知识,压力不小

角色解读

  • 技术路线:从算子开发工程师成长为高性能计算专家或AI芯片架构师
  • 横向发展:可转向AI框架开发、编译器开发或分布式系统优化等方向
  • 管理路线:积累经验后带团队,负责核心算力平台的规划与建设
  • 围绕英伟达GPU、华为NPU等硬件,开发并优化大模型核心计算和通信算子,提升训练和推理效率
  • 针对跨卡、跨机通信场景,设计高效通信算子,保障分布式计算链路
  • 与算法和框架团队协作,分析真实负载性能,挖掘硬件与算法的协同优化空间
  • 精通C++/C语言,扎实的数据结构、算法和操作系统知识
  • 熟练掌握CUDA或Ascend C编程,理解GPU/NPU架构的并行执行和内存层级
  • 掌握编译优化技术(如TileLang、Triton),能针对硬件特性进行性能调优

申请策略

  • 关注科大讯飞在AI算力方面的技术博客和开源项目,在面试中展示对行业动态的了解
  • 准备一个体现性能优化思维的技术案例,最好涉及硬件特性与软件协同优化
  • 突出C++/C编程能力和项目中的性能优化经验,如加速比、延迟降低等量化成果
  • 如有CUDA或Ascend C开发经历,详细描述算子实现和优化过程
  • 强调竞赛成绩(如高性能计算赛事)或相关框架使用经验(如VLLM)
  • 系统学习CUDA编程和GPU架构,动手实现简单算子并进行性能调优
  • 了解编译优化技术,如TVM、Triton的基本原理,尝试编写简单的TileLang脚本

面试指南

  • 对于底层技术问题,采用“原理+实践”结构:先阐述理论,再结合具体项目说明如何应用
  • 对于优化类问题,遵循“分析瓶颈→设计策略→验证效果”的闭环思路,强调数据驱动
  • 对于协同类问题,突出跨团队沟通和系统思维,说明如何平衡硬件限制与算法需求
  • 请详细解释CUDA的线程层级和内存层级,如何优化一个矩阵乘法算子?
  • 描述你在项目中使用性能分析工具(如nvprof、NVIDIA Nsight)定位瓶颈的经历
  • 你对GPU/NPU的硬件架构有哪些理解?如何根据硬件特性设计算子?
  • 谈谈你了解的通信算子(如AllReduce)的实现原理及优化方法
  • 你如何看待算子开发与模型算法之间的关系?如何协同优化?

职位点评

77
综合评分

科大讯飞校招,技术前沿、薪资优厚,适合追求技术深度的应届生,但工作强度可能较大。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合重视技术成长和前沿领域探索的求职者,愿意在WLB上做出一定妥协以换取快速能力提升。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活60
使命价值70

薪资福利

75中等

科大讯飞作为上市大厂,校招薪资在合肥很有竞争力,且福利完善,但具体薪资未披露,整体补偿性较高。

薪资信号未披露(AI估算:20K-30K/月)

成长发展

90较高

该职位聚焦AI算力前沿技术(GPU/NPU、编译优化),深度参与大模型底层研发,成长空间大,且明确要求掌握多个技术栈,发展性极强。

技术前沿前沿/新兴技术
技术栈CUDA、Ascend C、GPU、NPU、TileLang、Triton、编译优化、大模型
业务类型profit_center

工作生活

60中等

现场办公且未提及弹性工作,合肥生活节奏相对适中,但高性能优化工作可能强度大,WLB一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

AI算力是国家战略赛道,工作直接推动大模型落地,社会价值明显,但公司未明确使命导向,意义感中等偏上。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs