
科大讯飞
【星火X计划】面向大模型高效训推的算子研发与极致优化(J13802)
【星火X计划】面向大模型高效训推的算子研发与极致优化(J13802)
发布于 大约 8 小时前普通员工/个人贡献者
合肥市 / 北京市
无经验要求
全职员工
仅现场办公
硕士
机器学习工程
Ascend C
Cuda
Pytorch
Tilelang
大模型
算子优化
高性能计算
AI 估算 · 25k–50k
AI前沿方向人才稀缺,科大讯飞为上市AI龙头,顶尖计划薪资竞争力强;考虑到合肥/北京两地差异,综合评估月薪约2.5-5万元。
职位详情
关于这个职位
这是一个面向大模型高效训练推理的算子研发与优化岗位,核心任务是深入理解GPU/NPU等AI芯片的硬件架构,通过设计和优化高性能Kernel(如CUDA、Ascend C等),提升算力利用率和通算融合效率,解决大模型训推中的性能瓶颈
你将参与算子自动调优、编译优化等前沿工作,需要具备扎实的计算机体系结构基础和强大的C/C++/Python编程能力
最低要求
-27届硕士及以上学历,人工智能、计算机科学、高性能计算、数学、电子信息等相关专业,其他专业但具备突出工程能力者同样欢迎
具备扎实的计算机架构基础,熟练使用linux操作系统
熟练使用Git、VSCode等,熟练使用Pytorch、numpy等框架
对GPU/NPU等AI加速芯片的体系结构有深入理解,熟悉CUDA/Ascend C/Triton/TileLang等至少一种编程模型,有实际的Kernel开发调优经验
较强的编程实现能力,熟练掌握C/C++,Python等语言,有底层性能优化项目经验
具备较强的独立思考能力,具备追求卓越,不断突破创新精神,不断通过效率分析提升算子效率
工作职责
关键算子极致优化:针对大模型核心算子,结合硬件微架构特征(向量单元、矩阵单元、缓存层次、张量切分等),实现高算力利用率的高性能Kernel开发
通算融合:结合超节点等互联架构,实现计算与通信高效融合,降低分布式整体并行开销
算子自动调优与编译优化:研发面向大模型的算子自动调优框架,融合Tiling策略搜索、内存层次优化与指令调度,减少算子实现的人工调优成本,提升跨模型架构的算子复用性
AI 洞察
优缺点分析
优点
- 接触前沿AI基础设施技术,深度参与大模型训推优化,技术含量高,成长快
- 科大讯飞作为AI领域上市公司,平台大,资源多,该计划吸引顶尖人才,团队氛围和peer水平高
- 薪资和福利有竞争力,可能有股票或期权等激励
- 工作强度大,涉及底层性能优化往往需要长时间钻研,可能经常需要加班或高强度投入
- 技术门槛高,需要同时掌握硬件架构、并行计算、编译原理等知识,学习曲线陡峭
缺点 / 挑战
- 工作内容极具挑战性,能大幅提升对硬件与系统的理解,职业生涯竞争力强
- 需要持续跟踪最新硬件和AI技术发展,快速迭代,压力较大
- 适合对计算机体系结构和性能优化有浓厚兴趣,热衷挑战技术难题,具备较强自学能力和动手能力的顶尖技术人才
角色解读
- 从算子开发工程师起步,逐步成长为AI基础设施领域的技术专家,主导核心算子的设计与优化
- 可向AI芯片设计、编译器研发、分布式系统等方向拓展,成为全栈性能优化人才
- 在顶尖AI人才培养计划中,可获得更多资源支持和快速晋升通道,未来发展空间广阔
- 深入分析GPU/NPU等AI芯片的硬件架构,针对大模型训推核心算子进行性能剖析与瓶颈定位
- 使用CUDA/Ascend C等编程模型开发高性能Kernel,实现接近理论峰值的算力利用率和通信带宽
- 参与通算融合设计,优化分布式并行策略下的通信与计算重叠,降低端到端延迟
- 研究算子自动调优与编译优化技术,提升算子实现的复用性和开发效率
- 扎实的计算机体系结构基础,理解GPU/NPU的微架构特性(向量/矩阵单元、缓存层次等)
- 精通C/C++和Python,熟练掌握PyTorch、NumPy等常用框架
- 熟悉CUDA/Ascend C/Triton/TileLang至少一种编程模型,并有实际Kernel开发调优经验
- 熟悉Linux操作系统,熟练使用Git、VSCode等开发工具
申请策略
- 了解科大讯飞星火大模型的业务方向,在面试中展现对AI基础设施的热情
- 准备一个完整的性能优化案例,从问题发现到优化方案的完整过程
- 突出高性能计算或并行计算相关的项目经历,如GPU编程、算子加速等
- 强调底层系统优化成果,如性能提升的具体数字(如加速比、利用率提升)
- 展示对大模型训练框架的熟悉程度,以及参与过的开源项目或论文
- 体现对硬件架构的深入理解,如阅读过芯片白皮书或做过性能建模
- 系统学习CUDA编程和GPU体系结构,建议完成NVIDIA官方课程或相关项目
- 深入理解大模型训练框架(如PyTorch、DeepSpeed)的算子实现原理
面试指南
- 对于性能优化类问题,可以按以下框架回答:
- 背景:明确任务目标和性能指标
- 分析:使用profiling工具定位瓶颈(如计算、访存、延迟等)
- 方案:针对瓶颈提出多种优化策略(如向量化、数据结构调整、异步化)
- 验证:通过实验对比,量化优化效果
- 反思:总结可推广的方法论
- 请详细说明你经历过的一个算子优化项目,如何定位瓶颈并优化?
- 解释GPU的内存层次结构,以及如何利用共享内存、寄存器等提升访存效率?
职位点评
80
综合评分
顶尖AI人才计划,前沿算子优化技术,薪资高成长快,但工作强度大,WLB不确定性高。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
该职位最适合追求技术成长和挑战高难度问题,且对薪资有较高期望的求职者,不适合追求工作生活平衡的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活60
使命价值75
薪资福利
85较高
该职位薪资竞争力强,公司平台稳定,补偿性需求能得到较好满足。
薪资信号未披露(AI估算:25K-50K/月)
成长发展
90较高
这是前沿技术岗位,技术含量高,成长空间大,发展性动机满足程度很高。
技术前沿前沿/新兴技术
技术栈CUDA、Ascend C、Triton、TileLang、C/C++、Python、PyTorch、GPU、NPU、分布式并行
业务类型ambiguous
工作生活
60中等
工作地点包括合肥和北京,但JD未提及WLB相关信息,且高强度优化工作可能影响生活平衡。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
该职位有助于提升AI算力效率,推动技术发展,具有一定的社会价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs