Ant Group logo
蚂蚁集团
蚂蚁集团-异构计算研发工程师-北京/杭州

蚂蚁集团-异构计算研发工程师-北京/杭州

发布于 1 天前

普通员工/个人贡献者

北京市 / 杭州市
高级经验
全职员工
仅现场办公
不限
机器学习工程
Cuda
Flashattention
Gpu
Megatron-Lm
Vllm
显存优化

AI 估算 · 30k–60k

蚂蚁集团核心AI团队,GPU优化人才稀缺,薪资处于行业高位,福利完善。

职位详情

关于这个职位

该职位负责蚂蚁集团GPU高性能异构计算系统的研发,聚焦大模型训练与推理的性能优化

你将深入分析AI芯片硬件架构,使用CUDA、Triton等开发极致高效的算子和显存优化方案,并与算法团队协同探索大模型创新
适合对底层技术充满热情的资深工程师

最低要求

● 计算机相关学科专业,基本功扎实,3年以上相关工作经验

● 熟悉Linux开发环境,掌握C/C++/Python编程语言,具备CUDA算子开发能力,掌握cutlass/CuTe/triton等算子开发工具,掌握nsys/ncu等profile工具
● 深度理解GPU体系结构和CUDA编程模型,掌握GPU算子开发和性能调优技术,掌握GPU显存优化技术
● 有创新想法和技术攻关能力,优秀的逻辑分析和解决问题的能力,团队沟通协作能力强

工作职责

● Software&Hardware Co-Design:深入分析GPU等AI芯片的硬件架构,打磨极致高效的算子与显存优化技术,优化大模型引擎

通过系统建设和优化,推动计算效率逼近硬件的性能极限,打造面向大模型的AI系统生态,提升智算集群的整体效率
● Algorithm&System Co-Design:从系统的视角出发,和算法团队紧密配合,共同探索大模型结构和范式的创新,并面向大规模AI应用场景进行系统级优化与落地

优先资格

● 掌握FlashAttention/FlashMLA/DeepGEMM/FlashInfer等项目源码,有该加速库优化经验者优先

● 掌握Megatron-LM或vllm/sglang等训推框架,有实际性能调优经验和开源代码贡献者优先
● 有AI编译器开发和优化经验者优先
● 有国产加速卡程序开发和优化经验者优先
● 有开源贡献、系统顶会论文或者相关专利者优先

AI 洞察

优缺点分析

优点

  • 大厂核心AI基础设施团队,接触最前沿的GPU和AI系统技术
  • 技术深度高,涉及软硬件协同、算子开发和系统级优化,个人技能积累快
  • 薪资福利优厚,平台稳定,有丰富的内部技术资源和开源社区影响力
  • 工作强度可能较大,大模型领域竞争激烈,任务周期紧
  • 适合对硬件软件协同设计有浓厚兴趣、具备深厚系统编程能力并热爱解决性能难题的资深工程师

缺点 / 挑战

  • 技术门槛较高,需要扎实的底层系统知识和持续学习能力

角色解读

  • 可成为GPU计算领域的技术专家,负责关键性能瓶颈攻关
  • 可向AI系统架构师方向发展,主导大规模AI基础设施设计与建设
  • 也可在团队中成长为技术负责人,带领团队推进核心项目
  • 负责GPU算子的开发与性能优化,提升大模型训练和推理效率
  • 深入分析GPU等AI芯片的硬件架构,设计极致显存优化方案
  • 与算法团队协作,从系统角度探索大模型结构和范式的创新
  • 精通C/C++和Python,熟练掌握CUDA编程和性能调优方法
  • 深入理解GPU体系结构,熟悉显存优化和算子开发工具(如Triton、CUTLASS)
  • 了解主流大模型训练推理框架(如Megatron-LM、vLLM),具备系统级优化经验

申请策略

  • 关注蚂蚁集团在AI基础设施方面的技术博客和开源项目,面试中体现认同感
  • 准备一个完整的性能调优案例,讲述从分析到优化再到验证的全过程
  • 突出CUDA算子开发和性能调优的具体项目,用数据展示性能提升
  • 强调对GPU架构和显存优化的深入理解,可附上技术博客或开源贡献
  • 如有大模型训练推理优化经验,一定要重点说明
  • 提前阅读FlashAttention、vLLM等主流加速库源码,理解其设计思路
  • 了解国产加速卡(如昇腾、寒武纪)的编程模型,增加差异化竞争力
  • 补充AI编译器知识(如TVM、MLIR),提升系统层面认知

面试指南

  • 先拆解问题,从硬件架构到算法层面层层递进,体现系统性思维
  • 结合具体项目经验,用数据和对比展示优化效果,增强说服力
  • 展示对性能调优工具的熟练使用,并说明如何通过工具定位瓶颈
  • 解释GPU内存带宽和计算密度对算子性能的影响,并举例说明如何优化
  • 如何诊断一个CUDA kernel的性能瓶颈?你会使用哪些工具和方法?
  • 谈谈FlashAttention的原理,它与标准Attention相比有哪些优势?
  • 比较Tensor Core和CUDA Core的差异,分别适用于什么场景?
  • 复习CUDA编程模型、GPU内存层次和并行计算经典范式

职位点评

80
综合评分

蚂蚁集团核心AI基础设施岗位,前沿GPU技术,薪资优厚,但工作强度较大、WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和职业成长,对GPU计算有热情,并能接受一定工作强度的候选人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值80

薪资福利

85较高

该职位薪资优厚,福利完善,平台稳定,补偿性需求能得到较好满足。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

95较高

职位深耕GPU异构计算前沿技术,技术栈新且挑战大,发展性动机高度满足。

技术前沿前沿/新兴技术
技术栈GPU、CUDA、C++、Python、Triton、CUTLASS、FlashAttention、Megatron-LM、vLLM、显存优化
业务类型ambiguous

工作生活

50较低

工作地点在北京/杭州,但JD未提及工作生活平衡,大厂节奏可能紧张,生活方式满足度一般。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

该工作推动AI技术发展,提升算力效率,具有较高的社会价值,使命感较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs