
蚂蚁集团
蚂蚁集团-异构计算研发工程师-北京/杭州
蚂蚁集团-异构计算研发工程师-北京/杭州
发布于 1 天前普通员工/个人贡献者
北京市 / 杭州市
高级经验
全职员工
仅现场办公
不限
机器学习工程
Cuda
Flashattention
Gpu
Megatron-Lm
Vllm
显存优化
AI 估算 · 30k–60k
蚂蚁集团核心AI团队,GPU优化人才稀缺,薪资处于行业高位,福利完善。
职位详情
关于这个职位
该职位负责蚂蚁集团GPU高性能异构计算系统的研发,聚焦大模型训练与推理的性能优化
你将深入分析AI芯片硬件架构,使用CUDA、Triton等开发极致高效的算子和显存优化方案,并与算法团队协同探索大模型创新
适合对底层技术充满热情的资深工程师
最低要求
● 计算机相关学科专业,基本功扎实,3年以上相关工作经验
● 熟悉Linux开发环境,掌握C/C++/Python编程语言,具备CUDA算子开发能力,掌握cutlass/CuTe/triton等算子开发工具,掌握nsys/ncu等profile工具
● 深度理解GPU体系结构和CUDA编程模型,掌握GPU算子开发和性能调优技术,掌握GPU显存优化技术
● 有创新想法和技术攻关能力,优秀的逻辑分析和解决问题的能力,团队沟通协作能力强
工作职责
● Software&Hardware Co-Design:深入分析GPU等AI芯片的硬件架构,打磨极致高效的算子与显存优化技术,优化大模型引擎
通过系统建设和优化,推动计算效率逼近硬件的性能极限,打造面向大模型的AI系统生态,提升智算集群的整体效率
● Algorithm&System Co-Design:从系统的视角出发,和算法团队紧密配合,共同探索大模型结构和范式的创新,并面向大规模AI应用场景进行系统级优化与落地
优先资格
● 掌握FlashAttention/FlashMLA/DeepGEMM/FlashInfer等项目源码,有该加速库优化经验者优先
● 掌握Megatron-LM或vllm/sglang等训推框架,有实际性能调优经验和开源代码贡献者优先
● 有AI编译器开发和优化经验者优先
● 有国产加速卡程序开发和优化经验者优先
● 有开源贡献、系统顶会论文或者相关专利者优先
AI 洞察
优缺点分析
优点
- 大厂核心AI基础设施团队,接触最前沿的GPU和AI系统技术
- 技术深度高,涉及软硬件协同、算子开发和系统级优化,个人技能积累快
- 薪资福利优厚,平台稳定,有丰富的内部技术资源和开源社区影响力
- 工作强度可能较大,大模型领域竞争激烈,任务周期紧
- 适合对硬件软件协同设计有浓厚兴趣、具备深厚系统编程能力并热爱解决性能难题的资深工程师
缺点 / 挑战
- 技术门槛较高,需要扎实的底层系统知识和持续学习能力
角色解读
- 可成为GPU计算领域的技术专家,负责关键性能瓶颈攻关
- 可向AI系统架构师方向发展,主导大规模AI基础设施设计与建设
- 也可在团队中成长为技术负责人,带领团队推进核心项目
- 负责GPU算子的开发与性能优化,提升大模型训练和推理效率
- 深入分析GPU等AI芯片的硬件架构,设计极致显存优化方案
- 与算法团队协作,从系统角度探索大模型结构和范式的创新
- 精通C/C++和Python,熟练掌握CUDA编程和性能调优方法
- 深入理解GPU体系结构,熟悉显存优化和算子开发工具(如Triton、CUTLASS)
- 了解主流大模型训练推理框架(如Megatron-LM、vLLM),具备系统级优化经验
申请策略
- 关注蚂蚁集团在AI基础设施方面的技术博客和开源项目,面试中体现认同感
- 准备一个完整的性能调优案例,讲述从分析到优化再到验证的全过程
- 突出CUDA算子开发和性能调优的具体项目,用数据展示性能提升
- 强调对GPU架构和显存优化的深入理解,可附上技术博客或开源贡献
- 如有大模型训练推理优化经验,一定要重点说明
- 提前阅读FlashAttention、vLLM等主流加速库源码,理解其设计思路
- 了解国产加速卡(如昇腾、寒武纪)的编程模型,增加差异化竞争力
- 补充AI编译器知识(如TVM、MLIR),提升系统层面认知
面试指南
- 先拆解问题,从硬件架构到算法层面层层递进,体现系统性思维
- 结合具体项目经验,用数据和对比展示优化效果,增强说服力
- 展示对性能调优工具的熟练使用,并说明如何通过工具定位瓶颈
- 解释GPU内存带宽和计算密度对算子性能的影响,并举例说明如何优化
- 如何诊断一个CUDA kernel的性能瓶颈?你会使用哪些工具和方法?
- 谈谈FlashAttention的原理,它与标准Attention相比有哪些优势?
- 比较Tensor Core和CUDA Core的差异,分别适用于什么场景?
- 复习CUDA编程模型、GPU内存层次和并行计算经典范式
职位点评
80
综合评分
蚂蚁集团核心AI基础设施岗位,前沿GPU技术,薪资优厚,但工作强度较大、WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和职业成长,对GPU计算有热情,并能接受一定工作强度的候选人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值80
薪资福利
85较高
该职位薪资优厚,福利完善,平台稳定,补偿性需求能得到较好满足。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
95较高
职位深耕GPU异构计算前沿技术,技术栈新且挑战大,发展性动机高度满足。
技术前沿前沿/新兴技术
技术栈GPU、CUDA、C++、Python、Triton、CUTLASS、FlashAttention、Megatron-LM、vLLM、显存优化
业务类型ambiguous
工作生活
50较低
工作地点在北京/杭州,但JD未提及工作生活平衡,大厂节奏可能紧张,生活方式满足度一般。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
该工作推动AI技术发展,提升算力效率,具有较高的社会价值,使命感较强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs