Ant Group logo
蚂蚁集团
蚂蚁集团-大模型 AI 工程师/技术专家-上海/杭州

蚂蚁集团-大模型 AI 工程师/技术专家-上海/杭州

发布于 大约 14 小时前

普通员工/个人贡献者

上海市 / 杭州市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Deepspeed
Gpu优化
Llm
Megatron-Lm
Pytorch
Sglang
Vllm
分布式训练

AI 估算 · 40k–70k

大模型赛道热门,蚂蚁集团作为头部互联网公司,技术专家薪资较高,结合上海/杭州市场水平,月薪4-7万合理。

职位详情

关于这个职位

这个职位将让你深入参与蚂蚁集团大语言模型(LLM)的研发,从基础设施视角出发,与算法研究员紧密合作,解决大规模分布式训练和推理中的前沿挑战

你将负责算法与工程的协同设计,优化训练/推理框架性能,并研发高效的并行策略和算子优化,将硬件潜力发挥到极限
适合对高性能计算、系统优化和AI基础设施充满热情的资深工程师

最低要求

教育背景:计算机科学、软件工程、人工智能或相关专业的本科及以上学历

编程能力:具备出色的工程实现能力,至少精通 Python 或 C++ 其中一种编程语言,并有扎实的数据结构和算法基础
框架经验:熟悉至少一种主流深度学习框架(如 PyTorch、TensorFlow)的内部机制,对 PyTorch 有深入理解者优先
大模型经验:熟悉大模型训练或推理技术,有使用 Megatron-LM/Transformer-Engine , DeepSpeed 等大规模训练框架的实践经验
系统能力:具备良好的系统性思维和问题解决能力,能够从软硬件结合的视角分析和解决复杂的性能问题

工作职责

从基础设施的视角,参与到新一代基座模型研发中,包括但不限于以下工作:

算法与工程协同设计:参与 scaling law 和新模型架构的迭代设计,提供专家级工程实现方案,确保新模型架构的可实现性、高效性及可扩展性
训练与推理系统优化:基于特定模型架构,系统性分析并优化训练/推理框架性能,识别并解决大规模集群环境下的关键性能瓶颈
高性能并行与算子优化:研发高效精细的分布式并行策略(如张量、流水线、序列并行等),并针对核心算子进行定制化优化,充分释放硬件计算潜能
前沿技术探索与落地:跟踪并引入业界最新的 AI 基础设施技术,包括但不限于编译优化、新型硬件架构等,并将其应用于实际的大模型研发中

优先资格

熟悉 CUDA 编程,并有实际的 GPU 性能优化经验

熟悉底层算子库,如 Cutlass(cutedsl), cuBLAS 等的实现和优化
对 AI 编译器技术有深入了解,有 MLIR, TVM, XLA, IREE 等项目经验
或熟悉新兴的 Kernel aot/jit 编程语言框架,如 Triton, cutile 等
熟悉 SGLang, vLLM 等业界领先的高性能推理引擎或框架
有大规模分布式系统(如高性能计算、分布式存储、RDMA/NVLink 通信)的开发和优化经验
在顶级会议(如 ASPLOS、ISCA、OSDI、SOSP、MLSys、NeurIPS、ICLR、ICML)上有相关论文发表者优先

AI 洞察

优缺点分析

优点

  • 身处AI最热门的大模型赛道,技术积累前沿,学习机会丰富
  • 团队技术氛围浓厚,有机会与顶级算法研究员合作,发表顶会论文
  • 对软硬件综合能力要求极高,需要深入理解并行计算、网络通信等底层细节
  • 岗位竞争激烈,需要具备扎实的工程经验和系统优化能力
  • 适合对高性能计算和系统优化充满热情,拥有扎实编程和分布式系统经验,并希望在大模型基础设施领域深耕的技术专家

缺点 / 挑战

  • 蚂蚁集团提供国际化平台和算力资源,能解决真实工业级大规模分布式挑战
  • 工作强度可能较高,需要跟进快速迭代的AI技术,持续学习压力大

角色解读

  • 成为大模型基础设施领域的专家,主导训练推理系统的架构设计与优化
  • 向技术管理方向发展,带领团队攻克AI基础设施前沿难题
  • 横向拓展至AI编译器、新型硬件加速等前沿领域,保持技术领先性
  • 参与大语言模型(LLM)的算法与工程协同设计,确保新架构的可实现性和高效性
  • 系统性地分析和优化训练/推理框架性能,解决大规模集群下的性能瓶颈
  • 研发分布式并行策略(如张量、流水线并行)并优化核心算子,充分释放GPU计算潜能
  • 跟踪前沿AI基础设施技术(如编译优化、新型硬件),并将其应用于实际大模型研发
  • 精通Python或C++,具备扎实的数据结构和算法基础
  • 深入理解PyTorch等深度学习框架的内部机制
  • 熟悉大模型训练/推理技术,有Megatron-LM、DeepSpeed等实践经验
  • 具备系统性思维,能从软硬件结合角度解决复杂性能问题

申请策略

  • 准备一个能体现系统性优化思维的完整项目案例,从问题定义到方案落地
  • 了解蚂蚁Ling团队的技术动态和成果,在面试中展现你的兴趣和思考
  • 突出大模型训练或推理的实践经验,如使用Megatron-LM、DeepSpeed等框架的优化案例
  • 强调GPU性能优化或CUDA编程的实际成果,如具体提速效果
  • 展示分布式系统设计能力,如大规模集群下的性能分析和瓶颈解决
  • 如有AI编译器或论文发表,务必重点突出
  • 深入掌握CUDA编程和GPU性能分析工具(如nsight)
  • 学习主流大模型训练框架(DeepSpeed、Transformers)的源码,理解其内部机制

面试指南

  • 针对性能优化问题,使用STAR原则:背景、任务、行动、结果,量化提速效果
  • 对于架构设计问题,从需求分析、方案对比、权衡取舍出发,体现系统性思维
  • 对于底层原理问题,先清晰解释概念,再结合实际场景说明应用
  • 请描述你在训练或推理大模型时遇到的主要性能瓶颈,以及你是如何优化的?
  • 如何设计一个高效的分布式并行策略?请结合具体模型架构说明
  • 解释CUDA编程中的warp调度和shared memory优化原理
  • 谈谈你对Megatron-LM中张量并行的理解,以及如何进一步优化?
  • 假设我们需要部署一个100B参数的LLM,你会如何设计推理系统?

职位点评

74
综合评分

大模型基础设施技术专家,高薪前沿技术,发展空间大,但工作强度较高且需现场办公。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最看重技术成长和前沿挑战的求职者,追求高薪资和技术深度,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值70

薪资福利

80较高

薪资水平处于市场高位(月薪4-7万),蚂蚁集团提供完善福利,但具体薪资需面议稳定。

薪资信号面议 (40K-70K/月)

成长发展

95较高

岗位处于大模型技术前沿,深度参与核心研发,有大量学习成长机会,且蚂蚁集团对技术投入大。

技术前沿前沿/新兴技术
技术栈LLM、PyTorch、CUDA、Megatron-LM、DeepSpeed、分布式训练、vLLM、SGLang、MLIR、Triton
业务类型profit_center

工作生活

40较低

上海/杭州现场办公,未提及弹性工作或远程,AI大模型岗位节奏快,可能加班强度较高。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

蚂蚁集团在金融科技领域有广泛影响力,大模型技术助力业务创新,社会价值较高,但主要聚焦商业应用。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs