Alibaba logo
阿里巴巴
大模型研发工程师-Infra

大模型研发工程师-Infra

发布于 大约 3 小时前

普通员工/个人贡献者

杭州市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Jax
Pytorch
Rlhf
Sft
Tensorflow
分布式训练
大模型
推理优化
机器学习平台

AI 估算 · 30k–60k

阿里大模型Infra方向稀缺人才,薪资竞争力强,杭州地区大厂高级工程师水平。

职位详情

关于这个职位

作为阿里大模型Infra工程师,你将主导核心算力集群的架构设计与平台构建,攻坚分布式训练、高性能推理、海量数据管理等技术难题

与顶尖算法团队协作,优化大模型训练的稳定性与性能,持续引入业界前沿实践,是驱动技术创新的核心角色
适合有分布式系统背景、喜欢挑战技术深度的同学

最低要求

本科及以上学历,计算机、人工智能、软件工程等相关专业优先

具备扎实的机器学习与深度学习理论基础,精通PyTorch/JAX/TensorFlow等至少一种主流框架
深入理解分布式系统的核心原理,拥有大规模、高可用分布式系统设计、研发或维护实战经验者优先
具备优秀的实验设计与问题定位能力,能够独立分析并解决大模型在不同场景下的性能与表现问题
善于沟通与团队协作,乐于在快速迭代的环境中分享见解、推动项目落地

工作职责

主导并深度参与大模型核心算力集群的架构设计与平台构建,为国内顶尖的AI技术打造坚实可靠的基石

深入探索并攻坚机器学习平台的多个核心领域,包括但不限于:大规模分布式训练、高性能推理优化、海量数据管理以及高效工作流编排
与顶尖的算法及工程团队紧密协作,精准定位并解决大模型在训练与推理过程中遇到的性能、稳定性及规模化等各类复杂技术挑战
保持对技术前沿的高度敏锐,持续追踪并引入业界在大模型系统领域的最新成果与最佳实践,成为驱动整个技术体系创新与迭代的核心力量

优先资格

熟悉SFT、RLHF等后训练技术,或拥有相关项目、竞赛、论文经验者优先

拥有顶会(ICML/NeurIPS/ICLR/ACL/CVPR等)论文发表经历者优先
拥有ACM-ICPC、Kaggle等竞赛获奖经历或开源大模型项目贡献经历者优先

AI 洞察

优缺点分析

优点

  • 阿里平台资源丰富,能接触到大规模算力集群和顶级算法团队
  • 薪资和股票回报优厚,职业发展空间广阔
  • 工作强度较大,项目周期紧,可能需要应对突发的线上问题
  • 技术深度要求高,需持续学习最新研究,保持竞争力
  • 跨团队协作频繁,需要良好的沟通与推动能力
  • 适合对AI基础设施有浓厚兴趣、喜欢解决复杂系统问题、抗压能力强且追求技术深度的求职者

缺点 / 挑战

  • 身处AI最前沿的大模型赛道,技术挑战大,成长迅速

角色解读

  • 技术路线:Infra工程师 → 高级工程师 → 技术专家/架构师,深入AI基础设施核心领域
  • 跨领域发展:可转向算法或平台团队,成为AI全栈人才
  • 行业前景:大模型持续火热,Infra人才稀缺,具备极高市场价值
  • 设计并构建大模型核心算力集群,包括计算、存储、网络等基础设施的规划与优化
  • 深入优化大规模分布式训练和推理的性能,解决训练稳定性、通信瓶颈等难题
  • 与算法团队协作,针对模型结构调整进行系统级适配,提升整体训练效率
  • 精通PyTorch/JAX/TensorFlow等深度学习框架,熟悉分布式训练原理
  • 扎实的分布式系统知识,包括参数服务器、AllReduce、异步训练等架构
  • 良好的问题定位与性能调优能力,熟悉GPU编程、网络优化等底层技术

申请策略

  • 关注阿里巴巴AI基础设施团队的博客或开源项目,了解技术栈
  • 在简历中量化成果,如训练加速比、资源利用率提升等
  • 突出分布式系统相关项目经验,尤其是大规模训练或推理优化案例
  • 强调PyTorch/JAX等框架的使用深度,可列出性能优化具体成果
  • 如有竞赛获奖或顶会论文,务必在显眼位置展示
  • 深入学习RLHF、模型并行等前沿训练技术
  • 补充Kubernetes、Docker等容器化部署及调度知识

面试指南

  • 分析问题本质,明确瓶颈是计算、通信还是IO
  • 结合系统设计原则,提出分层优化思路,如并行策略、梯度压缩等
  • 通过实际案例说明如何验证方案效果,并关注可扩展性
  • 如何设计一个支持千卡级别分布式训练的系统?
  • 在训练大模型时遇到OOM或通信瓶颈,你会如何定位和解决?
  • 请谈谈你对Megatron-LM或DeepSpeed等框架的了解
  • 如何优化Transformer模型的推理延迟?
  • 系统复习分布式训练相关论文(如GSPMD、ZeRO、Megatron-LM)

职位点评

77
综合评分

阿里大模型infra岗,高薪前沿技术,但工作强度大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长与高回报、能够接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值75

薪资福利

85较高

阿里大厂薪资体系完善,大模型方向溢价明显,但JD未提及具体福利细节。

薪资信号偏高 (30K-60K/月)

成长发展

95较高

大模型Infra属于前沿技术领域,能深度参与核心技术研发,成长空间极大。

技术前沿前沿/新兴技术
技术栈大模型、分布式训练、PyTorch、RLHF
业务类型profit_center

工作生活

40较低

阿里巴巴企业文化强调拼搏,工作强度高,JD未提及WLB信息。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

75中等

大模型技术推动AI进步,有较高社会影响力,但JD未直接提及使命价值。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs