
阿里巴巴
大模型研发工程师-Infra
大模型研发工程师-Infra
发布于 大约 3 小时前普通员工/个人贡献者
杭州市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Jax
Pytorch
Rlhf
Sft
Tensorflow
分布式训练
大模型
推理优化
机器学习平台
AI 估算 · 30k–60k
阿里大模型Infra方向稀缺人才,薪资竞争力强,杭州地区大厂高级工程师水平。
职位详情
关于这个职位
作为阿里大模型Infra工程师,你将主导核心算力集群的架构设计与平台构建,攻坚分布式训练、高性能推理、海量数据管理等技术难题
与顶尖算法团队协作,优化大模型训练的稳定性与性能,持续引入业界前沿实践,是驱动技术创新的核心角色
适合有分布式系统背景、喜欢挑战技术深度的同学
最低要求
本科及以上学历,计算机、人工智能、软件工程等相关专业优先
具备扎实的机器学习与深度学习理论基础,精通PyTorch/JAX/TensorFlow等至少一种主流框架
深入理解分布式系统的核心原理,拥有大规模、高可用分布式系统设计、研发或维护实战经验者优先
具备优秀的实验设计与问题定位能力,能够独立分析并解决大模型在不同场景下的性能与表现问题
善于沟通与团队协作,乐于在快速迭代的环境中分享见解、推动项目落地
工作职责
主导并深度参与大模型核心算力集群的架构设计与平台构建,为国内顶尖的AI技术打造坚实可靠的基石
深入探索并攻坚机器学习平台的多个核心领域,包括但不限于:大规模分布式训练、高性能推理优化、海量数据管理以及高效工作流编排
与顶尖的算法及工程团队紧密协作,精准定位并解决大模型在训练与推理过程中遇到的性能、稳定性及规模化等各类复杂技术挑战
保持对技术前沿的高度敏锐,持续追踪并引入业界在大模型系统领域的最新成果与最佳实践,成为驱动整个技术体系创新与迭代的核心力量
优先资格
熟悉SFT、RLHF等后训练技术,或拥有相关项目、竞赛、论文经验者优先
拥有顶会(ICML/NeurIPS/ICLR/ACL/CVPR等)论文发表经历者优先
拥有ACM-ICPC、Kaggle等竞赛获奖经历或开源大模型项目贡献经历者优先
AI 洞察
优缺点分析
优点
- 阿里平台资源丰富,能接触到大规模算力集群和顶级算法团队
- 薪资和股票回报优厚,职业发展空间广阔
- 工作强度较大,项目周期紧,可能需要应对突发的线上问题
- 技术深度要求高,需持续学习最新研究,保持竞争力
- 跨团队协作频繁,需要良好的沟通与推动能力
- 适合对AI基础设施有浓厚兴趣、喜欢解决复杂系统问题、抗压能力强且追求技术深度的求职者
缺点 / 挑战
- 身处AI最前沿的大模型赛道,技术挑战大,成长迅速
角色解读
- 技术路线:Infra工程师 → 高级工程师 → 技术专家/架构师,深入AI基础设施核心领域
- 跨领域发展:可转向算法或平台团队,成为AI全栈人才
- 行业前景:大模型持续火热,Infra人才稀缺,具备极高市场价值
- 设计并构建大模型核心算力集群,包括计算、存储、网络等基础设施的规划与优化
- 深入优化大规模分布式训练和推理的性能,解决训练稳定性、通信瓶颈等难题
- 与算法团队协作,针对模型结构调整进行系统级适配,提升整体训练效率
- 精通PyTorch/JAX/TensorFlow等深度学习框架,熟悉分布式训练原理
- 扎实的分布式系统知识,包括参数服务器、AllReduce、异步训练等架构
- 良好的问题定位与性能调优能力,熟悉GPU编程、网络优化等底层技术
申请策略
- 关注阿里巴巴AI基础设施团队的博客或开源项目,了解技术栈
- 在简历中量化成果,如训练加速比、资源利用率提升等
- 突出分布式系统相关项目经验,尤其是大规模训练或推理优化案例
- 强调PyTorch/JAX等框架的使用深度,可列出性能优化具体成果
- 如有竞赛获奖或顶会论文,务必在显眼位置展示
- 深入学习RLHF、模型并行等前沿训练技术
- 补充Kubernetes、Docker等容器化部署及调度知识
面试指南
- 分析问题本质,明确瓶颈是计算、通信还是IO
- 结合系统设计原则,提出分层优化思路,如并行策略、梯度压缩等
- 通过实际案例说明如何验证方案效果,并关注可扩展性
- 如何设计一个支持千卡级别分布式训练的系统?
- 在训练大模型时遇到OOM或通信瓶颈,你会如何定位和解决?
- 请谈谈你对Megatron-LM或DeepSpeed等框架的了解
- 如何优化Transformer模型的推理延迟?
- 系统复习分布式训练相关论文(如GSPMD、ZeRO、Megatron-LM)
职位点评
77
综合评分
阿里大模型infra岗,高薪前沿技术,但工作强度大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长与高回报、能够接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值75
薪资福利
85较高
阿里大厂薪资体系完善,大模型方向溢价明显,但JD未提及具体福利细节。
薪资信号偏高 (30K-60K/月)
成长发展
95较高
大模型Infra属于前沿技术领域,能深度参与核心技术研发,成长空间极大。
技术前沿前沿/新兴技术
技术栈大模型、分布式训练、PyTorch、RLHF
业务类型profit_center
工作生活
40较低
阿里巴巴企业文化强调拼搏,工作强度高,JD未提及WLB信息。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
75中等
大模型技术推动AI进步,有较高社会影响力,但JD未直接提及使命价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
微信-后台开发高级工程师-机器学习工程方向
腾讯 · 广州市AI 估算 · 25k-45k广告算法实习生
知乎 · 北京市AI 估算 · 4k-8k2026 Shanghai Machine Learning Modelling Engineer Internship, PhD
澳蒂华 · 上海市AI 估算 · 15k-25kSenior Machine Learning Engineer
澳蒂华 · 上海市AI 估算 · 40k-70kAI Application Development Intern
联想 · 中国台湾, Taipei City, 中山(Zhongshan)AI 估算 · 3k-5k
Watch Jobs