
阿里巴巴
大规模分布式训练推理加速及核心基础设施软硬协同优化-阿里星
大规模分布式训练推理加速及核心基础设施软硬协同优化-阿里星
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 杭州市
其它
全职员工
仅现场办公
硕士
机器学习工程
Ai基础设施
Cuda
Gpu性能优化
分布式系统
软硬协同
集合通信
高性能网络
异构调度
训练推理加速
AI 估算 · 40k–60k
阿里星为顶尖校招项目,薪酬对标P7,AI基础设施方向热门,一线城市薪资水平高。
职位详情
关于这个职位
这是一个专注于大规模分布式训练与推理加速的核心技术岗位,涉及软硬协同优化、高性能网络和智能资源调度,旨在解决AI基础设施的效率瓶颈
你将与顶尖工程师合作,推动大模型与生成式AI的技术边界,为集团核心AI业务提供底层支撑
最低要求
分布式系统、计算机体系结构、编译优化或通信与计算协同设计方向的硕/博士研究生
具备AI训推计算性能分析与优化的经验,能深入分析AI模型在GPU平台上的性能瓶颈,提出并实施优化方案
针对分布式训练和推理系统,进行性能调优,提升系统的吞吐量和效率
熟悉业界常见的优化栈(cuda/rocm/cutlass/ck/triton等),在高效的内存管理、通信优化(NvLink/Infiniband/RoCEv2等)关键技术上有实操经验
工作职责
极致性能优化:探索算法、训推引擎和基础设施的co-design协同突破效率瓶颈,最大化算力、网络和存储等硬件性能
高性能网络:负责设计、实现、维护AI和高性能计算所需要的高性能网络通信框架和大模型推理场景的性能优化,聚焦模型通信场景的能力建设,完善集合通信、点对点通信等通信方式与推理框架的联合方案设计,推动提升推理性能
智能资源调度:针对大规模分布式的LLM/多模态理解生成训练推理等新兴计算场景,优化多集群多地域的异构调度编排能力,实现分钟级模型分发、训推任务弹性伸缩等
其他随着AI模型、训推范式、算力硬件等迭代演进而出现的AI系统优化工程挑战和业界难题
优先资格
分布式系统研发经验是加分项:设计和实现高效的分布式训练和推理框架,解决大规模分布式系统中的通信、同步和负载均衡问题
探索新型的分布式架构,提升系统的可扩展性和容错性
前沿技术研究:跟踪AI Infra领域的最新研究进展,探索新的硬件架构、算法和系统优化技术
发表高水平学术论文,参与国际顶级会议(如ISCA、MICRO、OSDI、SOSP、ATC、NSDI等)
AI 洞察
优缺点分析
优点
- 阿里星是集团战略性人才培养项目,享有顶级资源倾斜,成长速度远超普通岗位
- 阿里巴巴平台大、算力资源丰富,有机会接触最新GPU/网络硬件与大规模真实业务场景
- 工作强度可能较大,需要应对AI技术快速迭代,持续保持技术前沿性
缺点 / 挑战
- 身处AI基础设施核心战场,技术挑战大,能快速积累深度软硬协同经验
- 技术难度高,需同时掌握算法、系统和硬件知识,学习曲线陡峭,初期压力大
- 对结果要求严苛,需解决实际业务中的性能瓶颈,容错空间小
- 适合对AI系统底层技术有强烈热情,具备扎实计算机基础,喜欢挑战极限且能接受高强度工作的技术型人才
角色解读
- 从专项技术专家成长为AI基础设施领域的领军人物,参与行业标准与技术路线制定
- 可向技术管理方向发展,带领团队攻克系统级难题,成为集团核心技术的负责人
- 依托前沿研究和顶会论文发表,成为学术与工程兼备的复合型人才,获得业界影响力
- 负责大规模分布式训练和推理系统的性能分析,定位GPU等硬件平台的瓶颈并实施优化方案
- 设计实现高性能网络通信框架,优化集合通信和点对点通信,提升大模型推理性能
- 参与智能资源调度系统的研发,实现多集群多地域的异构计算资源管理与弹性伸缩
- 跟踪AI Infra领域前沿技术,探索软硬协同设计创新,解决算法与硬件融合的工程挑战
- 扎实的分布式系统、计算机体系结构、编译优化理论基础
- 熟悉CUDA/ROCm等底层优化技术栈,具备GPU性能调优和内存管理实战经验
- 掌握高性能网络通信优化技术,如NvLink、InfiniBand、RoCEv2等
- 具备分布式训练推理框架研发能力,理解NCCL、TensorRT等业界方案
申请策略
- 阿里星更看重技术潜力与学习热情,面试中展示你对软硬协同的思考深度
- 了解阿里巴巴在AI基础设施(如PAI、灵骏)的布局,与面试官讨论现实场景
- 突出分布式训练/推理相关的项目经验,量化性能提升指标(如吞吐量、延迟、模型规模)
- 强调对CUDA、Triton等底层工具的实操经验,展示深入分析性能瓶颈的能力
- 体现体系结构、编译优化方面的知识深度,可附上相关课程或研究亮点
- 如有顶级会议论文(如OSDI、MLSys等),务必放在显眼位置
- 提前学习NCCL、TensorRT等框架源码,理解其设计思想和优化策略
- 练习使用Nsight、Perf等性能分析工具,提升对GPU行为的感知能力
面试指南
- 使用STAR法则(情境、任务、行动、结果)回答问题,突出个人贡献和量化效果
- 遇到开放性问题时,采用分层分析法:从算法、系统、硬件三层逐一拆解,展示系统性思维
- 回答中强调跨层协同意识,体现软硬结合的优势与挑战
- 如何分析一个大规模训练任务的性能瓶颈?请举例说明你的排查过程
- 描述你参与过的一个分布式系统优化项目,你承担了什么角色,取得了什么量化结果?
- 请解释集合通信中Ring AllReduce的原理,并分析其优缺点
- 如何设计一个支持弹性伸缩的多集群资源调度系统?需要考虑哪些关键因素?
- 你对AI Infra领域未来的发展趋势有何见解,认为哪些技术将起主导作用?
职位点评
80
综合评分
阿里星顶尖技术岗,前沿AI基础设施方向,薪资优厚,成长性强,但WLB一般。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合追求技术深度、快速成长并期望获得高薪回报的求职者,同时能接受较高工作强度和不确定的工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值75
薪资福利
85较高
该职位提供极具竞争力的薪酬和阿里巴巴完善的企业福利,虽未披露具体数字,但阿里星的薪资水平处于行业顶尖,能较好满足经济回报需求。
薪资信号未披露(AI估算:40K-60K/月)
成长发展
95较高
该职位处于AI基础设施前沿技术领域,软硬协同优化是稀缺高价值技能,阿里星项目提供系统性培养资源,成长空间巨大。
技术前沿前沿/新兴技术
技术栈分布式系统、CUDA、Triton、GPU、高性能网络、集合通信、软硬协同
业务类型ambiguous
工作生活
50较低
工作要求现场办公,未提及弹性工作安排,且技术挑战大可能导致高强度工作,生活平衡满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
推动AI基础设施发展具有积极社会意义,支援核心AI业务,创新性强,能带来较强的使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs