Alibaba logo
阿里巴巴
MaaS 的高效资源调度与系统设计-阿里星

MaaS 的高效资源调度与系统设计-阿里星

发布于 大约 2 小时前

普通员工/个人贡献者

北京市 / 杭州市
无经验要求
全职员工
仅现场办公
硕士
架构师
Go
Maas
云原生
分布式系统
大模型推理
资源调度

AI 估算 · 30k–50k

阿里星作为顶尖校招项目,薪资具有竞争力,结合北京/杭州一线城市水平及AI基础设施岗位的高需求,预估月薪3-5万。

职位详情

关于这个职位

该职位是阿里巴巴MaaS推理平台的核心系统设计与开发岗位,专注于构建高性能、低延迟、高吞吐的大模型推理基础设施

你将参与GPU/CPU等异构算力资源调度、请求调度、批处理优化等关键系统组件的设计与实现,并持续优化推理系统的性能、稳定性与成本效率
适合对分布式系统、云原生和AI基础设施有浓厚兴趣的技术人才

最低要求

计算机科学相关专业研究生及以上学历,具备扎实的计算机基础知识

具备良好的系统设计与工程能力,熟悉至少一种主流编程语言(如 C++ / Go / Java / Python / Rust),能够完成复杂系统模块的设计与实现
熟悉 Linux 系统开发环境,具备良好的工程实践能力,能够进行系统调优、性能分析与问题定位
对分布式系统、资源调度系统或云原生平台有一定理解,例如 Kubernetes、容器调度、任务调度或服务编排机制
对 AI 基础设施或大模型推理系统有强烈兴趣,具备良好的学习能力与技术探索精神

工作职责

参与 MaaS(Model as a Service)推理平台核心系统的设计与建设,面向大规模模型服务场景,打造高性能、低延迟、高吞吐的推理基础设施

参与 GPU / CPU / 网络等异构算力资源的高效调度系统设计,构建面向大模型推理任务的资源编排与调度能力,实现资源利用率与服务质量的最优平衡
设计并实现面向 LLM 推理场景的关键系统组件,包括请求调度、批处理优化、推理并行策略、缓存与上下文管理等核心机制
参与构建大规模模型服务平台的系统架构,包括模型部署、服务治理、流量调度、容量管理与自动扩缩容等核心能力
通过系统架构优化与工程创新,持续提升推理系统在 性能、稳定性与成本效率 方面的表现,支撑大规模 AI 应用的稳定运行

优先资格

有系统领域顶会论文、ACM/ICPC国际奖项、主流开源项目活跃贡献者是加分项

AI 洞察

优缺点分析

优点

  • 技术前沿:深度参与大模型推理基础设施的建设,处于AI技术发展的最前沿
  • 高薪待遇:阿里星项目提供极具竞争力的薪酬和福利
  • 适合对系统底层技术有浓厚兴趣,具备扎实的计算机基础,渴望在AI基础设施领域深耕的顶尖技术人才

缺点 / 挑战

  • 平台优势:阿里巴巴提供海量业务场景和丰富的资源,技术挑战大,成长空间广阔
  • 技术挑战大:需要深入理解分布式系统、GPU调度、性能优化等多个复杂领域
  • 工作强度高:作为核心系统研发,可能需要应对高并发、高可用等挑战,工作节奏快

角色解读

  • 技术专家路线:在系统架构、资源调度、AI基础设施等方向深耕,成为领域专家
  • 技术管理路线:从技术骨干逐步成长为团队负责人,带领团队进行系统设计与技术攻关
  • 跨领域发展:基于对AI系统的深入理解,可向AI平台产品、解决方案架构等方向发展
  • 设计并实现MaaS推理平台的核心系统,包括请求调度、批处理优化、推理并行策略等关键组件,确保高性能与低延迟
  • 构建GPU/CPU/网络等异构算力资源的调度系统,优化资源利用率,平衡服务质量与成本
  • 参与大规模模型服务平台架构设计,涵盖模型部署、服务治理、流量调度、容量管理与自动扩缩容
  • 持续进行系统性能调优与工程创新,提升推理系统的性能、稳定性和成本效率
  • 扎实的计算机科学基础,熟悉操作系统、网络、数据结构与算法
  • 精通至少一种主流编程语言(C++/Go/Java/Python/Rust),具备复杂系统模块的设计与实现能力
  • 深入理解分布式系统、资源调度或云原生平台(如Kubernetes),具备系统调优与性能分析能力
  • 对AI基础设施或大模型推理系统有强烈兴趣,具备快速学习与探索新技术的能力

申请策略

  • 了解阿里云AI基础设施团队的业务方向和技术栈,在面试中展现对业务的思考
  • 准备一个能体现你系统设计能力的项目案例,并深入思考其优化空间
  • 突出系统设计与实现经验,尤其是分布式系统、资源调度或高性能计算相关项目
  • 强调编程能力,展示C++/Go/Rust等语言的深度使用经验
  • 如有Kubernetes、容器调度、云原生平台相关经验,务必重点描述
  • 展示对AI基础设施或大模型推理的兴趣,如相关项目、论文或开源贡献
  • 深入学习Kubernetes、容器调度、任务调度等云原生技术
  • 系统学习大模型推理原理,如模型并行、KV Cache、批处理优化等

面试指南

  • 对于系统设计问题,采用自顶向下的方法:先明确需求(如性能、延迟、成本),再设计整体架构,然后拆解模块,最后讨论关键细节和权衡
  • 对于技术原理问题,结合具体场景,阐述原理、应用和优缺点,并展示你的深度理解
  • 对于项目经验问题,使用STAR法则(情境、任务、行动、结果),突出你的个人贡献和思考
  • 如何设计一个高吞吐、低延迟的LLM推理服务系统?
  • 请详细解释Kubernetes的调度机制,以及如何优化GPU资源利用率
  • 如何实现大模型推理的请求调度和批处理优化?
  • 请描述一个你解决过的复杂系统性能问题,并说明解决思路
  • 谈谈你对MaaS(Model as a Service)的理解和未来发展趋势

职位点评

79
综合评分

阿里云核心AI系统研发岗,技术前沿、薪资优厚、成长空间大,但工作强度高。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术前沿、渴望快速成长、愿意接受高强度挑战的顶尖技术人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值85

薪资福利

85较高

阿里巴巴作为头部大厂,提供极具竞争力的薪酬和福利,薪资水平在行业中处于领先地位。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

95较高

该职位处于AI基础设施前沿,技术挑战大,成长空间广阔,能快速提升系统设计和AI系统能力。

技术前沿前沿/新兴技术
技术栈MaaS、LLM、GPU、Kubernetes、分布式系统、C++、Go、Python、Rust
成长机会顶会论文、ACM/ICPC国际奖项、开源项目
业务类型profit_center

工作生活

40较低

大厂核心系统岗位通常工作强度较高,但提供有竞争力的薪酬和福利。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

该职位致力于构建AI基础设施,推动AI技术规模化应用,具有较高的技术价值和社会影响力。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号支撑大规模AI应用的稳定运行
创新程度积极采用新技术
Watch Jobs