Alibaba logo
阿里巴巴
面向 AI Agent 的下一代智能调度引擎与运行时系统-阿里星/A Star

面向 AI Agent 的下一代智能调度引擎与运行时系统-阿里星/A Star

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
无经验要求
全职员工
仅现场办公
硕士
云计算
Ai Agent
Go
Linux内核
Microvm
分布式系统
虚拟化
调度系统

AI 估算 · 60k–90k

阿里星顶尖校招,系统软件方向稀缺,博士学历加持,薪资竞争力强。

职位详情

关于这个职位

阿里巴巴阿里星项目招聘顶尖博士/硕士,主导阿里云AI Agent基础设施的调度引擎与运行时系统研发

工作涉及底层系统、虚拟化、Kubernetes调度、异构算力协同,攻克毫秒级冷启动、智能休眠等难题,支撑千万级实例规模
适合对系统软件有极致追求、兼具工程与研究能力的技术人才

最低要求

学历与学术背景:

计算机科学、软件工程、电子工程、人工智能或相关领域的博士学位(PhD)优先
或极具天赋的硕士学位,需在顶级系统/人工智能会议(如 OSDI, SOSP, EuroSys, NeurIPS, ICML 等)或期刊发表过高水平一作论文
具备深厚的操作系统、分布式系统理论基础,对系统软件前沿技术有敏锐洞察力
核心技术栈与工程能力:
编程语言:精通 Go/C++/Rust 中至少一种,具备大型、复杂底层系统或分布式调度系统的设计与开发经验,代码风格严谨,工程素养优秀
系统底层:深入理解 Linux 内核机制(如 cgroups, namespaces, 内存管理, 内核调度)及虚拟化技术(KVM, QEMU, Hypervisor)
熟悉 eBPF、CRIU、gVisor、Kata Containers 等云原生前沿技术者优先
云原生架构:熟悉 Kubernetes 架构,特别是其调度器(kube-scheduler)和资源管理机制,有二次开发、重度使用或大规模集群管理经验
有分布式系统调度算法(如 Borg, Omega, Mesos)设计或研究经验者优先
综合素质与软技能:
问题解决能力:逻辑严谨,善于在复杂的存量系统中进行重构与创新,不仅仅是纸上谈兵
具备体系化的方法论来解决复杂系统中的性能瓶颈与稳定性问题
驱动力与抗压性:拥有强烈的技术热情和好奇心,自驱力和学习力强
乐观皮实,坚韧抗压,结果导向
喜欢挑战性的技术研发工作,善于攻坚克难,能持续推动问题解决和突破
团队协作:具备良好的沟通能力和团队合作精神,能够跨团队(如与算法、硬件、产品团队)高效协作

工作职责

定义未来架构与统一底座:主导阿里云新一代 AI Agent 基础设施的顶层设计与演进,构建融合 Agent Sandbox、容器与虚拟化技术的统一算力调度系统

深度探索 MicroVM、异构计算调度、OS Agent 等前沿技术在智能体场景下的应用边界,确立技术领先优势
攻克极致性能与成本难题:解决超大规模分布式系统中的核心挑战,实现 Agent/Sandbox 的毫秒级冷启动、带状态极速唤醒及智能休眠
通过数据驱动的异构算力(CPU/GPU/NPU)协同调度与安全超卖,在保障 SLO 的前提下显著提升资源利用率,打造兼具极致性能与极致成本效益的计算底座
支撑千万级规模与学术工程闭环:突破单集群千万级 Agent/Sandbox 实例的管理瓶颈,确保生产环境的高可用与稳定性
保持对系统软件(System Software)领域前沿技术的敏锐度,推动学术界最新成果(SOTA)在工业界的大规模落地验证,并通过实战反哺学术研究,产出高水平专利与论文

优先资格

跨界融合与创新思维(强烈加分项):

System + AI 跨界能力:既懂系统底层又懂 AI 算法,有利用大模型微调、强化学习解决系统工程问题(如智能调度、异常检测)的相关经验
或掌握 AI 基础知识,能将 AI 工具集成到研发工作流中提升效率
开源贡献:是 Linux Kernel, Kubernetes, Docker, KubeVirt 等知名开源项目的主要功能贡献者(Committer/Maintainer),或在社区有活跃影响力

AI 洞察

优缺点分析

优点

  • 阿里巴巴平台资源丰富,阿里星项目提供高起点的职业发展通道
  • 与顶尖人才合作,解决超大规模分布式难题,技术成长空间巨大
  • 薪资待遇优厚,学术与工程并重,满足成就感和物质需求
  • 技术栈深,要求极强的底层功底,学习曲线陡峭
  • 跨团队协作复杂,需同时处理算法、硬件等多方需求,沟通成本高
  • 适合对系统底层技术有极致兴趣、具备强自驱力和抗压能力的顶尖技术人才,尤其是博士或极优硕士

缺点 / 挑战

  • 站在AI时代基础设施前沿,技术挑战大,积累顶级工程与研究能力
  • 工作强度大,面临极致性能与成本的双重压力,需要高强度攻坚

角色解读

  • 技术深耕方向:成为系统软件/云基础设施领域的顶尖专家,主导核心技术架构
  • 研究双向赋能:与学术界合作,产出高水准论文专利,提升行业影响力
  • 管理方向:从技术专家转向技术管理,带领团队攻克更大规模难题
  • 主导AI Agent基础设施的调度引擎设计,涵盖容器、虚拟化、异构算力协同,构建统一算力底座
  • 攻克毫秒级冷启动、带状态唤醒、智能休眠等性能难题,提升资源利用率和成本效益
  • 管理千万级实例规模,确保系统高可用,并推动学术成果转化为工业实践
  • 精通Go/C++/Rust之一,有大型系统或分布式调度开发经验
  • 深入理解Linux内核、虚拟化技术,熟悉Kubernetes调度器
  • 具备扎实的分布式系统、操作系统理论基础,能进行系统级性能优化
  • 了解AI基础,能将大模型或强化学习应用于系统问题,是加分项

申请策略

  • 了解阿里云底层技术栈和开源项目,面试时展示对业务的理解
  • 准备深度项目复盘,用数据和架构图清晰表达技术决策过程
  • 突出顶级会议论文(OSDI, SOSP等)或重磅开源贡献,证明技术深度
  • 强调大型系统项目的实际设计与落地经验,展示解决复杂问题的能力
  • 展现Go/C++/Rust及内核、虚拟化的扎实功底,附上性能优化案例
  • 如果曾有AI+系统结合的项目,务必突出,这是重要加分项
  • 如果对Kube-scheduler或Kata Containers不熟,提前研究其源码并尝试二次开发
  • 补充AI基础知识,了解大模型如何辅助系统设计或智能调度

面试指南

  • 分维度回答:先明确目标约束,再对比主流方案,最后结合系统实际给出设计取舍
  • 用STAR法则讲项目:情境(Situation)、任务(Task)、行动(Action)、结果(Result),突出个人贡献
  • 对于开放性问题,展现系统性思维:从底层机制到上层架构,再到未来演进
  • 如何设计一个支持百万级Agent实例的调度系统?请谈架构与挑战
  • 你如何解决容器冷启动延迟高的问题?具体技术方案是什么?
  • 请分享一个你在分布式系统性能优化上的实际案例,并量化结果
  • 你如何看待AI Agent未来的基础设施需求?哪些是核心难点?
  • 如何在保障SLO的前提下实现异构算力调度与超卖?

职位点评

79
综合评分

顶级平台、前沿技术、超高薪资,但工作强度大、WLB一般。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术极致、渴望成为系统软件领军人物的顶尖博士/硕士,愿意为前沿事业投入高强度工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活45
使命价值80

薪资福利

85较高

阿里星提供极具竞争力的薪资和顶尖平台,薪酬水平处于市场最高档,福利保障完善。

薪资信号未披露(AI估算:60K-90K/月)

成长发展

95较高

该职位处于AI基础设施最前沿,技术挑战极大,学术与工程结合,成长空间无限。

技术前沿前沿/新兴技术
技术栈AI Agent、MicroVM、Kubernetes、eBPF、CRIU、gVisor、Kata Containers、异构计算、Linux内核
成长机会学术工程闭环、产出高水平专利与论文
业务类型profit_center

工作生活

45较低

工作地点为北京/杭州/深圳,但需高强度攻坚,未明确WLB,现场办公,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

推动AI基础设施发展,技术影响力大,对行业有积极贡献,使命感和价值感强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号确立技术领先优势、推动学术界最新成果在工业界落地
创新程度开拓性创新(行业首创)
Watch Jobs