Ant Group logo
蚂蚁集团
蚂蚁集团-算力调度研发专家-杭州

蚂蚁集团-算力调度研发专家-杭州

发布于 大约 14 小时前

普通员工/个人贡献者

杭州市
高级经验
全职员工
仅现场办公
学历未注明
云计算
Gpu优化
Knative
Pytorch
Tensorflow
Volcano
云原生
分布式调度
高性能计算

AI 估算 · 40k–65k

蚂蚁集团技术专家岗,算力调度核心方向,薪资竞争力强,通常15-16薪。

职位详情

关于这个职位

该职位是蚂蚁集团算力调度团队的核心技术岗,负责构建通智算一体的高性能调度系统,支持在线服务、大数据、大模型训练/推理等多种负载的统一调度

你将深入优化大规模任务调度性能,结合GPU、网络拓扑等硬件特性进行异构资源调度,提升资源利用率和系统容错性
适合对分布式系统和AI基础设施有深厚兴趣的资深工程师

最低要求

● 具有 3 年以上的云计算/任务调度/高性能计算领域经验

● 熟练掌握分布式调度系统、大规模高可用系统、高性能软硬件架构等领域的专业知识
● 熟悉云原生或大规模并行计算相关技术栈,如 Kubernetes、Volcano、Knative、Pytorch/Tensorflow 等
● 有团队沟通和协作能力,较强,对创新驱动和交付高质量产品充满热情

工作职责

● 研发通智算一体的高性能调度系统,支持云原生应用、大数据计算作业、分布式模型训练和推理任务、函数任务等多种工作负载混合部署和运行

● 优化大规模任务调度,提升AI、大数据场景任务调度性能、优化并行计算场景作业编排
● 结合硬件拓扑、网络架构,研发异构硬件优化调度算法,提升异构硬件下的服务/任务运行性能
● 提升算力调度服务水平,保障大规模调度场景的服务可用性,提高系统化处理效率
● 通过弹性、混部、抢占等技术提升资源效率,提升业务任务运行效率

优先资格

● 有结合硬件和网络拓扑优化经验的优先,如 GPU、PCIe、NUMA、FatTree/SpineLeaf 优化等

AI 洞察

优缺点分析

优点

  • 技术栈前沿,涉及云原生、分布式系统、高性能计算和硬件优化,成长空间大
  • 团队处于快速扩张期,有较大发展潜力,薪资福利有竞争力
  • 技术深度和广度要求高,需要持续学习紧跟行业前沿
  • 适合热爱技术攻关、希望在AI基础设施领域深耕、具备扎实分布式系统背景的资深工程师

缺点 / 挑战

  • 蚂蚁集团平台大,算力调度是AI时代核心基础设施,技术挑战和影响力兼备
  • 工作强度可能较大,需要应对超大规模系统的复杂性和稳定性挑战
  • 跨团队协作频繁,沟通成本较高,需要较强的推动能力

角色解读

  • 在算力调度领域深耕,成为技术专家或架构师,主导大规模基础设施架构演进
  • 向AI基础设施方向扩展,参与更广泛的资源调度、集群管理和算力优化工作
  • 有机会转向技术管理岗位,带领团队负责核心调度系统研发
  • 负责研发通智算一体的高性能调度系统,支持云原生应用、大数据作业、大模型训练/推理等多种负载混合部署
  • 优化大规模任务调度性能,提升AI、大数据场景下的作业编排与运行效率
  • 结合硬件拓扑和网络架构,设计异构硬件优化调度算法,提升GPU等资源利用率
  • 通过弹性、混部、抢占等技术提升资源效率,保障大规模调度系统的高可用性
  • 精通分布式调度系统、大规模高可用系统设计,如Kubernetes、Volcano等
  • 熟悉云原生技术栈和并行计算框架,如Knative、PyTorch、TensorFlow等
  • 具备分布式系统性能调优和排障能力,理解CPU、GPU、内存、网络等硬件特性
  • 良好的团队沟通与协作能力,能够推动跨团队技术落地

申请策略

  • 关注蚂蚁在AI基础设施(如绿色算力、算力网络)上的战略布局,在面试中体现认知
  • 准备好讲述一个从性能瓶颈到优化方案落地的完整项目故事,突出你的技术判断力
  • 重点突出分布式系统或调度系统的架构设计和落地经验,量化性能提升成果
  • 强调对Kubernetes、Volcano等开源项目的深入使用或贡献经历
  • 展示在资源利用率优化、成本控制或大规模集群管理方面的具体案例
  • 如有GPU/网络优化经验(如CUDA、RDMA、拓扑感知),务必详细体现
  • 深入理解Kubernetes调度器及Volcano等框架的源码和设计思想
  • 学习GPU虚拟化、资源隔离与混部技术,掌握性能分析工具如profiler、perf

面试指南

  • 采用'需求-设计-权衡-验证'的结构,先明确业务目标,再阐述架构选型和技术细节,强调对性能、可用性、扩展性的平衡
  • 结合具体项目案例,说明问题背景、优化措施、量化收益和复盘总结,突出个人在其中的贡献
  • 在回答分布式系统问题时,注意提到一致性、容错、弹性等核心设计要素,并关联经典理论如CAP、一致性哈希等
  • 如何设计一个支持多租户、多工作负载的高性能调度器?
  • 在Kubernetes中如何实现GPU资源的高效调度与隔离?
  • 如何优化大规模任务在异构集群上的调度策略,提升资源利用率?
  • 请描述一个你解决过的分布式系统性能问题,以及你的排查和优化思路
  • 如何保证调度系统在单点故障或网络分区时的可用性?

职位点评

80
综合评分

蚂蚁算力调度专家岗,技术前沿、成长空间大,但WLB不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和前沿方向、渴望在AI基础设施领域成长的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活60
使命价值75

薪资福利

85较高

蚂蚁集团作为行业巨头,薪资和福利水平较高,技术专家岗位薪酬竞争力强。但JD中未明确披露具体薪资与福利。

薪资信号未披露(AI估算:40K-65K/月)

成长发展

90较高

该职位聚焦算力调度这一AI基础设施核心方向,技术栈前沿,涉及云原生、分布式系统和硬件优化,成长空间巨大。

技术前沿前沿/新兴技术
技术栈Kubernetes、Volcano、Knative、PyTorch、TensorFlow、GPU、分布式调度
业务类型cost_center

工作生活

60中等

岗位可能涉及高强度工作,JD未明确工作生活平衡措施,办公地点为杭州,现场办公。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

算力调度对AI产业发展有积极推动作用,技术影响力大,但属于商业公司内部技术岗位,社会意义相对间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs