
普通员工/个人贡献者
综合评分 79
核心AI算力基础设施研发岗,技术前沿且成长空间大,但需承担值班响应压力。
从薪资福利、成长发展、工作生活和使命价值四个维度综合评估,方便横向比较。
薪资怎么样
5万
比DevOps/SRE中位数高
发布情况
新岗位 · 今天发布
公司情况
这家公司招聘很活跃
约 3340 个在招 · 其中DevOps/SRE 24 个
市场机会
选择适中
杭州 · DevOps/SRE · 39 个在招
该职位负责阿里云灵骏AI算力集群的稳定性平台研发,构建健康诊断、故障自愈及全链路监控体系
拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作
建设覆盖灵骏智算集群、超节点、节点、硬件与网络的统一健康诊断、自愈与智能故障治理体系,围绕算力可用性、故障恢复效率、规模运维效率等目标,构建“异常快速发现-智能根因分析-故障自愈处置”的闭环系统
有过线上系统监控体系、变更体系/流程设计和研发经验者优先
优点
缺点 / 挑战
作为高级技术专家岗位,薪资福利处于行业前列,但涉及值班响应,整体补偿性较好。
处于AI算力基础设施核心领域,技术前沿性极强,能接触到超大规模智算集群,技术成长空间巨大。
岗位明确要求涉及值班响应和SLA保障,存在一定的on-call压力,工作生活平衡受限。
支撑AI大模型时代的底层算力基础设施,社会价值和行业前景极高,使命感强。
阿里巴巴 的其他在招职位