
蚂蚁集团
蚂蚁集团-基础设施高可用工程师-杭州
蚂蚁集团-基础设施高可用工程师-杭州
发布于 大约 14 小时前普通员工/个人贡献者
杭州市
中级经验
全职员工
仅现场办公
不限
DevOps/SRE
Ai Agent
Service Mesh
Sre
分布式系统
容灾多活
混沌工程
高可用架构
AI 估算 · 30k–60k
蚂蚁集团核心基础设施团队,技术含量高,杭州互联网薪资竞争力强,通常16薪。
职位详情
关于这个职位
该职位负责守护蚂蚁集团全球级基础设施的稳定性,覆盖服务注册、配置、消息、网关等核心组件
你将参与高可用架构设计,主导SLA体系、容灾多活、混沌工程等稳定性能力建设,并探索AI Agent在智能运维中的应用
适合对分布式系统和稳定性有浓厚兴趣的技术人员
最低要求
● 至少一个基础设施领域的深度技术经验(中间件/容器/网络/存储/数据库/大数据中选一),能讲清底层实现原理,而非停留在方案层面
我们更看重你在某个领域的深度,而非面面俱到
● 大规模系统经验:参与过百节点以上规模的系统建设或运维,对大规模分布式系统的复杂性有切身体会
● 故障应急实操经验:参与过线上故障的应急处理(研发方向参与过即可),在研发或运维过程中需要考虑稳定性问题
● 扎实的编程基础,2年及以上研发经验,熟悉至少一种开发语言(Java/Golang/Python)
● 对基础设施稳定性架构方向有明确的兴趣和意向——这不是一个被动执行运维指令的角色,而是一个需要主动思考、系统性设计高可用方案的技术架构角色
工作职责
● 守护蚂蚁全球级基础设施的稳定性:负责蚂蚁全站数百万级容器规模、数百亿次调用的基础设施服务可靠性和稳定性,覆盖服务注册中心、配置中心、限流中心、消息中心、任务调度、分布式事务、MOSN/Layotto、七层网关、HCS、DNS、NTP等核心组件
● 从架构层面设计高可用能力:这不是传统的"被动运维"角色
你将参与产品的稳定性架构设计,主导SLA体系建设、容灾多活方案规划、混沌工程、变更防御、自愈容灾等高可用能力的设计与落地,而不仅仅是执行日常运维
● 用技术手段解决规模化难题:深入理解基础设施产品和架构,结合业务场景对生产问题进行根因诊断和持续优化
帮助业务应用在可用性、成本、效率上做好合适的架构选型
● 推动前沿技术大规模落地:设计并落地Service Mesh、Serverless、FaaS等在蚂蚁数百万容器场景下的接入、部署和升级方案,构建平台化能力体系化识别和管控风险
● 探索AI驱动的智能运维:结合大模型探索AI Agent在稳定性保障中的落地实践,引领中间件产品的稳定性保障模式向数字化、智能化方向演进
优先资格
● 有SLO/SLA体系建设、混沌工程、容灾多活等高可用体系的实操经验
● 熟悉主流开源中间件(如Kafka、RabbitMQ、Redis、Dubbo等)的实现机制,有开源社区贡献
● 熟悉Linux操作系统、网络协议、存储、Docker与Kubernetes
● 有AI Agent开发经验或智能运维方向实践
● 有基础设施即代码(IaC)实践经验(如Ansible、Terraform)
AI 洞察
优缺点分析
优点
- 团队重视前沿技术,如Service Mesh、Serverless、AI Agent,有较多创新空间
- 蚂蚁集团平台大,技术积累深厚,职业发展前景广阔
- 对技术深度和架构设计能力要求高,需要持续学习和钻研底层原理
- 稳定性责任重大,线上问题处理需要快速响应和冷静分析
缺点 / 挑战
- 接触全球级基础设施规模,技术挑战大,能快速提升分布式系统架构能力
- 工作强度可能较大,需要应对大规模系统稳定性压力,可能需要On-Call
- 适合对分布式系统底层原理有强烈好奇心,喜欢解决复杂技术问题,能承受一定压力并愿意深入钻研的技术人员
角色解读
- 向基础设施稳定性架构专家方向发展,成为高可用技术领域的技术权威
- 可横向拓展至平台工程、SRE管理岗,或深耕AI运维、混沌工程等细分方向
- 在蚂蚁集团这样的大型互联网平台,可接触业界前沿技术,获得快速成长和晋升空间
- 负责蚂蚁全球级基础设施的稳定性保障,包括服务注册、配置、消息、网关等核心组件,确保数百万容器规模下的高可用
- 从架构层面设计稳定性能力,如SLA体系、容灾多活、混沌工程等,并推动落地,而非被动处理日常运维
- 深入诊断和优化线上故障,帮助业务在可用性、成本、效率上做出合适的架构选型
- 探索前沿技术如Service Mesh、Serverless、AI Agent在稳定性保障中的应用,引领智能化运维方向
- 至少一个基础设施领域的深度技术经验(中间件/容器/网络/存储/数据库/大数据),能讲清底层原理
- 具备大规模分布式系统建设和运维经验,理解复杂系统的运维挑战
- 掌握至少一种编程语言(Java/Golang/Python),有扎实的编程基础
- 熟悉故障应急处理流程,能独立或参与线上故障诊断与解决
申请策略
- 在简历和面试中强调你对稳定性架构的主动思考,而非被动运维的执行者
- 了解蚂蚁集团的技术栈和中间件产品(如SOFA、MOSN),展示对公司的了解
- 突出你参与过的大规模系统项目,强调系统规模和你的具体贡献
- 详细描述线上故障处理案例,展示你的问题定位、根因分析和解决能力
- 强调在基础设施领域的深厚技术功底,如中间件、容器、网络或存储的底层原理
- 如果具备高可用体系实践经验(如SLA、混沌工程、容灾)务必重点突出
- 深入理解Kubernetes、Service Mesh等主流云原生技术,补充相关项目经验
- 学习混沌工程和SRE方法论,了解如何系统化设计稳定性体系
面试指南
- 对于故障类问题,使用STAR法则:描述背景、任务、行动、结果,重点突出你的分析过程和技术决策
- 对于系统设计类问题,从需求分析、架构选型、关键指标、容灾和扩展性等方面层层展开,体现架构思维
- 对于开放性问题,结合自己的技术经验,给出具体落地思路,展现主动探索和创新能力
- 请介绍一个你处理过的最复杂的线上故障,你是如何诊断和解决的?
- 如何设计一个高可用的服务注册中心?你会考虑哪些关键指标和容灾策略?
- 谈谈你对SLA和SLO的理解,以及如何为一个核心系统制定SLO
- 你熟悉哪些开源中间件?请深入讲讲其中之一的底层实现原理
- 你如何看待AI Agent在智能运维中的应用?假如让你设计一个,你会怎么做?
职位点评
69
综合评分
蚂蚁核心基础设施岗位,前沿技术栈,发展空间大,但工作强度高,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术成长和自我实现、热衷挑战复杂技术问题、能够适应高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值60
薪资福利
70中等
蚂蚁集团作为一线互联网大厂,薪资福利具有较强竞争力,但JD未明确具体数额和福利,因此薪资信号为未披露。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
85较高
该职位涉及Service Mesh、Serverless、AI Agent等前沿技术,有大量技术挑战和成长空间,发展性动机满足度较高。
技术前沿前沿/新兴技术
技术栈Service Mesh、Serverless、FaaS、Kubernetes、AI Agent、Chaos Engineering
业务类型ambiguous
工作生活
50较低
仅现场办公,JD未提及弹性工作或WLB相关安排,互联网基础设施团队通常工作强度较高,生活化动机满足度有限。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
60中等
保障全球级基础设施稳定性具有重要的技术价值,但属于成熟技术领域,社会影响力中性,意义感中等。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs