DiDi logo
滴滴出行
业务稳定性-MX-CL SRE

业务稳定性-MX-CL SRE

发布于 大约 2 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
学历未注明
DevOps/SRE
Aiops
Go
Sre
变更管理
可观测性
容灾
故障定位
监控预警

AI 估算 · 25k–45k

北京一线互联网SRE岗位,涉及金融核心业务,薪酬竞争力强,通常15薪左右。

职位详情

关于这个职位

作为滴滴Fintech业务线的SRE,你将贴身负责支付、数字银行等核心业务的稳定性保障,包括监控预警、故障应急、容量规划、变更管控等

需要深入理解业务,构建主动防御体系,推动容灾架构演进,并参与7×24 oncall
适合热爱技术挑战、具备强责任心和应急处置能力的资深工程师

最低要求

年以上 SRE / 稳定性 / 运维开发经验,或资深研发工程师转稳定性方向,有大规模在线服务系统的稳定性保障与架构设计经验,对系统稳定性保障有全面深入的理解

扎实的研发功底,至少精通一门主流语言(Go / Java / Python),能做工具化与自动化
扎实的故障定位与应急处置能力,独立扛过线上重大故障处理
熟悉 SRE 理论与可观测体系(Metrics / Logging / Tracing)、容量与变更管控
强责任心与使命感,良好的跨团队沟通与复杂问题分析能力,能在压力下独立决策与推动
有 AI + 稳定性(智能运维 / AIOps)落地经验

工作职责

贴身业务、为一条业务线的稳定性负责:深入理解Fintech业务线(如支付业务/Cuenta数字银行 / 现金贷 / 信用卡 / 先买后付/99pay),作为稳定性owner,围绕可用性、连续性与安全目标,挖掘业务风险、沉淀稳定性标杆,对该线 SLA/SLO、MTTD/MTTR 负责

构建主动防御与快速止损能力:建设监控预警、根因定位、链路分析能力,沉淀降级、限流、熔断、一键预案等止损手段,推动从"被动救火"到"主动防御"
变更与发布管控:主导/参与核心变更评审,识别高危变更
负责 P0/P1 发布的方案制定与值守,守住发布质量
×24 oncall 与应急:参与业务线 oncall 轮转,快速定位止损
主导/参与故障复盘,闭环改进项
核心链路梳理与容灾:摸清关键链路与依赖,识别单点,推动容灾、弹性等架构演进,提升业务可用率
智能运维与提效:结合 AI 与自动化能力提升保障效率,推动监控自愈、智能诊断等能力落地

AI 洞察

优缺点分析

优点

  • 滴滴作为大厂,平台资源丰富,有完善的基础设施和工具链,学习成长空间大
  • SRE岗位在行业内需求旺盛,职业前景好,薪资待遇优厚
  • 深度接触AIOps等前沿方向,提升技术视野
  • 涉及多团队协作,沟通成本高,需要较强的推动力
  • 适合对系统稳定性有浓厚兴趣、抗压能力强、愿意深入业务的技术工程师

缺点 / 挑战

  • 参与核心金融业务,技术挑战大,能积累高并发、高可用系统的宝贵经验
  • 需承担7×24 oncall压力,可能有夜间和节假日应急响应
  • 业务稳定性责任重大,故障时需快速决策,心理压力较大

角色解读

  • 成为稳定性领域的专家,精通高可用架构、容量规划与智能运维
  • 从单条业务线稳定性负责人成长为整个技术体系稳定性负责人
  • 向技术管理方向发展,带领稳定性团队,或转向云原生、基础架构等方向
  • 作为稳定性Owner,深入理解Fintech业务(支付、数字银行、信贷等),对业务线的SLA/SLO、MTTD/MTTR负责,确保服务高可用
  • 构建监控预警、根因定位、链路分析等主动防御体系,沉淀降级限流熔断等快速止损手段
  • 主导核心变更评审和发布值守,参与7×24 oncall应急响应,并组织故障复盘和改进闭环
  • 梳理核心链路,推动容灾和弹性架构演进,并通过AI和自动化提升运维效率
  • 扎实的研发能力,精通Go/Java/Python中的至少一种,能够进行工具化和自动化开发
  • 深入理解SRE理论与可观测体系(Metrics/Logging/Tracing),熟悉容量和变更管控
  • 具备优秀的故障定位和应急处置能力,能独立处理重大线上故障
  • 熟悉AIOps或智能运维技术,有AI+稳定性落地经验者优先

申请策略

  • 在简历中量化成果,例如可用性从99.9%提升到99.99%,MTTR降低多少
  • 提前了解滴滴Fintech的业务方向,如支付、数字银行等,在面试中展现业务理解
  • 突出大规模在线系统的稳定性保障经验,例如SLA/SLO达成、重大故障处理案例
  • 强调编程能力,给出用Go/Java/Python开发的自动化工具或监控系统
  • 展示对SRE体系(监控、容量、变更、应急)的深入理解,最好有实际架构设计实践
  • 如有AIOps或智能运维项目经验,务必突出
  • 加深SRE理论学习,熟悉可观测性工具如Prometheus、Grafana、Jaeger等
  • 练习故障排查思路,熟悉常见故障场景(如DB连接耗尽、缓存穿透、依赖超时等)

面试指南

  • 对于故障处理问题,使用STAR法则,明确背景、任务、行动和结果,强调个人角色和量化成果
  • 对于设计监控体系,从指标采集、数据存储、告警规则、自愈行动几个层面阐述,并结合具体工具
  • 对于容量问题,先分析容量瓶颈,再给出快速扩容、限流、降级等应急措施,然后讲长期容量规划
  • 请介绍你处理过的最严重的一次线上故障,你是如何快速定位和止损的?
  • 如何设计一个高可用系统的监控和告警体系?
  • 当业务突然出现流量暴增导致系统容量不足时,你会如何应对?
  • 谈谈你对SRE和传统运维的区别的理解,以及你对SRE核心指标的认知
  • 你是否有过推动稳定性改进的项目?如何衡量改进效果?

职位点评

64
综合评分

大厂核心金融业务,SRE岗位技术挑战大,薪资优厚但oncall压力大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合重视技术成长和职业发展,能够接受高强度工作和oncall压力的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展80
工作生活30
使命价值70

薪资福利

70中等

虽然JD未明确薪资,但作为上市大厂核心金融业务的技术岗位,薪酬水平通常较高,具有竞争力。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

80较高

SRE岗位技术含量高,涉及AIOps前沿方向,且滴滴平台提供丰富的实践场景,个人成长空间大。

技术前沿前沿/新兴技术
技术栈SRE、Go、Java、Python、AIOps、可观测性、容灾
业务类型ambiguous

工作生活

30较低

明确要求7×24 oncall,工作节奏和压力较大,对生活会有较多侵占,WLB较差。

工作模式仅现场办公
办公地点未明确
加班情况明确要求弹性/高强度

使命价值

70中等

支付和数字银行等业务直接影响用户资金安全,有较强的社会价值,且金融科技行业处于增长期。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs