
滴滴出行
业务稳定性-MX信用卡 SRE骨干
业务稳定性-MX信用卡 SRE骨干
发布于 大约 1 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
学历未注明
DevOps/SRE
Aiops
Go
Sre
可观测性
容灾
故障定位
监控预警
稳定性保障
限流熔断
AI 估算 · 30k–50k
北京互联网大厂SRE高级岗位,技能稀缺,薪资竞争力强,通常14-16薪。
职位详情
关于这个职位
作为滴滴Fintech业务线的SRE骨干,你将负责支付、数字银行、信贷等核心业务的稳定性保障,主导监控、容灾、变更管理和应急响应
这个岗位需要扎实的SRE功底和故障处理能力,同时有机会探索AI+智能运维的前沿方向,适合热爱稳定性工程、能承受oncall压力的技术专家
最低要求
年以上 SRE / 稳定性 / 运维开发经验,或资深研发工程师转稳定性方向,有大规模在线服务系统的稳定性保障与架构设计经验,对系统稳定性保障有全面深入的理解
扎实的研发功底,至少精通一门主流语言(Go / Java / Python),能做工具化与自动化
扎实的故障定位与应急处置能力,独立扛过线上重大故障处理
熟悉 SRE 理论与可观测体系(Metrics / Logging / Tracing)、容量与变更管控
强责任心与使命感,良好的跨团队沟通与复杂问题分析能力,能在压力下独立决策与推动
有 AI + 稳定性(智能运维 / AIOps)落地经验
工作职责
贴身业务、为一条业务线的稳定性负责:深入理解Fintech业务线(如支付业务/Cuenta数字银行 / 现金贷 / 信用卡 / 先买后付/99pay),作为稳定性owner,围绕可用性、连续性与安全目标,挖掘业务风险、沉淀稳定性标杆,对该线SLA/SLO、MTTD/MTTR负责
构建主动防御与快速止损能力:建设监控预警、根因定位、链路分析能力,沉淀降级、限流、熔断、一键预案等止损手段,推动从"被动救火"到"主动防御"
变更与发布管控:主导/参与核心变更评审,识别高危变更
负责 P0/P1 发布的方案制定与值守,守住发布质量
×24 oncall 与应急:参与业务线 oncall 轮转,快速定位止损
主导/参与故障复盘,闭环改进项
核心链路梳理与容灾:摸清关键链路与依赖,识别单点,推动容灾、弹性等架构演进,提升业务可用率
智能运维与提效:结合 AI 与自动化能力提升保障效率,推动监控自愈、智能诊断等能力落地
AI 洞察
优缺点分析
优点
- 业务核心:Fintech是滴滴的重要业务,稳定性角色关键,能接触支付、信贷等高价值场景
- 前沿方向:AI+智能运维是行业趋势,有落地实践机会
- 平台优势:滴滴作为大型互联网公司,技术体系成熟,薪资福利有竞争力
- 责任重大:作为稳定性owner,需要为线上事故承担较大责任
- 适合热爱稳定性工程、抗压能力强、乐于解决复杂系统问题,并且能接受非固定工作时间的资深开发者
缺点 / 挑战
- 技术挑战:大规模在线系统、复杂依赖,能深度锻炼故障排查和架构设计能力
- On-call压力大:需要7×24轮班,随时可能被叫醒处理故障
- 跨部门协调:需要推动其他团队进行架构改造和风险整改,可能遇到阻力
角色解读
- 技术专家路线:从SRE骨干到稳定性专家/架构师,深入建设高可用体系
- 管理路线:可成为稳定性团队的技术负责人,带领团队负责多条业务线
- 跨界发展:通过AIOps积累AI工程能力,转向智能运维、平台工程等领域
- 负责支付、数字银行、现金贷等Fintech业务线的稳定性保障,作为owner对SLA/SLO、MTTD/MTTR负责
- 构建监控预警、根因定位、链路分析能力,沉淀降级、限流、熔断等止损手段
- 主导核心变更评审,负责P0/P1发布方案制定与值守,以及7×24 oncall应急
- 梳理核心链路与依赖,推动容灾和弹性架构演进,并探索AI智能运维提升效率
- 扎实的研发功底,精通Go/Java/Python之一,能进行工具化与自动化开发
- 深刻理解SRE理论,熟练运用可观测性体系(Metrics/Logging/Tracing)和容量、变更管控
- 出色的故障定位与应急处置能力,能独立扛过线上重大故障
- 良好的跨团队沟通与复杂问题分析能力,能在压力下决策
申请策略
- 了解滴滴Fintech的海外业务(如Cuenta、99pay),在面试中体现对业务的思考
- 强调你对稳定性文化的认同,展示你乐于主动发现风险并推动改进的态度
- 突出你负责过的大规模系统稳定性保障项目,量化SLA提升、故障时长降低等成果
- 强调你的故障处理案例,描述你如何快速定位、止损和复盘
- 展示你的自动化工具开发能力,比如写过的监控、发布或演练脚本
- 如果有AIOps或智能运维相关的实践,务必重点提及
- 深入学习可观测性技术栈,如Prometheus、Grafana、ELK、Jaeger等
- 复习常见分布式系统故障模式和处理方法,阅读SRE相关经典书籍
面试指南
- 使用STAR法则:描述情境(Situation)、任务(Task)、行动(Action)、结果(Result),突出你的决策和量化效果
- 针对设计类问题,先明确目标(如可用性、SLO),再分层次阐述监控、预案、容灾等方案
- 对推动类问题,强调沟通策略、数据驱动的说服方式,以及如何建立跨团队共识
- 请分享一次你处理过的重大线上故障,你是如何定位、止损和复盘的?
- 如何设计一个高可用系统的监控和告警体系?告警阈值如何制定?
- 在变更管理方面,你如何识别高危变更并控制发布风险?
- 如何说服业务团队投入资源进行容灾或架构优化?
- 你对AIOps有哪些理解?如何将AI能力落地到稳定性保障中?
职位点评
64
综合评分
滴滴Fintech SRE骨干,技术前沿、薪资可观,但需接受7×24 oncall,WLB较差。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和快速成长、愿意接受oncall高强度工作的稳定性工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活30
使命价值60
薪资福利
70中等
薪资水平未在JD中披露,但滴滴作为上市互联网公司,薪资福利在行业内具有竞争力。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
85较高
岗位涉及AI+智能运维等前沿方向,技能成长空间大,但未提及明确的晋升路径。
技术前沿前沿/新兴技术
技术栈SRE、AIOps、可观测性、Go、Java、Python、容灾、监控预警
业务类型ambiguous
工作生活
30较低
JD明确要求7×24 oncall,工作强度大,WLB较差。
工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词
使命价值
60中等
Fintech业务涉及支付和信贷,有一定社会价值,但JD未明确使命导向。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Watch Jobs