
渣打银行
Lead, SRE Engineer
Lead, SRE Engineer
发布于 大约 9 小时前中层管理(经理/总监)
广州市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Aiops
Opentelemetry
Sre
可观测性
可靠性工程
AI 估算 · 35k–55k
外资银行中高层技术管理岗,广州薪资水平较一线城市略低,但结合SRE稀缺性和复杂度,预估月薪3.5-5.5万
职位详情
关于这个职位
作为市场部门SRE团队的负责人,您将制定并推动可靠性工程战略,领导全球团队建立SRE标准、可观测性实践和自动化能力,提升服务可靠性并降低运营风险
这是一个结合技术领导、人员管理和运营治理的岗位
最低要求
在Prometheus、Grafana、OpenTelemetry、Elastic Stack、Kafka、Azure/AWS/Kubernetes、Terraform/Ansible等多项技术上有丰富经验
熟练掌握Shell脚本、Java、Python或Ruby中的一种或多种编程语言
具备高级故障排除能力,涵盖应用、中间件、云基础设施、数据库、网络和分布式系统
有生产事故管理和重大事件支持经验
具备根本原因分析和问题管理专业知识
有容量规划、性能工程和弹性测试经验
深入理解运营风险和产线稳定性原则
工作职责
制定并维护市场SRE战略、运营模型、标准和路线图
建立并管理SLI、SLO和错误预算框架
制定可靠性成熟度评估和改进计划
推动降低运营风险的系统性修复
向高级技术领导层呈现可靠性指标、风险主题和弹性改进计划
主持或参与可靠性评审、服务健康评审和重大事故治理论坛
确保市场技术团队在可观测性、弹性和运营就绪标准上的一致性
推动并监督关键市场服务的可靠性改进项目
领导生产事故的诊断和解决,减少MTTD和MTTR
驱动根本原因分析和永久性修复
主动识别可靠性风险并实施改进措施
定义监控、可观测性和容量管理解决方案的标准并提供技术领导
与开发团队合作提高应用可操作性、可观测性、可恢复性和生产就绪度
支持灾难恢复、弹性测试、故障切换演练和服务连续性规划
通过自动化、自愈能力和减少手动操作来推动运营卓越
在重大事故期间作为高级SRE升级点,协调技术恢复活动并与高级利益相关者沟通
推动生产事故中暴露的系统性可靠性风险的识别和修复
开发并增强可观测性解决方案,覆盖指标、日志、追踪、合成监控和服务健康监控
构建自动化运营工作流、runbook和修复能力
开发仪表板和分析工具,提供应用健康、性能、容量和可靠性趋势的可操作洞察
支持银行监控和可观测性能力的持续演进
定义市场AIOps和可靠性自动化路线图
优先并赞助提高运营效率、弹性和工程生产力的AI用例
治理微软Copilot集成运营助手的设计和实现
建立AI在生产支持和可靠性工程中的采用标准和控制措施
识别通过AI辅助诊断、变更风险评估、事故管理和知识管理减少运营辛劳的机会
在市场技术领导论坛中担任主要SRE代表
与应用程序开发、生产支持、架构、基础设施和云工程领导者合作
影响工程团队采用弹性、可观测性、自动化和运营就绪的最佳实践
定期向高级利益相关者提供可靠性性能、运营风险和弹性改进的最新信息
优先资格
在以下一个或多个领域有经验:Microsoft Copilot Studio和Copilot扩展性
AI智能体开发和编排
生成式AI平台和LLM
AIOps平台和智能事件管理
检索增强生成(RAG)架构
运营知识管理和搜索平台
AI驱动的可观测性和事故管理解决方案
AI 洞察
优缺点分析
优点
- 外资银行背景,平台稳定,薪资福利具有竞争力,工作流程规范
- 前沿领域包括AIOps、AI辅助运维,技术栈现代且持续更新
- 涉及全球协作,时区差异可能带来灵活工作时间的要求
- 适合具有5年以上SRE或运维经验、期望向技术管理转型的资深工程师,对金融科技和AI赋能运营有浓厚兴趣
缺点 / 挑战
- 领导全球团队,接触复杂金融系统,技术挑战大,成长空间广阔
- 作为领导岗,需要同时扛起技术方向和人员管理责任,工作压力较大
- 银行业对合规和风险控制要求严格,流程可能较为冗长
角色解读
- 晋升为更高层技术总监或首席SRE架构师,负责更大范围的技术战略
- 横向扩展至其他领域如云架构、平台工程或AI基础设施领导岗位
- 在银行业内建立SRE最佳实践品牌,成为行业顾问或创新推动者
- 制定市场部门的SRE战略,包括可靠性标准、可观测性框架和自动化路线图
- 领导全球SRE团队,推动服务可靠性改进,包括事故管理、容量规划和弹性测试
- 与开发、基础设施和云工程团队合作,确保应用可操作性和产线稳定性
- 推动AIOps和AI辅助运营,利用Copilot和LLM提升故障诊断和运营效率
- 精通可观测性技术栈,如Prometheus、Grafana、OpenTelemetry、Elastic
- 熟悉云平台(Azure/AWS)和容器编排(Kubernetes、AKS/EKS),具备自动化工具(Terraform、Ansible)经验
- 至少掌握一种编程语言(Python、Java、Go、Shell),用于脚本和工具开发
- 具备生产环境故障诊断、事故管理和根本原因分析能力
申请策略
- 在面试中准备一个具体的可靠性改进案例,并用量化指标证明效果
- 提前了解渣打银行的技术动态,特别是其数字化转型和AI战略
- 突出以往领导SRE团队的经验,包括所负责的基础设施规模、关键指标改善(如MTTR降低百分比)
- 强调可观测性体系搭建的成果,例如SLI/SLO框架的建立和监控覆盖率提升
- 展示自动化运维方面的成就,如通过脚本或工具减少人工操作的具体案例
- 提及AI/ML在运维中的应用尝试,即使是POC项目也有价值
- 系统学习AIOps和LLM在运维中的应用,如微软Copilot Studio或RAG架构
- 补充金融行业知识,了解交易系统对可靠性的特殊要求
面试指南
- STAR法则:描述情境、任务、行动、结果,突出领导力和量化成果
- 分阶段回答:先谈战略框架,再讲执行细节,最后总结学习与改进
- 你将如何设计一个SRE战略路线图,并确保组织内的执行?
- 描述一次你领导处理重大生产事故的经验,如何协调团队并减少MTTR?
- SLI/SLO/错误预算在实际团队推行中可能遇到哪些阻力?你会如何应对?
- 你如何看待AIOps和AI在可靠性工程中的角色?是否有实际经验?
- 在跨国团队中,你如何确保不同地区的SRE标准一致?
- 复习SRE经典文献(Google SRE书籍),并能够结合实际案例阐述原则
职位点评
68
综合评分
外资银行全球SRE负责人,技术前沿,薪资优厚,但现场办公和潜在弹性时间需权衡。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最看重技术成长、领导力和薪资竞争力的求职者,愿意接受现场办公和适度的工作弹性。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活40
使命价值60
薪资福利
75中等
作为外资银行中高层技术管理岗,薪资水平在广州市具有较强竞争力,福利体系完善,但银行薪资增长相对较慢。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
85较高
该职位技术栈现代(Kubernetes、云原生、AI),涉及前沿的AIOps和LLM应用,且领导全球团队,发展空间大。
技术前沿前沿/新兴技术
技术栈Prometheus、Grafana、OpenTelemetry、Kubernetes、Kafka、Terraform、Ansible、Python、AIOps、Microsoft Copilot、LLM
成长机会领导全球团队、策略制定、路线图
业务类型profit_center
工作生活
40较低
银行通常现场办公,虽未明确加班情况,但领导岗和全球协作可能涉及非工作时间响应,WLB一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
60中等
金融行业稳定但社会影响力中性,对系统稳定性的使命有正向意义,但创新模式仍以成熟技术为主。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
渣打银行 的其他在招职位
相似职位推荐
Watch Jobs