
渣打银行
Senior SRE Engineer
Senior SRE Engineer
发布于 大约 9 小时前普通员工/个人贡献者
广州市
高级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Go
Opentelemetry
Sre
AI 估算 · 30k–50k
广州资深SRE岗位,外资银行+技术栈要求高,薪资竞争力强,月薪约3-5万
职位详情
关于这个职位
作为渣打银行市场技术部的站点可靠性工程师(SRE),你将负责提升关键交易应用和平台的可靠性、性能与可扩展性
你将与开发、基础设施和云团队紧密合作,推动SRE实践,并参与开发基于AI和微软Copilot的智能运维工具
该职位适合有丰富生产环境支持经验、熟悉可观测性技术栈(如Prometheus、Grafana、Elastic)并具备编程能力的工程师
最低要求
在以下多个技术领域有丰富经验:Prometheus和Alert Manager、Grafana、Open Telemetry(指标、日志、链路)、Elastic Stack或同类可观测性平台、应用性能监控(APM)工具、合成监控方案、Kafka/Confluent Kafka、ServiceNow ITOM及事件管理、Azure、AWS、AKS、EKS或基于Kubernetes的平台、Terraform、Ansible、Chef、Puppet或类似自动化工具、Shell脚本、Java、Python或Ruby、Web技术(Apache、HTML、JavaScript、HTTP、XML)
至少熟练掌握一种编程/脚本语言:Python、Java、Go、Shell脚本、PowerShell
可靠性工程相关经验
工作职责
站点可靠性工程**
提高关键市场应用和平台的可靠性、可用性、可扩展性和性能
建立和管理服务级别指标(SLI)、服务级别目标(SLO)和错误预算,推动以可靠性为中心的工程决策
主导生产事件的诊断与解决,减少平均检测时间(MTTD)和平均恢复时间(MTTR)
推动根本原因分析和对重复生产问题的永久修复
主动识别可靠性风险并实施措施以提高韧性和容错能力
设计和实现跨市场技术平台的监控、告警、可观测性和容量管理方案
与开发团队合作改进应用的可操作性、可观测性、可恢复性和生产就绪度
支持灾难恢复、韧性测试、故障转移演练和服务连续性规划
通过自动化、自愈能力和减少手工操作来推动运营卓越
在高严重性事件和关键生产事件期间提供技术领导
可观测性与自动化**
开发和增强涵盖指标、日志、链路、合成监控和服务健康监控的可观测性方案
构建自动化运维工作流、运行手册和修复能力
开发仪表板和分析,提供有关应用健康、性能、容量和可靠性趋势的可操作洞察
支持银行监控和可观测性能力的持续演进
AI与Copilot工程**
参与AI驱动的运维工具和智能自动化方案的设计与开发
开发集成微软Copilot的智能体,协助工程师进行故障排除、事件响应、变更风险评估、知识检索和运维决策
识别应用生成式AI和AIOps能力以减少运维工作量、提高工程效率的机会
与平台工程、架构和业务利益相关者合作,在生产运维中开发实用的AI用例
评估并实施AI驱动的可观测性、异常检测、事件关联和预测性运维能力
AI 洞察
优缺点分析
优点
- 职位融合AI和Copilot开发,紧跟技术前沿,有机会参与AI在运维领域的创新应用
- 渣打银行提供完善的培训体系和国际化工作环境,有利于职业长线发展
- 广州作为一线城市,生活配套完善,且外资银行薪资福利有竞争力
- 涉及多种技术栈,需要持续学习,对综合能力要求高
- 作为外资银行,可能涉及跨国协作,需适应时差和跨文化沟通
- 适合有5年以上SRE或运维开发经验,热爱自动化、追求高稳定性系统,并希望探索AIOps和智能运维方向的技术专家
缺点 / 挑战
- 加入全球顶级银行的技术团队,接触高并发、高可用的金融交易系统,技术挑战大,成长快
- 金融系统对稳定性要求极高,生产事故处理压力大,需要随时待命响应
角色解读
- 技术方向:可成长为首席SRE、架构师,或专精于可观测性、AIOps等细分领域专家
- 管理方向:可晋升为SRE团队负责人、生产管理负责人,带领团队保障核心系统
- 跨领域发展:积累银行金融业务知识后,可转向交易系统开发、平台工程或技术管理岗位
- 负责银行市场交易系统的可靠性、性能和可扩展性,通过定义SLO、监控告警、故障恢复等手段保障业务连续性
- 参与生产事件的诊断与解决,推动根本原因分析及永久修复,减少MTTD/MTTR
- 开发基于AI和微软Copilot的智能运维工具,实现自动化故障排查、知识检索和事件响应
- 建设可观测性平台,集成指标、日志、链路追踪、合成监控等能力,提供运营洞察
- 扎实的SRE理论和实践经验,包括SLI/SLO、错误预算、容量规划、灾备演练等
- 精通可观测性技术栈:Prometheus、Grafana、OpenTelemetry、Elastic Stack等
- 熟练掌握至少一种编程语言(Python、Java、Go)及脚本能力,能开发自动化工具
- 深入理解云原生技术(Kubernetes、Azure/AWS)和基础设施即代码(Terraform、Ansible)
申请策略
- 关注渣打银行的公众号或技术博客,了解其技术文化和最新动态,面试中展现对公司的理解
- 准备一个你主导的SRE改进项目案例,从问题背景、方案设计、实施过程到量化结果,用STAR法则呈现
- 突出你在SRE领域的实际成果:如通过优化SLO减少了多少故障、自动化程度提升、MTTR降低等量化指标
- 强调可观测性平台建设经验:具体使用的工具(Prometheus、Grafana、Elastic等)以及部署规模
- 展示编程能力:列出你参与开发的自动化工具或脚本,最好有GitHub链接或代码样例
- 若有AI或机器学习项目经验,尤其是应用于运维的(如异常检测、智能告警),务必突出
- 如果还不熟悉OpenTelemetry,建议系统学习其三大信号(指标、日志、链路)及与Kubernetes的集成
- 补充Cloud Native相关知识,尤其是Kubernetes集群管理、Helm、Operator等,提升云平台运维能力
面试指南
- 对于故障处理类问题,使用STAR框架(情境、任务、行动、结果),强调时间线、影响范围、根因分析和长期规避措施
- 对于SLO/错误预算问题,应体现对可靠性和敏捷性的平衡思考,最好引用Google SRE书籍中的经典方法
- 对于工具比较类问题,从功能特点、适用场景、团队规模、成本等维度展开,避免武断结论
- 请描述一次你处理过的重大生产事故,你是如何诊断和恢复的?事后做了哪些改进?
- 如何定义有效的SLO和错误预算?在平衡可靠性和新功能发布速度时如何决策?
- 你使用过哪些可观测性工具?请比较Prometheus和Elastic在监控方面的优劣
- 请举例说明你如何通过自动化减少运维成本或人工操作
- 你对AIOps和智能运维的理解?你认为AI在SRE领域最有潜力的应用是什么?
职位点评
72
综合评分
外资银行高级SRE,前沿技术栈+AI创新,薪资优厚但WLB一般
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度、热爱学习前沿技术、看重职业发展的资深SRE工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活50
使命价值55
薪资福利
80较高
外资银行高级职位,薪资水平在广州属于高位,福利体系完善,但JD未明确具体薪酬福利数字。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
85较高
职位涉及前沿AI技术(Copilot、AIOps)和云原生技术栈,有良好的技能成长空间,但JD未明确提及晋升通道。
技术前沿前沿/新兴技术
技术栈SRE、Prometheus、Grafana、OpenTelemetry、Elastic、Kafka、Azure、AWS、Kubernetes、Terraform、Ansible、Python、Java、Go、AI、Copilot、AIOps
业务类型ambiguous
工作生活
50较低
工作地点为广州现场办公,JD未提及弹性工作或远程选项,且金融行业可能涉及on-call,WLB一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
55较低
银行IT属于稳定成熟行业,社会影响力中性,职位以技术保障为主,创新性一般。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
渣打银行 的其他在招职位
相似职位推荐
Watch Jobs