Standard Chartered logo
渣打银行
Senior SRE Engineer

Senior SRE Engineer

发布于 大约 14 小时前

普通员工/个人贡献者

广州市
高级经验
全职员工
仅现场办公
学历未注明
DevOps/SRE
Opentelemetry
Sre

AI 估算 · 25k–45k

外资金融机构SRE岗位,薪资水平较高,技术栈前沿,具有竞争力。

职位详情

关于这个职位

作为渣打银行市场科技部的SRE工程师,你将负责提升市场应用和平台的可靠性、稳定性、性能与可扩展性

你将与开发、基础设施、云和生产支持团队紧密合作,推动SRE实践落地,减少运营风险,确保关键应用持续可靠运行
同时,你将参与AI驱动的运营工具和微软Copilot集成代理的开发,提高事件管理、故障排查和运营效率

最低要求

强大的可靠性工程、可观测性平台、软件工程、云计算、自动化工程、事件管理经验

熟悉以下多项技术:Prometheus和AlertManager、Grafana、OpenTelemetry(指标、日志、链路)、Elastic Stack或同等可观测性平台、APM工具、合成监控方案、Kafka/Confluent Kafka、ServiceNow ITOM和事件管理、Azure、AWS、AKS、EKS或基于Kubernetes的平台、Terraform、Ansible、Chef、Puppet或类似自动化工具、Shell脚本经验

工作职责

提升业务关键的市场应用和平台的可靠性、可用性、可扩展性和性能

建立并管理服务级别指标(SLI)、服务级别目标(SLO)和错误预算,推动以可靠性为中心的工程决策
主导生产事件的诊断和解决,减少平均检测时间(MTTD)和平均恢复时间(MTTR)
推动根本原因分析和重复生产问题的永久修复
主动识别可靠性风险并实施提高韧性和容错能力的措施
设计和实施跨市场技术平台的监控、告警、可观测性和容量管理解决方案
与开发团队合作,提高应用的可操作性、可观测性、可恢复性和生产就绪度
支持灾难恢复、韧性测试、故障转移演练和服务连续性规划
通过自动化、自愈能力和减少手动操作努力推动运营卓越
在高严重性事件和关键生产事件期间提供技术领导
开发和增强涵盖指标、日志、链路、合成监控和服务健康监控的可观测性解决方案
构建自动化运营工作流、运行手册和修复能力
开发提供关于应用健康、性能、容量和可靠性趋势的可操作洞察的仪表板和分析
支持银行监控和可观测性能力的持续演进
贡献于AI驱动的运营工具和智能自动化解决方案的设计与开发
开发微软Copilot集成代理,帮助工程师进行故障排查、事件响应、变更风险评估、知识检索和运营决策
确定应用生成式AI和AIOps能力以减少运营工作负载并提高工程生产力的机会
与平台工程、架构和业务利益相关者合作,开发生产运营中的实际AI用例
评估并实施AI驱动的可观测性、异常检测、事件关联和预测性运营能力

AI 洞察

优缺点分析

优点

  • 外资金融机构,平台稳定,福利好,有完善的培训和职业发展体系
  • 技术栈前沿,涉及云原生、可观测性、AI等热点领域,技能积累快
  • 工作内容不仅包括传统SRE,还包含AI工具开发,视野广阔
  • 需要同时掌握多种技术栈,学习曲线陡峭
  • 生产事件可能需要在非工作时间响应,影响工作生活平衡
  • 适合有3-5年运维或SRE经验、热爱技术、愿意学习AI和自动化、希望在金融领域深耕的工程师

缺点 / 挑战

  • 金融行业对系统稳定性和安全性要求极高,工作压力较大

角色解读

  • 在大型金融机构积累SRE经验,可向高级SRE专家或SRE架构师发展
  • 接触AIOps和生成式AI,未来可转向智能运维或AI工程方向
  • 在渣打银行内部可横向转型至云平台工程、基础设施架构或技术管理岗位
  • 负责市场应用和平台的可靠性、可用性和性能优化,通过SRE实践减少故障发生
  • 主导生产事件的诊断与解决,推动根因分析和永久修复,降低MTTD和MTTR
  • 设计与实施监控、告警、可观测性方案,并开发AI驱动的运营工具和Copilot集成代理
  • 深入掌握SRE原则和可观测性技术,如Prometheus、Grafana、OpenTelemetry、Elastic Stack等
  • 熟练使用Kafka、Kubernetes、云平台(Azure/AWS)及自动化工具(Terraform、Ansible)
  • 具备脚本编程能力(Shell)和软件开发基础,能够构建自动化工作流

申请策略

  • 关注渣打银行的技术博客和技术分享,了解其SRE团队文化
  • 面试中展示对金融系统合规和可靠性的理解,强调责任心
  • 突出SRE相关经验,如SLO/SLI管理、事件响应、自动化运维等
  • 列出掌握的可观测性工具(Prometheus、Grafana、OpenTelemetry等)及云平台认证
  • 如有AI或机器学习项目经验,特别是与运维结合的点,务必强调
  • 补充Kubernetes和云原生生态知识,如Service Mesh、Helm等
  • 学习生成式AI基础,了解AIOps概念和工具,如Ansible结合AI

面试指南

  • 使用STAR原则描述经历:情境、任务、行动、结果,用数据支撑
  • 对于设计类问题,从需求出发,给出方案比较,突出权衡和决策
  • 展示学习能力,对于不熟悉的技术,表现出快速学习和兴趣
  • 谈谈你如何设计一个SLO并基于错误预算做出工程决策?
  • 描述一次你主导处理生产故障的经历,如何降低MTTR?
  • 你对可观测性中的Metrics、Logs、Traces如何理解?在项目中如何落地?
  • 你如何设计一个自动化运维工作流?请举例说明
  • 你对AI在运维中的应用有什么看法?是否了解AIOps?

职位点评

68
综合评分

外资金融SRE,前沿技术栈,发展空间大,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合以技能成长和技术前沿为主要动力、能接受现场办公和可能加班的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活40
使命价值60

薪资福利

75中等

该职位薪资水平较高,外资金融机构福利完善,但JD未明确具体福利细节,整体补偿性较好。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

技术栈前沿,涉及SRE、云原生、AI,有明确的技能成长机会,但JD未提及晋升路径。

技术前沿前沿/新兴技术
技术栈SRE、Prometheus、Grafana、OpenTelemetry、Kafka、Kubernetes、Terraform、Azure、AWS、AI、Copilot
业务类型profit_center

工作生活

40较低

仅现场办公,未明确WLB,金融行业可能涉及on-call,生活化需求满足度低。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

60中等

银行业属于稳定成熟行业,社会影响力中性,但技术部门对业务支撑作用明显,有一定意义感。

行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs