Oracle logo
甲骨文
Principal Site Reliability Engineer

Principal Site Reliability Engineer

发布于 大约 3 小时前

普通员工/个人贡献者

Hong Kong, HK
高级经验
全职员工
仅现场办公
学历未注明
DevOps/SRE
Automation
On-Call
Root Cause Analysis
Slo
Sre

AI 估算 · 60k–90k

香港资深SRE岗位,甲骨文平台大,技术要求高,薪资高于内地,但生活成本也高。

职位详情

关于这个职位

作为甲骨文香港的Principal Site Reliability Engineer,您将负责设计和架构高可靠性基础设施,参与容量规划、故障响应与自动化工具开发,并与软件开发团队协作确保服务可扩展性

该职位处于云基础设施的核心环节,要求深厚的SRE专业知识和领导能力

工作职责

关键职责:**

容量接入与管理:**
根据条款设计和架构基础设施/服务,以确保可靠性和功能性
预测基础设施需求并响应容量需求,确保系统有足够资源处理当前和未来工作负载,识别资源缺口
与软件开发团队合作开发基础设施,确保功能根据部署要求可靠且可扩展
主动识别原型设计机会并推动原型计划(例如,测试新应用或基础设施,协助接入),探索新方法
事件和服务生命周期管理:**
进行数据收集、分类、技术分析和转交时运用判断力,以维护和优化运营及基础设施可靠性
主动监控服务,保持对其性能的最新了解,并记录其状况
运用高级知识对指定服务执行事件响应、根本原因分析和/或维护(如软件安装、版本升级、安全更新、备份与恢复)
提供全面的健康和性能报告,并根据数据趋势采取适当行动
可能执行供应以支持基础设施、应用和服务
可能实验新方法并执行退役(如关闭服务器、从数据库移除数据)以删除不再需要的对象
自动化:**
识别并推荐自动化机会,评估潜在收益以提升运营效率
开发并实施设计、自动化工具或脚本,以提供解决方案、收集指标、监控、分析、缓解或修复基础设施内的缺陷/问题
对中等复杂度的自动化进行测试,确保其正确执行任务并产生预期结果
技术沟通与指导:**
编写发布说明和/或向客户及直接和相关团队全面传达服务的规模、容量、安全、性能属性和要求
主动预见并阐述基础设施、功能和工具变更的潜在影响,考虑其对团队运营的影响
作为团队成员在沟通内容和沟通方式方面的资源
故障排除与解决:**
为技术提供全面运营支持,作为Oracle服务中事件和中等复杂度问题的关键升级点
驱动并积极参与轮值班次以解决问题
执行跨多个服务的技术问题解决,应用高级调查和调试技术来实现SLO(服务目标)
根据报告方法记录事件并执行根本原因分析,捕获关键信息供分析和未来参考
执行事后分析流程以防止事件再次发生
创新与改进:**
进行先进实验并评估前沿工具和技术,以优化基础设施性能和可靠性,主动遵循安全标准
识别并寻求性能瓶颈和部署方面的改进机会,确保资源使用效率、速度和可扩展性
开发和维护站点可靠性趋势的高级知识,与高级团队成员、管理层及更广范围分享宝贵见解和信息,以促进创新的构建、测试、部署和运行服务
执行中等复杂度分析,提供清晰的生产数据以推动业务发展决策(如设计变更)
核心职责:**
规划与执行:**
管理和协调中等复杂度任务,监控时间线和交付物,确保按时完成并符合中等规模项目或计划的要求
有效委派、监控和优先处理多个项目的工作,提供技术监督,并根据资源或时间表变化调整计划
协作与伙伴关系:**
在组织内协同对齐期望,实现共同目标
利用对业务领导者、利益相关者和/或客户的理解,确保提议的解决方案满足其需求
通过积极寻求和倾听不同观点,支持包容性,确保他人感到被倾听和尊重
问题解决:**
通过分析广泛数据和/或信息,识别并解决中等复杂问题,按照标准实践确定解决方案
主动升级未解决或关键问题,提供全面评估并建议潜在解决方案
审查、贡献并记录问题解决策略
持续学习:**
追求学习机会以扩展知识和技能,紧跟最新行业趋势和最佳实践
主动寻求并利用持续反馈和培训来提升技能
辅导和指导初级团队成员,促进团队内外的持续学习和知识共享
持续改进:**
开发想法、推荐更新和/或协作实施流程改进,以提高跨团队流程、协议和工作流的效率和效果,并评估对关键利益相关者的影响
征求他人对替代方法改进想法的反馈
绩效与发展:**
通过参与候选人面试、评估候选人和提供招聘建议,为人才发展管道做出贡献

AI 洞察

优缺点分析

优点

  • 薪资福利有竞争力,公司提供灵活医疗、保险和退休计划,工作稳定
  • 香港国际化环境,团队多元化,有利于拓展全球视野
  • 职位级别高,对综合能力要求高,需要同时处理技术、沟通和项目协调
  • 甲骨文作为大公司,流程可能较繁琐,创新速度受一定限制

缺点 / 挑战

  • 加入全球领先的云与AI公司,参与大规模、高并发的基础设施建设,技术挑战性强
  • 作为Principal级别,拥有较高技术自主权和影响力,可推动创新和自动化变革
  • 需要承担on-call责任,可能面临非工作时间响应紧急事件的压力
  • 适合拥有多年SRE经验、热爱解决复杂技术问题、能接受高压力和高责任感的资深工程师

角色解读

  • 在甲骨文这样的大型云厂商,可深入接触超大规模基础设施,成为SRE领域的专家
  • 有机会晋升为首席工程师或技术总监,带领更大的基础设施团队,或转向架构师方向
  • 积累的云计算和可靠性经验可向其他云厂商或大型互联网公司流动,职业选择广泛
  • 设计并架构高可靠性的基础设施,确保系统满足业务需求和可用性目标
  • 预测容量需求,规划资源扩展,识别并解决资源瓶颈,保障服务稳定运行
  • 主导事件响应、根因分析和故障排查,参与on-call轮班,快速恢复服务并防止再次发生
  • 开发自动化工具和脚本,优化运维流程,提升效率和系统韧性
  • 精通基础设施架构设计、容量规划和性能调优,熟悉云计算平台(如Oracle Cloud或其他公有云)
  • 深厚的故障排查和事件响应能力,熟悉根因分析(RCA)和事后总结(post-mortem)流程
  • 熟练使用脚本语言(如Python、Bash)和自动化工具(如Terraform、Ansible、Prometheus、Grafana等)
  • 熟悉SRE实践、SLO/SLI体系,具备良好的沟通和跨团队协作能力

申请策略

  • 了解甲骨文的云产品(如OCI)和行业动态,面试中展示对业务和技术结合的理解
  • 准备一个完整的SRE案例,从问题发现到自动化解决,展现系统性思维
  • 突出大型分布式系统的架构设计和容量规划项目,量化成果(如提升可用性、降低成本)
  • 强调事故处理和根因分析经验,展示你如何领导事后总结并推动改进
  • 列出自动化工具的开发和落地案例,体现解决问题的能力
  • 若有跨团队协作或技术指导经验,务必体现,因为该职位需要指导他人
  • 熟悉SRE前沿工具和趋势,如服务网格、混沌工程、可观测性平台
  • 加深对云原生技术栈(如Kubernetes、Docker)和基础设施即代码(IaC)的理解

面试指南

  • 使用STAR法则:情境(Situation)、任务(Task)、行动(Action)、结果(Result),结构化描述项目或事件,突出你的思考和影响
  • 强调方法论:先分析问题根因,再设计解决方案,最后通过数据和复盘验证效果
  • 展示领导力和协作:提及如何协调多团队、如何指导初级成员,以及如何推动流程改进
  • 描述一次你处理的严重服务故障,你是如何响应和解决的?
  • 如何设计一个高可用架构以应对突发流量?请举例
  • 如何平衡自动化投入和运维收益?你如何评估自动化机会?
  • 如何向非技术团队传达技术风险或变更影响?
  • 你对SLO和错误预算的理解是什么?如何在工作中应用?

职位点评

69
综合评分

甲骨文香港高级SRE岗位,技术挑战大、薪资优厚、成长空间广阔,但需承担on-call压力。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
This role is best suited for senior SREs who prioritize technical expertise and career growth, and who are comfortable with on-call responsibilities and high-pressure situations.
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活40
使命价值80

薪资福利

70中等

The position offers competitive benefits and a high salary level in Hong Kong, though specific numbers are not disclosed. Overall compensation is likely strong for the senior SRE role.

薪资信号未披露(AI估算:60K-90K/月)
福利待遇flexible medical、life insurance、retirement options

成长发展

85较高

The role provides significant opportunities for technical growth and innovation, with exposure to cutting-edge tools and mentoring responsibilities. The career level is high, and continuous learning is emphasized.

技术前沿主流现代技术
技术栈SRE、Capacity Planning、Incident Response、Automation、Root Cause Analysis、SLO
成长机会Continuous Learning、Coaches and mentors junior team members
业务类型ambiguous

工作生活

40较低

The role requires on-call shifts and may involve high pressure during incidents, offering limited work-life balance. Work mode is not specified, but on-call is mandatory.

工作模式未明确
办公地点未明确
加班情况JD含高强度暗示词

使命价值

80较高

Oracle's mission to power industry innovations and life-saving care, combined with AI and cloud solutions impacting billions, gives the role a strong sense of purpose. The cloud industry is rapidly growing.

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号power everything from industry innovations to life-saving care、AI and cloud solutions that impact billions of lives
创新程度积极采用新技术
Watch Jobs