Razer logo
雷蛇
Site Reliability Engineer

Site Reliability Engineer

发布于 大约 13 小时前

普通员工/个人贡献者

成都市
中级经验
全职员工
仅现场办公
本科
信息技术与基础设施
CI/CD
Cloudformation
Monitoring
Sre

AI 估算 · 15k–25k

基于成都市场水平,3年SRE经验且掌握AWS和IaC技能,薪资具有竞争力。

职位详情

关于这个职位

该职位主要负责设计、开发和维护云基础设施,确保系统的高可用性和可扩展性

你将使用 Terraform、AWS 等工具实现基础设施即代码,并参与监控、故障处理和架构优化
适合有一定经验的 SRE 或 DevOps 工程师,希望在游戏行业大型平台中提升技术深度

最低要求

计算机科学、软件工程、信息技术或相关领域的学士学位

至少3年SRE、DevOps、云基础设施或系统管理经验
精通AWS云服务,包括计算与容器化(EC2, Lambda, ECS, EKS, Auto Scaling)、网络(负载均衡器、VPC、Route 53、安全组、防火墙)、存储与数据库(RDS, ElastiCache, Athena, S3)、消息(SQS, SES)
深刻理解基础设施即代码(IaC)工具,如Terraform和CloudFormation
精通至少一种编程/脚本语言:Python, Node.js, Bash, Ruby或相关
具备Linux、Windows和容器化环境的操作和故障排除经验
对分布式系统、云网络(路由器、交换机)、防火墙、DNS和HTTP/TLS有深入理解
有实施监控和告警系统以及参与事件管理流程的经验
有零停机部署、蓝绿部署或金丝雀部署经验
熟悉AWS资源的成本优化和合理调整
接触过多区域、多账户的AWS架构
了解API网关或边缘网络(如Akamai, CloudFront)

工作职责

使用Terraform或CloudFormation等工具设计、开发和维护基础设施即代码(IaC),利用AI编码助手加速开发并强化最佳实践

在AWS上(如EC2, ECS, RDS, S3, Lambda, ElastiCache, SQS, SES, Auto Scaling, 负载均衡器)实施和运营可靠、可扩展的云基础设施
主导和参与架构评审,关注基础设施的可靠性、可扩展性、安全性、性能和成本效率
开发和维护健壮的监控、告警和日志解决方案(如CloudWatch, Prometheus, Grafana, ELK),结合AIOps工具进行预测性告警、异常检测并减少告警疲劳
执行事件管理、事后复盘、根因分析,并实施持续改进策略,利用AI驱动分析在中断期间快速汇总日志和跟踪
与软件工程团队合作改进CI/CD管道、部署自动化、发布管理以及机器学习模型的部署周期
使用脚本(Python, Bash, Node.js或Ruby)和AI驱动的工作流自动化,自动化基础设施操作,减少人工劳作并提高可靠性
维护和排查涉及Web服务器、数据库、防火墙、DNS、负载均衡器和网络的环境
确保系统符合安全标准,包括补丁、加固、安全访问策略以及AI训练数据相关的数据隐私约束
提供on-call支持,参与事件轮值
监控和维护服务级别目标(SLO)、SLA和错误预算,确保达到可靠性目标
为分配的事件和工单提供支持和解决方案

AI 洞察

优缺点分析

优点

  • 职位涉及AWS全栈和多区域架构,能深度接触前沿云原生技术
  • 团队跨5大洲,可提升全球化协作和沟通能力
  • 需要参与on-call轮值,可能面临非工作时段的紧急事件处理
  • 要求同时掌握多种技术栈(IaC、容器、监控、脚本等),学习曲线较陡
  • 适合有2-4年运维或DevOps经验,热爱云原生技术、愿意在快节奏环境中持续学习的工程师

缺点 / 挑战

  • 雷蛇为全球知名游戏品牌,平台大,技术挑战丰富,有利于职业背书
  • 游戏行业对系统稳定性和性能要求极高,压力较大

角色解读

  • 向高级SRE或架构师方向发展,深入云原生和分布式系统
  • 可转型为平台工程或DevOps专家,主导大型基础设施项目
  • 在游戏行业积累高并发、低延迟系统的运维经验,拓宽职业视野
  • 负责设计和维护AWS云基础设施,使用Terraform等工具实现基础设施即代码
  • 搭建监控、告警和日志系统,确保服务可靠性和快速故障恢复
  • 参与事件响应和事后复盘,持续优化系统架构和运维流程
  • 精通AWS云服务(EC2、ECS、RDS等)和相关网络、存储组件
  • 熟练掌握Terraform或CloudFormation进行基础设施自动化
  • 至少掌握一种编程语言(Python、Bash等),能够编写自动化脚本
  • 具备Linux系统管理和容器化(Docker/K8s)经验

申请策略

  • 了解雷蛇的游戏生态和产品线,在面试中表达对游戏行业的热情
  • 准备一个完整的SRE案例,包括问题背景、解决方案和量化结果
  • 突出AWS相关项目经验,尤其是使用Terraform管理基础设施的案例
  • 详细描述曾参与的高可用架构设计或故障排除经历
  • 列出掌握的编程语言和自动化脚本的具体应用场景
  • 如果有跨团队协作或on-call经验,务必提及
  • 若缺乏AWS经验,可考取AWS助理架构师或DevOps认证
  • 巩固IaC工具(Terraform)的实际动手能力,可参与开源项目或搭建个人实验环境

面试指南

  • STAR法则(情境、任务、行动、结果):先描述背景,再说明你的角色和具体操作,最后强调成果
  • 技术问题要结合理论和实践,例如先阐述原理,再举例说明你如何应用
  • 对于故障处理问题,展示系统性思维:监控发现→定位→缓解→根因→长期改进
  • 请描述你使用Terraform管理AWS基础设施的完整流程
  • 如何处理一个生产环境的高危告警?你的应急响应步骤是什么?
  • 蓝绿部署和金丝雀部署的区别是什么?你在实际项目中如何选择?
  • 如何设计一个高可用的多云架构?
  • 当系统出现性能瓶颈时,你如何定位并优化?

职位点评

69
综合评分

大型游戏公司SRE岗,前沿云原生技术栈,需要on-call,薪资未明确但发展前景好。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合注重技术成长和职业发展的求职者,若看重WLB可能需谨慎考虑。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值65

薪资福利

70中等

职位薪资未明确披露,但基于雷蛇的规模和行业,薪资应处于市场水准,且可能包含游戏行业特有福利。

薪资信号未披露(AI估算:15K-25K/月)

成长发展

85较高

职位涉及前沿云原生技术和AIOps,成长空间大,但JD未明确提及晋升通道或培训。

技术前沿前沿/新兴技术
技术栈AWS、Terraform、Docker、Kubernetes、AIOps、Prometheus、Grafana
业务类型profit_center

工作生活

50较低

职位需要on-call支持,工作地点在成都,JD未提及弹性工作或远程办公,WLB一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

65中等

游戏行业属于稳定成熟行业,雷蛇品牌有一定社会影响力,但JD未强调使命感。

行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs