Boke City logo
波克城市
资深云原生基础设施工程师(Kubernetes/云网络方向)

资深云原生基础设施工程师(Kubernetes/云网络方向)

发布于 大约 7 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
DevOps/SRE
Ack
Calico
Cilium
Cni
Eks
Tke
Vpc

AI 估算 · 30k–50k

资深云原生岗位,Kubernetes和云网络方向稀缺,上海游戏公司薪资有竞争力,综合评估中位数40k。

职位详情

关于这个职位

该职位负责公司云原生基础设施的架构治理与生产运维,重点保障多云 Kubernetes 集群及云网络(VPC、CNI、负载均衡等)的稳定性与性能

你将深入处理跨节点、跨可用区的复杂网络与存储问题,并参与游戏业务重大活动保障和应急响应
适合具备 5 年以上 Kubernetes 生产经验、对云网络有深入理解的技术专家

最低要求

全日制本科及以上学历,计算机相关专业,5 年及以上运维、SRE、平台工程或云原生基础设施经验,具备大型互联网、游戏或高并发业务生产经验

具备扎实的 Linux 和 TCP/IP 基础,能够独立分析生产环境中的网络、存储、性能及稳定性问题
具备完整的 Kubernetes 生产实践,熟悉集群运维、资源调度、服务发布、滚动升级、容量规划、故障恢复和性能优化
深入理解 Kubernetes 网络体系,能够讲清并排查 Pod、Service、kube-proxy或eBPF、Ingress/Gateway、CNI、NetworkPolicy与云 LB 之间的完整流量链路
熟悉 Cilium、Calico、Kube-OVN或云厂商 CNI 中至少一种
熟悉公有云网络,具备 VPC、子网、路由、安全组/NACL、ENI、负载均衡、对等连接等实际经验
能够从 Kubernetes 配置追踪至云平台控制台或 API 完成问题定位
熟悉 Kubernetes 存储体系,理解 PV/PVC、StorageClass、动态供给、扩容、快照及备份机制,具备云盘或文件存储 CSI 的生产实践和故障处理经验
具备至少两类 Kubernetes 环境的生产经验,其中至少一类为 ACK、TKE、EKS或GKE等托管 Kubernetes
能够独立承担相关环境的运维和优化
具备自动化与工程化能力,熟悉 Shell、Python或Go中的至少一种,有平台治理、运维自动化或基础设施标准化项目经验
责任意识和风险意识良好,能够参与游戏业务值班、应急响应及重大活动保障

工作职责

负责公司云原生基础设施的架构治理、生产运维与稳定性保障,覆盖多云托管 Kubernetes 集群及相关网络、存储、调度、发布和故障恢复能力

深入负责 Kubernetes 数据面与公有云基础设施,重点建设和治理 CNI、CSI、VPC、负载均衡、DNS、路由、安全组、ENI、NetworkPolicy等能力,解决跨节点、跨可用区及多云环境中的复杂网络与存储问题
逐步承接业务运维侧的 VPC 网络职责,梳理从公网或内网入口、云 LB、VPC、节点到 Service、CNI及Pod的完整流量路径,建立自主排障和稳定性保障能力
负责 ACK、TKE、EKS、GKE 等多云托管 Kubernetes 环境的运维、治理与优化,推动集群基线、容量管理、弹性扩缩容、发布回滚和资源治理标准化
参与游戏业务的部署交付、线上保障和重大活动保障,承担必要的值班及应急响应,在复杂故障中负责核心定位与处置,推动问题复盘和闭环整改
与平台工程、研发、安全等团队协作,完善监控、告警、日志、Event和链路追踪等排障闭环
推动多集群、安全治理及云原生能力的工程化落地
沉淀云原生基础设施相关文档、SOP、排障手册和最佳实践,提升团队对云网络、容器网络及存储体系的接管能力

优先资格

eBPF、Cilium、Hubble或容器网络性能优化经验

多集群管理、跨集群服务发现或跨地域部署经验
NetworkPolicy、零信任或与安全团队协同治理经验
AWS EKS、海外业务或游戏行业经验
Service Mesh、Operator、Admission Webhook、GitOps实践
CNCF 项目贡献经历
AI/AI Agent在智能运维、故障分析或平台提效方面的实践

AI 洞察

优缺点分析

优点

  • 接触多云环境(ACK、TKE、EKS、GKE 等),技术栈前沿,涵盖 eBPF、Cilium 等新技术,个人技术成长快
  • 公司大型、业务稳定,无需融资,福利待遇有一定保障
  • 岗位涉及完整流量链路和复杂网络问题,能积累稀缺的云网络排障经验,职业竞争力强
  • 涉及多云平台,技术复杂度高,需要持续学习新知识,对学习能力要求高
  • 游戏行业活动期间可能高强度保障,需要做好心理准备

缺点 / 挑战

  • 需要承担值班和应急响应,可能面临非工作时间的突发故障处理,工作强度有一定压力
  • 适合对云原生基础设施有浓厚兴趣、具备 5 年以上 Kubernetes 生产经验、能承受一定值班压力、追求技术深度的工程师

角色解读

  • 从基础设施工程师向云原生架构师或 SRE 专家发展,深化 Kubernetes 和云网络领域的专业技能
  • 可向平台工程或云原生研发方向转型,参与内部平台和工具的开发
  • 在游戏行业积累大规模高并发业务的基础设施保障经验,未来可跨行业拓展
  • 负责多云 Kubernetes 集群的架构治理与生产运维,包括集群的部署、升级、容量管理和故障恢复
  • 深入云网络领域,处理 CNI、VPC、负载均衡、DNS 等网络组件的配置和问题排查,保障跨节点、跨可用区网络稳定性
  • 参与游戏业务重大活动保障,承担值班和应急响应,在复杂故障中定位核心问题并推动复盘整改
  • 推动基础设施标准化和自动化,沉淀文档、SOP 和最佳实践,提升团队整体排障能力
  • 扎实的 Linux 和 TCP/IP 基础,能独立分析生产环境的网络、存储、性能问题
  • 熟练掌握 Kubernetes 生产实践,包括集群运维、资源调度、服务发布、容量规划和故障恢复
  • 深入理解 CNI、NetworkPolicy、Ingress/Gateway 等容器网络组件,熟悉 Cilium 或 Calico
  • 具备公有云网络知识(VPC、安全组、ENI、负载均衡),能结合云控制台和 API 定位问题
  • 掌握 Shell、Python 或 Go 至少一种语言,有自动化和平台工程经验

申请策略

  • 提前了解波克城市的游戏业务和云原生技术栈,在面试中结合业务场景提出优化思路
  • 准备 1-2 个详细的故障排查故事,体现从流量入口到 Pod 的完整排障思路
  • 突出大型互联网或游戏行业的 Kubernetes 生产运维经验,特别是多云管理经历
  • 强调云网络技能,详细描述处理过的 VPC、CNI、负载均衡等实际问题
  • 展示自动化项目成果,如用 Python/Go 开发的运维工具、平台治理方案
  • 如有 Cilium、eBPF 或 Service Mesh 经验,务必提及
  • 熟悉主流托管 Kubernetes 服务(ACK、EKS 等)的控制台和 API,了解其差异
  • 深入学习 eBPF 和 Cilium 原理,动手实验网络策略和可观测性

面试指南

  • 对于技术问题,采用'场景-分析-方案-复盘'的结构,先说明背景,再展示排查思路和定位过程,最后总结改进措施
  • 对于设计问题,从需求出发,考虑高可用、可扩展、安全性,并比较不同方案的优劣
  • 对于经验问题,突出个人角色和产出,量化结果,体现思考深度
  • 请描述一次你处理过的 Kubernetes 网络故障,从入口流量到 Pod 的链路如何排查?
  • 如何设计一个多集群的容器网络方案?考虑跨地域和跨云场景
  • Cilium 和 Calico 在数据路径上有何区别?如何选择?
  • 在业务大促或重大活动前,你会如何做容量规划和稳定性保障?
  • 你如何实现 Kubernetes 集群的自动化运维和治理?

职位点评

69
综合评分

大型游戏公司云原生基础设施岗位,技术前沿成长空间大,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合重视技术成长、热爱云原生挑战、能适应值班节奏的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展80
工作生活55
使命价值65

薪资福利

70中等

该公司为大型游戏企业,未明确薪资福利,但基于行业和岗位推测薪资处于市场水准,稳定性较好。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

80较高

岗位涉及云原生前沿技术(eBPF、Cilium、多集群等),技术挑战高,成长空间大,但 JD 未明确晋升机制。

技术前沿前沿/新兴技术
技术栈Kubernetes、CNI、VPC、Cilium、eBPF、CSI、多集群
业务类型cost_center

工作生活

55较低

默认现场办公,需承担值班和应急响应,可能影响工作生活平衡,JD 未提供弹性办公信息。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

游戏行业稳定,技术具有创新性,但社会价值中性,使命感一般。

行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs