
海康威视
软件产品-高级运维工程师-杭州
软件产品-高级运维工程师-杭州
发布于 大约 14 小时前普通员工/个人贡献者
杭州市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
CI/CD
Rocketmq
Sre
云原生
AI 估算 · 20k–35k
杭州上市企业,高级运维岗位,云原生技术要求高,薪资有竞争力。
职位详情
关于这个职位
该职位主要负责海康威视云平台底层基础设施和业务集群的运维保障,包括Kubernetes、数据库、中间件等组件的日常运维、监控告警、故障处理、自动化建设及容量规划
需要具备扎实的Linux和云原生技术背景,并能推动运维标准和流程的落地
最低要求
本科及以上学历,计算机、软件工程、网络工程、信息安全等相关专业优先
年以上运维、SRE、云原生运维或基础架构运维经验,有中大型云平台、互联网平台、企业云平台或多业务集群运维经验者优先
熟悉 Linux 操作系统,具备扎实的系统管理、网络排障、性能分析、Shell/Python 脚本编写能力
熟悉 Kubernetes、Docker、容器网络、Ingress、Service、资源调度、滚动升级、故障排查和集群运维管理
熟悉至少一种主流 CI/CD工具和发布体系,如 Jenkins、Helm 等,理解灰度发布、蓝绿发布、回滚、服务预热等发布治理机制
熟悉主流数据库和中间件的运维管理,包括 MySQL、Redis、Kafka、RocketMQ、Elasticsearch 等,具备高可用、备份恢复、性能调优和故障处理经验
熟悉监控告警和可观测体系,具备 Prometheus、Grafana、ELK/EFK、SkyWalking、Zabbix 等一种或多种工具的实践经验
具备较强的故障分析和应急处理能力,能够独立完成线上问题定位、风险判断、止血恢复、根因分析和复盘改进
具备容量规划和资源治理经验,能够结合业务规模、流量模型、资源水位和系统瓶颈进行扩容评估和成本优化
具备良好的安全意识,熟悉账号权限、网络访问控制、漏洞修复、系统加固、证书管理、审计日志和数据备份等基础安全要求
具备较强的跨团队沟通能力和文档沉淀能力,能够推动标准、流程、工具和规范在多个云平台团队落地
工作职责
负责云平台底层基础设施的日常运维与稳定性保障,包括物理服务器、操作系统、网络、存储、Kubernetes 集群、容器运行环境等
负责云平台业务集群的统一运维管理,推动集群资源标准化、环境隔离、权限治理、资源配额、容量评估和运行规范建设
负责数据库、中间件及基础组件的运维保障,包括 MySQL、Redis、Kafka、RocketMQ、Elasticsearch、配置中心、注册中心、网关等组件的部署、监控、备份、巡检、扩容、故障处理和版本升级
参与云平台业务变更保障,参与建设和优化发布平台、灰度发布、滚动发布、蓝绿发布、服务预热、回滚机制、变更审批和发布风险控制体系
负责监控告警与可观测体系建设,完善基础设施、容器、应用、中间件、数据库、链路追踪、日志、指标、告警和大盘体系,提升故障发现、定位和恢复效率
负责重大故障的应急响应、根因分析和复盘改进,推动故障分级、应急预案、SOP、演练机制和稳定性治理闭环建设
负责云平台业务容量规划与资源治理,结合业务增长、租户规模、峰值流量、容器资源使用率和中间件负载,输出容量评估、扩容计划和资源优化方案
负责运维自动化和工具化建设,提升服务器初始化、集群交付、组件部署、巡检、备份、告警处理、故障自愈和批量变更的自动化水平
参与制定底层技术运维标准,包括环境规范、部署规范、命名规范、监控规范、备份规范、变更规范、安全基线和故障处理规范
AI 洞察
优缺点分析
优点
- 海康威视为行业龙头,平台大、业务稳定,能接触大规模云平台运维场景
- 技术栈涵盖Kubernetes、中间件、可观测性等云原生核心领域,技能积累价值高
- 职位涉及自动化、容量规划、故障处理等多方面,职业发展空间广阔
- 云平台规模大,对运维的标准化、自动化要求高,需要较强的文档和规范推动能力
- 需同时掌握数据库、中间件、容器、监控等多个技术栈,学习曲线陡峭
- 适合对云原生运维有浓厚兴趣、具备较强动手能力和故障排查能力、希望在大型企业平台深耕的运维工程师
缺点 / 挑战
- 涉及大量基础设施和组件维护,故障响应和应急处理压力较大
角色解读
- 技术深耕:向SRE专家、云原生架构师方向发展,深入钻研稳定性、性能调优和自动化运维
- 管理方向:可晋升为运维团队负责人或基础架构负责人,带领团队制定运维标准和规范
- 跨领域拓展:向安全运维、DevOps、云平台架构等方向转型
- 负责云平台底层基础设施(服务器、网络、存储、Kubernetes集群)的日常运维与稳定性保障
- 管理数据库、中间件(MySQL、Redis、Kafka等)的部署、监控、故障处理及版本升级
- 建设监控告警与可观测体系,提升故障发现、定位和恢复效率
- 推动运维自动化工具建设,提升服务器初始化、集群交付、组件部署等环节的自动化水平
- 精通Linux操作系统管理、网络排障及Shell/Python脚本编写
- 深入掌握Kubernetes、Docker容器技术及云原生生态
- 熟悉主流数据库(MySQL、Redis等)和中间件的运维管理
- 具备监控、日志、链路追踪等可观测性工具(Prometheus、Grafana、ELK等)的实践经验
申请策略
- 了解海康威视的云平台业务方向(如AI Cloud、物联平台),在面试中展示对行业场景的理解
- 准备一个完整的运维案例,从问题发现、定位、解决到复盘改进,体现系统性思维
- 突出Kubernetes集群运维经验,包括集群部署、资源管理、故障排查等具体案例
- 展示数据库和中间件的运维实践,如MySQL主从、Redis哨兵、Kafka调优等
- 强调自动化运维脚本或工具开发经验,如用Python/Shell实现巡检、备份、自愈等
- 列举参与过的大型故障处理或容量规划项目,体现应急能力和分析能力
- 若对Kubernetes运维不够深入,可学习CKA认证课程并搭建实验环境
- 补充Prometheus+Grafana监控体系实践,以及SkyWalking链路追踪基础
面试指南
- 对于故障类问题,使用STAR法则(情境、任务、行动、结果)结构化回答,突出方法论和工具
- 对于设计类问题,先明确目标(如降低MTTR),然后分步骤:采集指标、告警规则、告警通知、响应流程、持续优化
- 对于技术细节问题,先给出核心原理,再结合实践经验说明常见坑和优化技巧
- 请描述一次Kubernetes集群故障排查的经历,你是如何定位和解决的?
- MySQL主从延迟如何处理?请列出常见原因及解决方案
- 如何设计监控告警系统来减少故障响应时间?
- 谈谈你对灰度发布和蓝绿发布的理解,以及在实际运维中如何实施?
- 在容量规划中,你如何评估当前资源是否足够并给出扩容建议?
职位点评
71
综合评分
稳定大厂、前沿技术栈、薪资有竞争力,但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和职业发展的运维工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值60
薪资福利
75中等
薪资面议,但作为上市公司高级职位,薪资竞争力较强,福利完善。
薪资信号面议 (20K-35K/月)
成长发展
85较高
职位涉及前沿云原生技术栈,有明确的职责分级,但未提及晋升通道,成长空间中等偏上。
技术前沿前沿/新兴技术
技术栈Kubernetes、Docker、云原生、Prometheus、Grafana、CI/CD
业务类型ambiguous
工作生活
50较低
仅现场办公,杭州科技园,未提及弹性工作或WLB,加班情况不明。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
60中等
海康威视在安防和AI领域有社会影响,但岗位为内部基础设施运维,直接社会价值一般。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
海康威视 的其他在招职位
相似职位推荐
IT网络运维工程师(J15108)
闻泰科技 · 无锡市AI 估算 · 8k-15kSenior Enterprise Architect (Engineering) (d/f/m)
汉高 · Germany, Düsseldorf, North Rhine WestphaliaAI 估算 · 45k-65k数据中心解决方案架构师
伊顿中国 · 上海市AI 估算 · 25k-45k厂建自控工程师-I&C Engineer(J18147)
长鑫存储 · 合肥市AI 估算 · 20k-30kAI服务器运维工程师-AI Server Operation and Maintenance Engineer(J16534)
长鑫存储 · 合肥市AI 估算 · 25k-40k
Watch Jobs