
新紫光集团
智能化运维工程师8246
智能化运维工程师8246
发布于 大约 15 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Aiops
Clickhouse
Cmdb
Dell Poweredge
Go
Snmp
Zabbix
Hpe Proliant
华为Oceanstor
AI 估算 · 30k–50k
资深运维工程师,要求高且技能稀缺,上市巨头薪资有竞争力,预估月薪30k-50k。
职位详情
关于这个职位
该职位负责构建智能化运维体系,包括统一监控、CMDB、可视化大屏和AIOps落地
你将主导Prometheus、Grafana等工具部署,开发智能异常检测模型,并协调多团队推进标准化
适合有8年以上运维经验、精通服务器/存储硬件、CMDB和AIOps的资深工程师
最低要求
学历与经验:计算机科学、通信工程、电子信息等相关专业本科及以上学历
年以上运维开发或监控系统建设经验,其中3年以上专注于大型数据中心基础设施监控或智能化运维领域
服务器与存储品牌运维经验(必须项):服务器:精通主流x86服务器品牌硬件架构及运维,包括但不限于Dell PowerEdge、HPE ProLiant、Lenovo ThinkSystem、Inspur、Supermicro等,熟悉其带外管理系统(iDRAC、iLO、BMC)、RAID配置、故障诊断面板及固件升级方法
存储:熟悉主流存储设备品牌及运维,包括但不限于Dell EMC(Unity/PowerStore)、HPE Primera/3PAR、NetApp FAS/AFF、华为OceanStor、Pure Storage等,能够进行LUN/卷管理、性能分析、控制器/磁盘故障排查及容量规划
具备跨品牌硬件统一纳管经验,能制定兼容多品牌的监控采集模板与自动发现规则,实现硬件级指标的标准化暴露
CMDB领域:深刻理解CMDB架构与ITIL配置管理流程,有Atlas、iTop、NetBox或自研CMDB实战经验
精通数据模型设计、自动发现规则与API开放,熟悉网络、服务器、存储、机房设备的纳管技术
监控系统与看板:精通至少一种主流监控系统(如Prometheus+Thanos/VictoriaMetrics、Zabbix、Nightingale、商业产品如Datadog),具备10万+指标吞吐量系统的调优经验
熟练使用Grafana设计复杂看板,掌握PromQL/LogQL/SQL查询语言,有大屏可视化设计经验,具备前端(Vue/React)基础者优先
领域技术覆盖:网络监控:熟悉SNMP、Syslog、NetFlow/sFlow、Streaming Telemetry、NETCONF等,能监控路由器、交换机、防火墙、负载均衡器等全量网络设备
机房监控:掌握DCIM/BMS系统集成,熟悉动环监控(UPS、精密空调、温湿度、电力、漏水检测),Modbus/BACnet等工业协议经验优先
服务器监控:精通Linux/Windows系统监控,带外管理(IPMI、Redfish、各品牌带外接口),物理机、虚拟机(KVM/VMware)及容器化(Kubernetes)环境的指标与日志采集
存储监控:理解SAN(FC)、NAS、分布式存储、对象存储架构,可监控IOPS、吞吐量、时延、容量利用率、磁盘/控制器健康状态等关键指标,并具备不同品牌存储的差异化监控适配能力
AIOps与开发能力:具备真实的AIOps落地经验,熟悉异常检测、时序预测、告警聚合等常见算法,有使用PyTorch/TensorFlow或商业智能运维平台(如Splunk ITSI、Dynatrace)的经验
扎实的编程能力,精通Python或Go,能够独立开发监控采集器、告警插件与自动化脚本,有API集成开发经验
软技能:优秀的跨团队沟通与推动能力,能同时协调网络、系统、设施等多领域团队,达成监控标准共识
对运维数据治理有较深认知,善于用数据衡量运维质量
工作职责
统一监控体系建设:设计并落地覆盖网络、机房、服务器、存储的一体化监控架构,构建指标(Metrics)、日志(Logs)、链路(Traces)全栈可观测性平台
主导监控工具链选型与自研,推进Prometheus、Zabbix、Grafana等系统的规模化部署与高可用调优
CMDB规划与建设:负责CMDB配置管理数据库的整体规划、模型设计及常态化运营,确保IT资产与配置数据精准、实时、完整
建立跨领域数据自动发现与消费机制:打通网络设备(SNMP/Netconf)、服务器(IPMI/Redfish/iDRAC/iLO)、存储设备及机房动环的自动入库链路
将CMDB作为监控、告警、变更、自动化、成本分析等场景的统一数据底座,推动消费侧应用
运维看板与可视化大屏建设:构建面向不同角色(NOC值班、领域专家、管理者、决策者)的运维看板与指挥大屏,整合网络拓扑、机房动力环境、服务器性能、存储容量等多维数据
使用Grafana等工具,实现资源水位、健康度评分、SLA合规率、告警风暴趋势等核心指标可视化
探索3D机房可视化、数字孪生展示,提升数据中心基础设施的可视化运营能力
智能化运维(AIOps)落地:基于海量监控数据,开发并落地智能异常检测、趋势预测、告警收敛降噪、根因分析等算法模型,大幅降低告警噪音与平均发现时间(MTTD)
设计故障自愈策略,联动自动化平台实现网络链路切换、服务容灾、磁盘隔离等场景的闭环处置,缩短平均修复时间(MTTR)
告警管理与流程优化:制定多领域统一的告警分级、抑制、升级与通知策略,对接IT服务管理(ITSM)系统,实现告警到工单的自动流转
定期复盘告警有效性,持续推进告警治理,确保每一条告警都具有明确可操作的处置路径
硬件运维标准化与跨品牌管理:建立覆盖多品牌的服务器、存储设备运维标准,包括带外管理接入规范、固件/驱动版本基线、硬件故障诊断手册及备件更换流程
协同厂商技术支持和各领域运维工程师,完成设备巡检、健康检查、批量固件升级及生命周期管理,确保不同品牌设备运维的一致性
横向拉通与标准化:协同网络、系统、存储、数据中心设施团队,制定监控标准化规范(采集对象、指标口径、标签命名、阈值模板),保障多领域数据可融合、可关联
推动监控与运维数据的治理,建设运维数据湖/数仓,支撑多维分析与AIOps算法训练
优先资格
【加分项】
持有主流服务器/存储厂商认证(如Dell Technologies Certified、HPE ASE、NetApp NCDA、华为HCIP-Storage等)
持有CCIE、RHCA、AWS/GCP/Azure专业级架构师认证
参与过开源监控或运维项目(如OpenTelemetry、Nightingale、Grafana插件)贡献
熟悉运维数据仓库技术栈(ClickHouse、Kafka、Flink),有海量指标/日志处理经验
有基础架构即代码(IaC)和自动化编排(Ansible/Terraform)的实践经验,以及通过Redfish/Ansible模块批量管理多品牌服务器的实战能力
AI 洞察
优缺点分析
优点
- 接触业界前沿的AIOps技术栈,技术深度和广度都能得到极大提升
- 上市巨头平台稳定,项目资源充足,有机会主导大型数据中心运维转型
- 薪资水平高,且岗位稀缺性强,职业竞争力强
- 需要同时管理多品牌硬件和跨团队协调,沟通成本高
- 技术栈庞杂,需要持续学习各领域协议和工具
- 适合有深厚运维基础、热爱技术攻坚、愿意推动标准化和智能化转型的资深工程师
缺点 / 挑战
- 对运维稳定性要求极高,告警治理和故障自愈压力大
角色解读
- 可向运维架构师或AIOps专家方向发展,主导智能化运维体系的整体设计
- 也可横向拓展为基础设施SRE,负责稳定性、性能优化和成本控制
- 随着数据中台经验积累,可转型为大数据或平台架构师
- 设计和落地数据中心全栈可观测性平台,涵盖网络、服务器、存储和机房环境
- 规划并运营CMDB,打通多品牌硬件自动发现链路,作为运维数据底座
- 开发智能异常检测和告警收敛算法,实现故障自愈和自动化运维
- 构建面向不同角色的可视化大屏,整合多维运维数据辅助决策
- 精通Prometheus、Zabbix、Grafana等监控系统,具备大规模调度经验
- 深入理解CMDB架构和ITIL流程,掌握Atlas、iTop等工具实战
- 扎实的Python/Go编程能力,能独立开发监控采集器和自动化脚本
- 熟悉AIOps算法(异常检测、时序预测)和机器学习框架(PyTorch/TensorFlow)
申请策略
- 面试前整理一套完整的监控架构设计方案,涵盖指标、日志、链路三大支柱
- 准备一个AIOps项目案例,详细说明算法选型、模型效果和业务价值
- 突出在大型数据中心监控系统建设中的主导项目,量化指标(如管理节点数、告警收敛率)
- 重点描述CMDB规划与实施经验,包括数据模型设计和自动发现链路
- 展示AIOps落地案例,如异常检测算法效果或故障自愈闭环率
- 提前熟悉Dell、HPE、华为等主流服务器/存储的硬件特性及带外管理协议
- 强化Python/Go开发能力,可练习编写Prometheus Exporter或Zabbix插件
- 了解ClickHouse、Kafka等数据管道技术,为面试中的数据处理问题做准备
面试指南
- 基于STAR法则描述项目背景、目标、行动和结果,突出量化指标
- 对比不同技术方案的优缺点,展示决策依据和trade-off思考
- 结合实际案例说明AIOps算法的落地过程,包括数据预处理、模型选择、效果评估
- 请描述你主导设计的大型监控系统架构,包括技术选型和规模
- 如何在多品牌服务器环境中实现统一的硬件监控?
- 解释CMDB的数据模型设计原则,并举例自动发现规则
- 你如何实现告警收敛和根因分析?请给出具体算法思路
- 如何评估监控系统的有效性和运维数据质量?
职位点评
68
综合评分
上市巨头,前沿AIOps技术栈,薪资优厚,但工作强度可能较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和成长机会、能接受现场办公的资深运维工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值60
薪资福利
70中等
薪资预估在市场高位,上市巨头福利稳定,但JD未明确薪资福利,补偿性动机满足程度中等偏上。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
职位涉及AIOps前沿技术、多品牌硬件和全栈可观测性,技术成长空间大,满足发展性动机。
技术前沿前沿/新兴技术
技术栈Prometheus、AIOps、Kubernetes、Redfish、ClickHouse、Flask
业务类型cost_center
工作生活
40较低
仅现场办公,未提弹性工作或WLB,上市巨头可能加班,生活化动机满足程度低。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
运维岗位对保障系统稳定性有直接贡献,但行业成熟,意义感中等。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
新紫光集团 的其他在招职位
相似职位推荐
Watch Jobs