CXMT logo
长鑫存储
观测平台运维运营开发工程师-Observability Platform Ops & Dev Engineer(J20083)

观测平台运维运营开发工程师-Observability Platform Ops & Dev Engineer(J20083)

发布于 大约 15 小时前

普通员工/个人贡献者

合肥市
高级经验
全职员工
仅现场办公
本科
DevOps/SRE
Elk
Go
可观测性
监控
自动化运维
蓝鲸

AI 估算 · 20k–35k

合肥半导体行业,5年经验高级岗位,薪资有竞争力,兼顾技术深度与行业红利。

职位详情

关于这个职位

该职位负责长鑫存储观测平台的稳定性保障与自动化运维工具开发,需搭建全链路可观测体系,包括监控、日志和Tracing,并推动平台功能迭代

适合有5年以上运维开发经验、精通Python/Go、熟悉Prometheus等工具的技术专家

最低要求

教育背景与专业知识:本科及以上学历,计算机、软件工程、通信工程或相关理工类专业

专业技能与资格:精通Python、Shell、Go中至少一种编程语言,具备自动化工具开发能力
熟悉Prometheus、Grafana、ELK、蓝鲸等可观测工具的使用与维护
行业与专业经验:5年以上监控或运维平台运营经验,具备大规模监控体系建设经验
项目/任务成果:主导或深度参与过至少一个大型可观测性平台或自动化运维项目的设计、开发与落地
其他要求:具有较强的数据分析能力,能从监控数据中定位问题并推动闭环
具有优秀的跨部门沟通与协作能力,能在多团队环境中高效推动任务

工作职责

平台稳定性保障:主导监控平台的日常运营与稳定性建设,制定并执行平台巡检与应急预案,确保系统高可用

全链路可观测体系搭建:搭建并维护覆盖监控、日志、Tracing等能力的可观测体系,设计异常及时发现与预警机制,提升故障响应效率
自动化运维工具开发:开发覆盖告警配置、故障自愈、场景巡检等自动化脚本与工具,推动运维效率持续优化
平台功能迭代与优化:结合业务需求,设计并推动监控平台的功能迭代,提升平台在业务场景中的适配性与使用体验
运营规范与最佳实践输出:编写并持续刷新平台运营文档与最佳实践手册,推动团队运维能力标准化

AI 洞察

优缺点分析

优点

  • 长鑫存储是国内半导体存储龙头,平台稳定,技术投入大
  • 可观测性与自动化运维是当前IT基础设施热点,技术积累价值高
  • 岗位职责全面,涵盖监控、自动化、平台开发,技能成长空间大
  • 需要同时掌握多种工具和编程语言,学习曲线较陡
  • 适合有多年运维开发经验、对可观测性技术有热情、喜欢解决复杂系统问题的技术专家

缺点 / 挑战

  • 半导体行业对系统稳定性要求极高,运维压力较大
  • 跨部门协作频繁,沟通成本较高

角色解读

  • 可在运维开发方向深耕,成为可观测性领域专家或架构师
  • 可转向SRE或平台工程方向,负责更大规模的系统可靠性
  • 也可向技术管理方向发展,带领运维团队
  • 负责监控平台的日常运营与稳定性保障,制定应急预案和巡检计划,确保系统高可用
  • 搭建全链路可观测体系,整合监控、日志和Tracing能力,设计异常预警机制提升故障响应效率
  • 开发自动化运维工具,如告警配置、故障自愈脚本,持续优化运维效率
  • 结合业务需求推动平台功能迭代,编写运营文档和最佳实践手册,促进团队标准化
  • 精通Python、Shell或Go中至少一种,具备自动化工具开发能力
  • 熟悉Prometheus、Grafana、ELK、蓝鲸等可观测工具的使用与维护
  • 年以上监控或运维平台运营经验,有大规模监控体系建设经验
  • 较强的数据分析能力和跨部门沟通协作能力

申请策略

  • 了解长鑫存储的业务和产品线,展现你对半导体行业的兴趣
  • 面试时准备一个你主导的运维项目案例,从问题背景到解决方案完整阐述
  • 突出参与过的大型可观测性平台或自动化运维项目,详细描述你的角色和贡献
  • 强调对Prometheus、Grafana等工具的深入使用和调优经验
  • 展示你使用Python/Go开发自动化脚本或工具的具体案例
  • 如有跨部门协作或故障应急处理经验,务必提及
  • 可提前复习或学习蓝鲸平台的操作和最佳实践
  • 了解半导体行业对监控的特定需求(如环境参数监控)

面试指南

  • STAR法则:情境、任务、行动、结果,清晰展示你的项目经验
  • 技术问题回答时先讲原理再谈实践,体现深度
  • 故障处理类问题展示系统化思维:监控发现→定位根因→止血→修复→复盘→改进
  • 请描述你主导过的一个大型监控系统建设过程,包括架构设计和技术选型
  • 如何处理Prometheus的高基数问题?有哪些优化经验?
  • 当线上出现告警风暴时,你的排查和处理流程是什么?
  • 你如何平衡告警的灵敏度和误报率?
  • 请举例说明你通过自动化工具解决的一个具体运维痛点

职位点评

69
综合评分

合肥半导体大厂,主流可观测技术栈,技术成长性好,但现场办公、加班情况不明。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合看重技术成长和职业稳定性,对WLB要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值65

薪资福利

70中等

薪资在合肥具备竞争力,但JD未明确福利,稳定性较好。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

85较高

技术栈前沿(Prometheus、Grafana等主流可观测工具),项目经验积累价值高。

技术前沿主流现代技术
技术栈Python、Go、Prometheus、Grafana、ELK、蓝鲸
业务类型cost_center

工作生活

50较低

仅现场办公,未提及弹性工作或WLB,半导体行业通常强度较大。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

65中等

半导体行业稳定且重要,但岗位偏向内部支撑,社会直接影响力有限。

行业发展稳定成熟行业
社会影响中性/一般
创新程度稳健跟随主流
Watch Jobs