GLM logo
智谱
MaaS-SRE/DBA

MaaS-SRE/DBA

发布于 4 个月前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
本科
系统与安全工程
自动化运维
高可用架构
GO
SRE

AI 估算 · 30k–50k

岗位要求高并发保障与架构设计能力,技术栈主流且深度要求高,北京互联网大厂SRE/DBA岗位市场竞争力强。

职位详情

关于这个职位

这是一个专注于保障MaaS平台数据库稳定性的SRE/DBA岗位

你将负责MySQL、Redis等核心存储组件的稳定性保障、架构治理与深度性能调优,并基于SRE理念开发自动化运维平台
核心目标是确保平台在高并发场景下的高可用性,并参与数据库架构的演进与优化

最低要求

学历与经验: 本科及以上学历,计算机相关专业

年以上大规模互联网数据库管理(DBA)或 SRE 经验,有高并发、大流量系统保障经验者极佳
数据库精通: 精通 MySQL 原理(InnoDB 引擎、事务锁机制、索引优化、主从复制),精通 Redis(集群模式、缓存一致性、热 Key/大 Key 处理)
熟悉其高可用架构(MHA/Orchestrator/Sentinel/Cluster)
SRE 与编程能力: 具备良好的编码能力,熟练掌握 Go/Python/Java 中至少一种语言(不仅仅是 Shell),有数据库中间件开发或自动化运维平台开发经验
系统与网络: 深入理解 Linux 操作系统原理(IO、内存管理、网络协议栈),具备极强的线上故障排查能力(熟练使用 perf, tcpdump, strace 等工具)
云原生与架构: 熟悉主流公有云(腾讯云/阿里云/AWS)数据库产品特性
了解 Kubernetes (K8s) 生态及数据库容器化技术者优先
软素质: 具备极强的责任心和抗压能力(能接受 On-call),良好的沟通协作能力
具备“数据安全红线”意识

工作职责

稳定性保障(核心):负责MySQL、Redis等核心存储组件的稳定性,建设全方位的监控告警体系(Prometheus/Grafana),实现故障的早发现、快止损,保障MaaS平台在高并发场景下的99.99%可用性

架构治理与演进: 主导数据库架构升级,包括读写分离、冷热分离、分库分表及异地多活(双活)容灾体系的建设
深度调优与质量管控: 建立标准化的SQL审核与发布流程,负责慢 SQL 治理、大表治理及数据库参数深度调优,解决数据库性能瓶颈
自动化平台建设: 基于SRE理念,开发数据库自动化运维平台(Python/Go),实现备份恢复、高可用切换、自动扩缩容及账号权限管理的自动化
应急响应与预案: 负责突发故障(如宕机、带宽拥塞)的应急响应,制定并定期演练标准化恢复预案(SOP),降低故障平均恢复时间(MTTR)
容量规划与成本管理: 结合业务增长模型进行容量预测与压测,优化资源利用率,制定降本增效策略

优先资格

有TiDB等分布式数据库(NewSQL)大规模生产环境落地经验

参与过跨地域双活/多活数据库架构设计与实施

AI 洞察

优缺点分析

优点

  • 技术栈主流且深入:涉及MySQL/Redis深度调优、云原生、自动化平台开发,技能积累价值高
  • 平台与业务重要性高:保障MaaS平台稳定性,直接支撑核心业务,工作成果影响力大
  • 职业发展清晰:SRE/DBA是互联网企业的关键岗位,技术纵深和横向发展路径明确
  • 市场需求旺盛:具备高并发系统保障经验的数据库和SRE人才在就业市场非常抢手
  • 技术复杂度高:需要同时精通数据库原理、系统、网络、编程和云原生技术,学习曲线陡峭
  • 需要持续学习:技术迭代快,需不断跟进新的数据库技术、云服务和运维理念
  • 适合具备扎实数据库和系统基础,追求技术深度,责任心强且能承受高压,希望在核心业务平台从事稳定性保障工作的资深工程师

缺点 / 挑战

  • 工作压力与责任大:需保障99.99%可用性,接受On-call,应对突发故障,对责任心和抗压能力要求极高

角色解读

  • 技术纵深发展:可成为数据库架构专家或SRE领域专家,主导更复杂的分布式系统稳定性体系建设
  • 横向扩展:向云原生、运维开发(DevOps)或基础架构方向拓展,掌握更全面的技术栈
  • 管理路径:积累足够经验后,可转向技术管理岗位,带领团队负责更大范围的系统稳定性工作
  • 负责MaaS平台核心数据库(MySQL/Redis)的稳定性保障,建设监控告警体系,确保99.99%的高可用性
  • 主导数据库架构的治理与演进,包括分库分表、读写分离、异地多活等复杂架构的设计与实施
  • 进行数据库深度性能调优,治理慢SQL、大表,并建立标准化的SQL审核与发布流程
  • 基于SRE理念,使用Python/Go开发自动化运维平台,实现备份、切换、扩缩容等操作的自动化
  • 精通MySQL与Redis的核心原理、高可用架构及性能调优,具备大规模生产环境运维经验
  • 熟练掌握至少一门编程语言(Go/Python/Java),具备开发自动化运维平台或中间件的能力
  • 深入理解Linux系统与网络原理,能熟练使用perf、tcpdump等工具进行线上故障排查
  • 熟悉主流公有云数据库服务及Kubernetes生态,了解数据库容器化技术

申请策略

  • 深入了解智谱公司的MaaS业务和其技术挑战,在面试中展现你对业务稳定性的理解
  • 强调你的“数据安全红线”意识和严谨的工作作风,这与岗位的软素质要求高度契合
  • 重点突出大规模、高并发生产环境的数据库(MySQL/Redis)稳定性保障和性能优化经验
  • 详细描述主导或深度参与的数据库架构升级项目,如分库分表、异地多活等
  • 展示使用Python/Go等语言开发自动化工具或运维平台的具体项目和成果
  • 列举通过监控、排查工具(如Prometheus, perf)成功定位并解决复杂线上故障的案例
  • 若对TiDB等NewSQL不熟,可提前了解其原理和适用场景,以应对加分项
  • 深化对Kubernetes及云原生数据库运维(如Operator模式)的理解和实践

面试指南

  • 使用STAR法则(情境-任务-行动-结果)结构化地回答项目或故障处理问题,突出你的技术决策和最终成效
  • 对于架构设计问题,从需求分析、方案选型、实施细节、风险控制到效果验证进行系统性阐述
  • 在回答中融入你对SRE理念(如Error Budget、自动化、消除琐事)的理解和实践
  • 请描述一次你处理过的最复杂的数据库故障(如宕机、性能雪崩)的排查和解决过程
  • 你是如何设计和实施一个数据库高可用或容灾方案(如MHA、双活)的?遇到过什么挑战?
  • 请举例说明你对一个慢SQL或大表进行治理的具体方法和优化效果
  • 你如何设计一个数据库自动化运维平台?请谈谈关键模块(如备份、切换)的设计思路
  • 如何结合业务模型进行数据库容量规划?请分享你的方法和经验

职位点评

76
综合评分

技术成长导向的核心平台SRE/DBA岗,技能栈深且前沿,北京现场办公,工作强度预期不低。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合那些将技术成长和职业发展置于首位,愿意为学习前沿技术和保障核心系统稳定性付出努力,对薪资有合理期待且能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值75

薪资福利

80较高

薪资预计具备市场竞争力,但JD未披露具体数字和福利,存在不确定性;岗位稳定性和技术价值是主要补偿点。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

技术栈前沿且全面(云原生、自动化、分布式数据库),直接参与核心平台架构,技能成长和职业发展空间巨大。

技术前沿主流现代技术
技术栈MySQL、Redis、Prometheus、Grafana、Python、Go、Kubernetes、AWS、TiDB
业务类型cost_center

工作生活

50较低

工作地点明确为北京,需现场办公。JD要求“抗压能力”和“接受On-call”,暗示工作强度可能较高,WLB相关信号未提及。

工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词

使命价值

75中等

保障AI MaaS平台稳定性,支撑前沿AI业务发展,具备一定的技术使命感和行业前景。但社会直接影响力相对间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs