
蚂蚁集团
蚂蚁集团-高级DBA/存储运维工程师-成都
蚂蚁集团-高级DBA/存储运维工程师-成都
发布于 大约 8 小时前普通员工/个人贡献者
成都市
高级经验
全职员工
仅现场办公
本科
数据库管理
Ai-Agent
Lindorm
Oceanbase
Rag
云原生
分布式存储
容灾
高可用
AI 估算 · 25k–45k
高级DBA岗位,蚂蚁大厂溢价,成都薪资略低于一线,综合估算月薪2.5-4.5万,15薪。
职位详情
关于这个职位
该职位负责蚂蚁集团分布式存储系统(HBase、Lindorm、OceanBase等)的运维与稳定性建设,包括部署监控、容灾设计、性能调优及故障应急
同时参与智能化运维体系建设,利用AI-Agent、RAG等技术实现故障自动诊断与自愈
适合具备大规模分布式存储运维经验、抗压能力强且追求前沿技术的工程师
最低要求
a. 三年以上大规模分布式存储(HBase、MySQL、OceanBase)等运维经验,熟悉底层架构原理
b. 精通Linux系统,熟练运用各种监控工具如Grafana、Prometheus等监控工具,具备全链路的问题定位能力
c. 对运维体系化建设有方法论,能够独立主导复杂问题攻关
d. 具备强抗压能力,对生产环境故障有敬畏心,追求极致稳定性
e. 良好的技术文档习惯,擅长跨团队协作
f. 计算机相关专业本科机以上学历
工作职责
系统运维与稳定性体系建设
a. 负责HBase/Lindorm、OceanBase等分布式数据库/存储系统的部署、监控、高可用设计以及故障应急,保障99.999%+稳定性SLA
b. 主导存储集群性能调优、容灾方案设计(如多机房容灾、数据备份恢复、全球多活、全球合规存储等),提升系统的健壮性
c. 深入分析慢查询、热点等疑难场景,输出系统性优化解决方案,并实现平台化落地
d. 针对业务场景设计存储选型方案,平衡性能、成本与可维护性
e. 制定存储产品,组件运维、变更SOP,以及容灾演练机制与应急预案
f. 推动开发团队落地存储使用最佳实践、以及平台能力的持续演进,降低人为故障风险
智能化运维体系建设
a. 开发运维工具链(如监控告警、自动扩缩容、巡检等),推动运维效率的持续提升
b. 持续积累沉淀专家经验与知识库,基于RAG等技术完善智能答疑的能力,并协助完成运维智能体的持续构建与优化
c. 持续探索AI-Agent在存储运维场景的应用与落地,实现故障的自动定位、诊断以及自愈
d. 持续跟踪HBase、Lindorm、OceanBase等分布式存储领域的前沿技术,主导关键组件的升级与架构演进
优先资格
a. 有PB级HBase、MySQL等集群运维经验,对相关存储引擎源码有了解
b. 参与过开源社区相关项目贡献
c. 熟悉云原生存储技术栈
d. 对技术有热情,持续关注探索AI等前沿技术
AI 洞察
优缺点分析
优点
- 涉及AI-Agent等前沿技术,有创新空间,紧跟行业趋势
- 稳定性SLA要求严格,能积累宝贵的容灾、高可用实战经验
- 团队协作和技术文档要求高,有助于规范化职业素养
- 分布式存储技术栈复杂,需要持续学习,上手门槛高
- 运维岗需要较强抗压能力,节假日可能需值班
- 适合对分布式技术有浓厚兴趣、抗压能力强、追求技术深度的工程师
缺点 / 挑战
- 蚂蚁集团平台大,接触大规模分布式系统,技术挑战高,能快速提升架构和运维能力
- 生产环境稳定性要求高,工作压力大,可能需要随时响应故障
角色解读
- 技术深度方向:从运维工程师成长为分布式存储专家,深入存储引擎源码,成为领域权威
- 技术管理方向:积累跨团队协作和体系化建设经验,向运维团队管理岗发展
- 智能化方向:结合AI-Agent和RAG,从传统运维向智能运维架构师转型
- 负责HBase/Lindorm、OceanBase等分布式数据库的部署、监控、高可用设计及故障应急,保障系统稳定性
- 主导存储集群性能调优、容灾方案设计,解决慢查询、热点等疑难问题
- 开发运维工具链,推进智能化运维,探索AI-Agent在故障诊断和自愈中的应用
- 制定运维SOP和应急预案,推动开发团队落地存储最佳实践
- 熟悉HBase、OceanBase、MySQL等分布式存储引擎的架构原理和运维经验
- 精通Linux系统及Grafana、Prometheus等监控工具,具备全链路问题定位能力
- 具备体系化运维建设方法论,能独立主导复杂问题攻关
- 了解云原生存储技术,对AI等前沿技术有持续热情
申请策略
- 强调自己对稳定性的敬畏心和对故障处理的冷静态度
- 了解蚂蚁集团的业务场景(支付、金融),说明自己对高可用架构的理解
- 突出HBase/MySQL等大规模集群运维经验,量化数据和规模(如节点数、QPS、稳定性)
- 强调自己主导过的性能调优、容灾设计或故障处理案例,展示解决问题的能力
- 列出自动化运维工具开发经验,突出Python/Go等脚本语言能力
- 如果有开源社区贡献或云原生存储经验,务必写明
- 深入学习OceanBase或HBase的底层架构和源码,理解LSM-tree、分布式一致性等核心原理
- 熟悉Kubernetes等云原生技术,了解容器化存储
面试指南
- 采用STAR法则,详细描述情境、任务、行动和结果,突出技术深度和协作能力
- 对比分析时,从架构、一致性、扩展性、运维复杂度等角度展开,体现系统性思考
- 对容灾设计,从RTO/RPO、机房部署、数据同步、切换流程等方面回答
- 请描述一次你主导处理大规模数据库故障的经过,你是如何定位和解决的?
- HBase和OceanBase的底层架构有什么区别?各自适用什么场景?
- 如何设计一个多机房容灾方案?考虑哪些因素?
- 你如何理解“稳定性建设”?有哪些具体的手段?
- 你使用过哪些自动化运维工具?如何设计监控告警和自动扩缩容?
职位点评
68
综合评分
蚂蚁集团高级存储运维,前沿技术栈,稳定性强,但现场办公且压力较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和职业发展、能承受较大工作压力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活45
使命价值60
薪资福利
70中等
薪资未明确,但大厂稳定性强,整体补偿性较好。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
85较高
技术栈前沿,包含AI-Agent、RAG等创新应用,成长空间大。
技术前沿前沿/新兴技术
技术栈HBase、Lindorm、OceanBase、Linux、Grafana、Prometheus、RAG、AI-Agent、云原生、分布式存储、容灾、高可用
业务类型cost_center
工作生活
45较低
现场办公,且JD含高强度抗压要求,工作生活平衡一般。
工作模式未明确
办公地点未明确
加班情况JD含高强度暗示词
使命价值
60中等
平台行业稳定,但对社会直接影响有限,意义感一般。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs