
智谱
AI院-GLM团队-SRE运维工程师
AI院-GLM团队-SRE运维工程师
发布于 4 个月前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
本科
系统与安全工程
CI/CD
云原生
容器安全
高可用架构
GO
SRE
AI 估算 · 30k–50k
岗位要求高级SRE经验,精通云原生技术栈,且位于北京AI头部公司,技术壁垒高,市场竞争力强。
职位详情
关于这个职位
这是一个专注于AI业务稳定性的SRE运维工程师岗位
你将负责大规模Kubernetes集群的稳定性建设与性能调优,包括高可用架构设计、容器化架构优化以及自动化运维工具链的开发
同时,你需要建立容器安全防护体系,并协同研发团队推动ServiceMesh等新技术的落地
最低要求
教育背景:统招本科及以上学历,计算机、软件工程、云计算相关专业优先
工作经验:3年以上容器运维经验,主导或深度参与过千级 Pod规模的集群维护
熟悉生产环境容器化全生命周期管理,包括部署、监控、扩缩容、故障恢复等场景
技术能力:精通Kubernetes架构及生态工具(如Etcd、Calico、Istio),具备集群性能调优经验(如APIServer负载均衡、节点调度优化)
熟练使用Docker、Prometheus、Grafana、ELK、CI/CD等工具链,熟悉云原生安全体系(如镜像扫描、RBAC策略、网络策略)
具备运维开发能力,能使用Python/Go开发自动化工具(如自定义Operator、监控告警脚本)
工作职责
负责TOC相关业务的稳定性建设,包括但不限于Web服务、APP后端、API网关
负责Kubernetes集群的建设与稳定性保障,包括版本升级、故障排查、资源利用率优化
设计高可用架构,解决APIServer性能瓶颈、etcd存储压力等大规模集群特有问题
主导容器化架构调优(如Pod调度策略、网络插件选型、存储方案设计),优化资源请求/限制配置以减少资源争用
建立容器安全防护体系,包括漏洞扫描、运行时安全监控(如Falco)、合规审计
深度参与自动化运维工具链建设,CI/CD流水线混沌工程测试、智能扩缩容(HPA/VPA) 推动Al0ns落地,其于时字数据合析预洲售群负裁并实现自愈
解决生产环境疑难问题(如 OOM、网络延迟、存储性能瓶颈),输出标准化SOP文档车
协同研发团队优化微服务架构,推动ServiceMesh等新技术落地
优先资格
有多云环境/混合云管理经验
头部互联网/云计算大厂优先
AI 洞察
优缺点分析
优点
- 技术前沿:深度接触并实践Kubernetes、ServiceMesh等云原生前沿技术,技能价值高且市场需求旺盛
- 平台优势:在AI头部公司(智谱)的核心团队工作,能参与支撑重要AI产品的稳定性建设,项目背书强
- 能力复合:岗位要求兼具运维、开发、架构和安全能力,有利于培养成为T型人才,职业护城河宽
- 协同要求高:需要与研发团队紧密协作推动架构优化,对沟通和推动能力有一定要求
- 适合拥有3年以上云原生运维经验,追求技术深度,能承受高压,并希望在AI基础设施领域长期发展的工程师
缺点 / 挑战
- 责任与压力:负责核心AI业务的稳定性,需7x24小时响应线上故障,工作压力大,对心理素质和应急能力要求高
- 技术复杂度高:需要解决大规模集群下的特有性能瓶颈和安全问题,技术挑战大,持续学习负担重
角色解读
- 技术纵深发展:可成为云原生架构专家或SRE领域专家,主导更复杂的系统稳定性与效能提升项目
- 横向扩展:向技术管理(如SRE团队负责人)或架构师方向转型,负责技术规划与团队建设
- 行业深耕:在AI基础设施领域持续积累,成为兼具AI业务理解与底层系统能力的复合型人才
- 负责AI业务(如Web服务、API网关)的稳定性保障与高可用架构设计,解决大规模Kubernetes集群的性能瓶颈问题
- 主导容器化架构的调优与安全体系建设,包括Pod调度、网络存储选型、漏洞扫描和运行时安全监控
- 开发和维护自动化运维工具链,实现CI/CD、混沌工程、智能扩缩容,并推动ServiceMesh等新技术在生产环境落地
- 排查并解决生产环境的复杂故障(如OOM、网络延迟),并输出标准化的处理流程文档
- 精通Kubernetes及其核心生态(如Etcd, Calico, Istio),具备大规模集群的性能调优和故障排查能力
- 熟练掌握云原生监控告警栈(如Prometheus, Grafana, ELK)和CI/CD工具链,并能用Python或Go进行运维开发
- 深入理解容器安全体系,能够设计并实施包括镜像扫描、网络策略在内的安全防护方案
- 具备丰富的生产环境容器全生命周期管理经验,熟悉部署、监控、扩缩容和故障恢复等场景
申请策略
- 提前了解智谱公司的AI产品线(如GLM大模型)及其技术架构,思考SRE如何为AI业务稳定性创造价值
- 面试中可准备1-2个体现你系统性解决复杂运维问题、并推动流程或工具改进的完整故事
- 重点突出主导或深度参与千节点以上Kubernetes集群建设、稳定性保障及性能调优的具体项目经历,量化成果
- 详细展示使用Python/Go开发自动化工具(如Operator、监控脚本)的经验,以及解决过的复杂生产故障案例
- 强调在容器安全、高可用架构设计以及CI/CD/混沌工程等自动化运维体系方面的实践和贡献
- 如有头部互联网或云计算大厂的相关工作经验,应明确标注,这是重要的优先条件
- 深入理解Kubernetes调度器、网络插件(如Calico Cilium)和存储系统的底层原理与调优方法
- 加强Go或Python的编程能力,特别是面向Kubernetes Operator开发或高效运维脚本编写的实践
面试指南
- 对于技术问题,采用“现象描述 -> 排查步骤与工具使用 -> 根因分析 -> 解决方案与实施 -> 事后复盘与改进”的结构进行回答
- 对于设计类问题,先阐述设计原则(如高可用、可扩展、安全),再分层(如基础设施层、编排层、应用层)展开具体方案
- 在回答中融入业务视角,说明技术方案如何最终服务于业务稳定性、效率或成本目标
- 请描述一次你处理过的最复杂的Kubernetes生产环境故障(如APIServer性能瓶颈、etcd问题),你的排查思路和最终解决方案是什么?
- 你如何设计和实施一个高可用的Kubernetes集群架构?请考虑网络、存储、控制平面等多个维度
- 请谈谈你在容器安全方面的实践经验,例如如何实施漏洞扫描、配置网络策略或进行合规审计?
- 你如何利用Prometheus等工具构建监控告警体系?请举例说明你设计过的一个关键告警规则及其背后的业务逻辑
- 请分享一个你用Python或Go编写的、显著提升了运维效率的自动化工具或脚本
职位点评
76
综合评分
技术前沿的AI公司SRE岗,技能成长空间巨大,薪资预期良好,但工作地点固定且可能面临运维高压。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合那些将技术成长和职业发展置于首位,能接受一定工作强度,并希望投身于AI基础设施建设的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值75
薪资福利
80较高
薪资预计具备市场竞争力,且位于高薪行业和城市,但具体福利待遇未在JD中披露,存在不确定性。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
岗位技术栈前沿,涉及云原生和AI基础设施,技能成长空间大;且需主导复杂项目,综合能力提升快。
技术前沿前沿/新兴技术
技术栈Kubernetes、Docker、Etcd、Calico、Istio、Prometheus、Grafana、ELK、Python、Go、Falco、CI/CD、ServiceMesh、HPA、VPA
业务类型cost_center
工作生活
50较低
工作地点明确为北京,未提及远程或弹性办公选项。岗位负责核心业务稳定性,可能面临随时响应的压力,WLB挑战较大。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
服务于AI头部公司的核心业务,参与支撑前沿AI产品的稳定运行,工作成果与高速增长的AI行业紧密相连,具有一定行业意义感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智谱 的其他在招职位
相似职位推荐
Watch Jobs