AgiBot logo
智元机器人
SRE 运维工程师 (Site Reliability Engineer)

SRE 运维工程师 (Site Reliability Engineer)

发布于 大约 17 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Ai Infra
Gpu
Rabbitmq

AI 估算 · 20k–35k

上海B轮AI公司,SRE岗位技术要求较高,但偏运维非开发,薪资位于中级工程师区间,结合行业和城市因素。

职位详情

关于这个职位

这是一个面向智元机器人具身研究中心的SRE运维工程师岗位,负责维护Kubernetes集群、中间件服务、GPU算力平台及网络基础设施的稳定性

你需要保障千台级机器人数据闭环基础设施的日常运行,快速响应故障并推动问题解决
适合有扎实运维基础、注重稳定性和团队协作的工程师

最低要求

容器与编排:熟悉Kubernetes日常运维操作(kubectl命令、Pod管理、日志查看、资源监控),能够独立处理常见的集群运维问题

数据库运维:熟悉PostgreSQL基础运维(连接管理、慢查询排查、备份恢复),了解数据库常见问题的排查思路
消息队列:熟悉RabbitMQ或Kafka的基础运维(队列监控、消息积压处理、节点状态检查)
监控系统:熟练使用Prometheus + Grafana进行监控查询与仪表盘配置,能够根据监控数据定位问题
网络基础:理解TCP/IP基础知识,熟悉代理服务配置(HTTP/SOCKS代理、VPN),能够排查基础网络连通性问题
脚本能力:熟悉Python或Shell脚本编写,能够编写自动化运维脚本提升工作效率

工作职责

Kubernetes集群运维:负责Kubernetes集群的日常监控、资源管理与故障排查

管理Pod/Deployment/StatefulSet等工作负载,处理服务异常、资源不足等常见问题,确保集群稳定运行
中间件服务运维:维护PostgreSQL、RabbitMQ、Redis等核心中间件的运行状态
执行日常巡检、状态监控、数据备份,处理连接异常、队列积压等运维问题
GPU算力平台运维:管理云端GPU计算资源,监控训练任务队列状态,处理任务调度异常,协调算力资源分配,保障大规模训练任务的顺利执行
网络与代理服务管理:维护公司互联网代理服务,确保研发人员的国际网络访问畅通
管理办公网络(WIFI)、VPN等网络基础设施的日常运维
可观测性与告警响应:使用Prometheus、Grafana等监控工具进行服务状态监控,响应告警事件,快速定位问题根因,执行故障恢复操作
故障响应与值班:参与on-call值班轮换,对生产环境故障进行快速响应与处理,编写故障报告并推动问题根本解决

优先资格

有AI Infra或GPU集群运维经验,了解训练任务调度

熟悉公有云平台(阿里云、金山云、AWS等)的运维操作
有网络代理系统(Clash/Mihomo、V2Ray等)的管理经验
有SRE、DevOps或ITIL相关认证
有良好的文档习惯,善于总结运维知识与故障处理经验

AI 洞察

优缺点分析

优点

  • 身处AI机器人前沿领域,接触具身智能和千台级机器人数据基础设施,技术背景扎实
  • 公司处于B轮融资阶段,成长速度快,个人有较大发展空间和晋升机会
  • 团队专注稳定性和可靠性,工作内容明确,能积累扎实的运维实战经验
  • 需要参与on-call值班,生产环境故障可能发生在非工作时间,对响应速度要求高
  • AI Infra领域技术栈更新快,需要持续学习新工具和新架构
  • 岗位偏运维,技术深度的天花板可能低于开发岗位,但广度要求高
  • 适合热爱基础设施稳定性、享受故障排除和系统优化、希望在AI领域深耕的运维工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 深耕AI基础设施运维领域,成为GPU集群和分布式训练平台专家
  • 向SRE高级工程师方向发展,主导稳定性设计和自动化运维平台建设
  • 可转型为DevOps工程师或云原生架构师,负责更大规模的基础设施架构
  • 维护Kubernetes集群和中间件(PostgreSQL、RabbitMQ、Redis)的稳定运行,处理日常故障和资源调度
  • 管理GPU算力平台,监控训练任务队列,协调算力资源分配,保障大规模训练任务顺利执行
  • 维护网络代理服务和办公网络,确保研发团队的网络畅通,包括VPN和WIFI
  • 使用Prometheus和Grafana搭建监控体系,响应告警,参与on-call值班,快速恢复生产环境故障
  • 熟练掌握Kubernetes日常运维操作,包括kubectl命令、Pod管理、日志查看和资源监控
  • 熟悉PostgreSQL、RabbitMQ、Redis等中间件的运维,能处理慢查询、消息积压等常见问题
  • 熟练使用Prometheus+Grafana进行监控和故障定位,具备网络基础(TCP/IP、代理、VPN)
  • 具备Python或Shell脚本编写能力,能编写自动化运维脚本提升效率

申请策略

  • 了解智元机器人的产品方向和具身智能领域,面试时展现对机器人基础设施的兴趣
  • 准备一两个故障排查的案例,展示你的问题定位和解决思路
  • 突出Kubernetes集群运维经验,包括集群规模、故障处理案例和自动化脚本成果
  • 详细描述PostgreSQL、RabbitMQ、Redis等中间件的运维实践,包括监控和备份恢复
  • 如有GPU集群或AI训练平台运维经验,务必重点展示
  • 列举Python/Shell脚本优化运维效率的具体案例,如自动化巡检或故障恢复脚本
  • 如果对Kubernetes不够熟悉,建议先通过CKA认证或动手实践加深理解
  • 学习Prometheus和Grafana的高级用法,如自定义告警规则和仪表盘

面试指南

  • STAR法则:描述情境(S)、任务(T)、行动(A)、结果(R),突出你的分析和动手能力
  • 问题定位思路:先看监控指标(CPU/内存/网络/错误日志),再使用命令行工具深入排查,最后给出修复方案和预防措施
  • 强调文档总结:每次故障后写复盘报告,推动问题根本解决,体现SRE的可持续性思维
  • 请描述一次你处理Kubernetes集群重大故障的经历,你是如何定位和恢复的?
  • 如何排查PostgreSQL慢查询?列出常用的排查工具和优化方法
  • RabbitMQ消息积压如何处理?请说明从发现到解决的完整流程
  • 你如何设计一套告警体系确保及时发现GPU训练任务异常?
  • 如果需要你写一个脚本定期检查所有中间件的健康状态,你会如何设计?

职位点评

66
综合评分

前沿AI机器人公司,运维岗位技术新、有使命感,但需on-call和现场办公。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和行业影响力,能接受on-call值班和一定工作强度的运维工程师。
表现最好
使命价值
相对薄弱
工作生活
薪资福利70
成长发展75
工作生活40
使命价值80

薪资福利

70中等

薪资中等偏上但未明确透露,B轮公司可能提供期权,福利未在JD中提及,整体补偿性中等。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

75中等

岗位能接触AI Infra和Kubernetes等前沿技术,公司处于快速发展期,但JD未明确提及培训或晋升通道,发展性较好但信息有限。

技术前沿前沿/新兴技术
技术栈Kubernetes、PostgreSQL、RabbitMQ、Redis、GPU、Prometheus、Grafana、Python、Shell
成长机会持续学习
业务类型ambiguous

工作生活

40较低

岗位要求on-call值班,工作时间灵活性差,JD未提及远程或弹性办公,生活化动机满足度较低。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

参与具身智能机器人基础设施建设,属于AI前沿领域,社会价值和行业前景较好,有较强的意义感。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs