
智元机器人
SRE 运维工程师 (Site Reliability Engineer)
SRE 运维工程师 (Site Reliability Engineer)
发布于 大约 17 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Ai Infra
Gpu
Rabbitmq
AI 估算 · 20k–35k
上海B轮AI公司,SRE岗位技术要求较高,但偏运维非开发,薪资位于中级工程师区间,结合行业和城市因素。
职位详情
关于这个职位
这是一个面向智元机器人具身研究中心的SRE运维工程师岗位,负责维护Kubernetes集群、中间件服务、GPU算力平台及网络基础设施的稳定性
你需要保障千台级机器人数据闭环基础设施的日常运行,快速响应故障并推动问题解决
适合有扎实运维基础、注重稳定性和团队协作的工程师
最低要求
容器与编排:熟悉Kubernetes日常运维操作(kubectl命令、Pod管理、日志查看、资源监控),能够独立处理常见的集群运维问题
数据库运维:熟悉PostgreSQL基础运维(连接管理、慢查询排查、备份恢复),了解数据库常见问题的排查思路
消息队列:熟悉RabbitMQ或Kafka的基础运维(队列监控、消息积压处理、节点状态检查)
监控系统:熟练使用Prometheus + Grafana进行监控查询与仪表盘配置,能够根据监控数据定位问题
网络基础:理解TCP/IP基础知识,熟悉代理服务配置(HTTP/SOCKS代理、VPN),能够排查基础网络连通性问题
脚本能力:熟悉Python或Shell脚本编写,能够编写自动化运维脚本提升工作效率
工作职责
Kubernetes集群运维:负责Kubernetes集群的日常监控、资源管理与故障排查
管理Pod/Deployment/StatefulSet等工作负载,处理服务异常、资源不足等常见问题,确保集群稳定运行
中间件服务运维:维护PostgreSQL、RabbitMQ、Redis等核心中间件的运行状态
执行日常巡检、状态监控、数据备份,处理连接异常、队列积压等运维问题
GPU算力平台运维:管理云端GPU计算资源,监控训练任务队列状态,处理任务调度异常,协调算力资源分配,保障大规模训练任务的顺利执行
网络与代理服务管理:维护公司互联网代理服务,确保研发人员的国际网络访问畅通
管理办公网络(WIFI)、VPN等网络基础设施的日常运维
可观测性与告警响应:使用Prometheus、Grafana等监控工具进行服务状态监控,响应告警事件,快速定位问题根因,执行故障恢复操作
故障响应与值班:参与on-call值班轮换,对生产环境故障进行快速响应与处理,编写故障报告并推动问题根本解决
优先资格
有AI Infra或GPU集群运维经验,了解训练任务调度
熟悉公有云平台(阿里云、金山云、AWS等)的运维操作
有网络代理系统(Clash/Mihomo、V2Ray等)的管理经验
有SRE、DevOps或ITIL相关认证
有良好的文档习惯,善于总结运维知识与故障处理经验
AI 洞察
优缺点分析
优点
- 身处AI机器人前沿领域,接触具身智能和千台级机器人数据基础设施,技术背景扎实
- 公司处于B轮融资阶段,成长速度快,个人有较大发展空间和晋升机会
- 团队专注稳定性和可靠性,工作内容明确,能积累扎实的运维实战经验
- 需要参与on-call值班,生产环境故障可能发生在非工作时间,对响应速度要求高
- AI Infra领域技术栈更新快,需要持续学习新工具和新架构
- 岗位偏运维,技术深度的天花板可能低于开发岗位,但广度要求高
- 适合热爱基础设施稳定性、享受故障排除和系统优化、希望在AI领域深耕的运维工程师
缺点 / 挑战
暂无明显挑战项
角色解读
- 深耕AI基础设施运维领域,成为GPU集群和分布式训练平台专家
- 向SRE高级工程师方向发展,主导稳定性设计和自动化运维平台建设
- 可转型为DevOps工程师或云原生架构师,负责更大规模的基础设施架构
- 维护Kubernetes集群和中间件(PostgreSQL、RabbitMQ、Redis)的稳定运行,处理日常故障和资源调度
- 管理GPU算力平台,监控训练任务队列,协调算力资源分配,保障大规模训练任务顺利执行
- 维护网络代理服务和办公网络,确保研发团队的网络畅通,包括VPN和WIFI
- 使用Prometheus和Grafana搭建监控体系,响应告警,参与on-call值班,快速恢复生产环境故障
- 熟练掌握Kubernetes日常运维操作,包括kubectl命令、Pod管理、日志查看和资源监控
- 熟悉PostgreSQL、RabbitMQ、Redis等中间件的运维,能处理慢查询、消息积压等常见问题
- 熟练使用Prometheus+Grafana进行监控和故障定位,具备网络基础(TCP/IP、代理、VPN)
- 具备Python或Shell脚本编写能力,能编写自动化运维脚本提升效率
申请策略
- 了解智元机器人的产品方向和具身智能领域,面试时展现对机器人基础设施的兴趣
- 准备一两个故障排查的案例,展示你的问题定位和解决思路
- 突出Kubernetes集群运维经验,包括集群规模、故障处理案例和自动化脚本成果
- 详细描述PostgreSQL、RabbitMQ、Redis等中间件的运维实践,包括监控和备份恢复
- 如有GPU集群或AI训练平台运维经验,务必重点展示
- 列举Python/Shell脚本优化运维效率的具体案例,如自动化巡检或故障恢复脚本
- 如果对Kubernetes不够熟悉,建议先通过CKA认证或动手实践加深理解
- 学习Prometheus和Grafana的高级用法,如自定义告警规则和仪表盘
面试指南
- STAR法则:描述情境(S)、任务(T)、行动(A)、结果(R),突出你的分析和动手能力
- 问题定位思路:先看监控指标(CPU/内存/网络/错误日志),再使用命令行工具深入排查,最后给出修复方案和预防措施
- 强调文档总结:每次故障后写复盘报告,推动问题根本解决,体现SRE的可持续性思维
- 请描述一次你处理Kubernetes集群重大故障的经历,你是如何定位和恢复的?
- 如何排查PostgreSQL慢查询?列出常用的排查工具和优化方法
- RabbitMQ消息积压如何处理?请说明从发现到解决的完整流程
- 你如何设计一套告警体系确保及时发现GPU训练任务异常?
- 如果需要你写一个脚本定期检查所有中间件的健康状态,你会如何设计?
职位点评
66
综合评分
前沿AI机器人公司,运维岗位技术新、有使命感,但需on-call和现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和行业影响力,能接受on-call值班和一定工作强度的运维工程师。
表现最好
使命价值
相对薄弱
工作生活
薪资福利70
成长发展75
工作生活40
使命价值80
薪资福利
70中等
薪资中等偏上但未明确透露,B轮公司可能提供期权,福利未在JD中提及,整体补偿性中等。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
75中等
岗位能接触AI Infra和Kubernetes等前沿技术,公司处于快速发展期,但JD未明确提及培训或晋升通道,发展性较好但信息有限。
技术前沿前沿/新兴技术
技术栈Kubernetes、PostgreSQL、RabbitMQ、Redis、GPU、Prometheus、Grafana、Python、Shell
成长机会持续学习
业务类型ambiguous
工作生活
40较低
岗位要求on-call值班,工作时间灵活性差,JD未提及远程或弹性办公,生活化动机满足度较低。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
参与具身智能机器人基础设施建设,属于AI前沿领域,社会价值和行业前景较好,有较强的意义感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs