AgiBot logo
智元机器人
运维研发工程师

运维研发工程师

发布于 大约 1 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Go
Gpu
Kubeedge
Openyurt
成本治理
监控告警
Helm Chart
Prefect

AI 估算 · 25k–45k

上海高级运维工程师,GPU集群经验稀缺,薪资较高,B轮公司现金部分中等,参考市场水平估算。

职位详情

关于这个职位

该职位负责智元机器人GenieStudio平台的私有化部署与基础运维,需要从0到1构建GPU集群的自动化部署、监控告警和成本治理体系,是支撑公司AI业务落地的关键角色

最低要求

具备坚实的 Python/Go/Shell 编程基础

具备良好的代码规范和强烈的工程意识
具备 GPU 集群以及相关环境的运维部署经验
具备 Kubernetes / KubeEdge / OpenYurt 和 Prefect / Ray 集群的运维部署经验
熟练掌握 Ansible / Terraform 等 Infrastructure as Code 工具的使用
熟练掌握 Helm Chart 容器化部署方式,有推动各业务团队统一容器化的经验
具备一定的数据分析与成本意识,能基于监控指标(如 GPU/CPU/存储/网络)做简单分析,支撑成本优化决策

工作职责

负责 GenieStudio 平台的私有化部署建设,能够从0到1完成各个组件的部署工作

负责 GenieStudio 的基础运维工作,参与分析解决线上问题,并保证系统稳定性
不断提升 GenieStudio 的运维部署能力,包括但不限于自动化部署、监控告警
负责平台的成本治理与资源利用率管控,针对算力与存储等关键资源建设成本工程能力
建立并维护 GPU / CPU 利用率统计与监控体系,支持按集群 / 租户 / 项目等多维度查看资源使用情况
建立高性能存储 / 对象存储 / 网络带宽的利用率监控与报表,分析容量增长、IO / 吞吐瓶颈及带宽消耗
对云上与云下(Kubernetes / KubeEdge / OpenYurt / 裸机 GPU 等)资源做统一资产统计与持续纳管,沉淀资源台账与统一看板
设计并落地资源利用率红黑榜,对高消耗低利用的项目/任务进行监控和治理

AI 洞察

优缺点分析

优点

  • 接触前沿的GPU集群和AI基础设施技术,技能稀缺性强
  • 从0到1搭建平台,能够积累完整的架构设计经验
  • 成本治理方向贴合企业降本需求,职业发展前景好
  • 涉及多组件集成和问题排查,对系统整体架构理解要求高
  • 成本治理需要数据敏感度和业务理解,协调多方推动优化
  • 适合热爱基础设施、对GPU和云原生技术有浓厚兴趣,并且愿意从0到1搭建系统、具备较强解决问题的动手能力的工程师

缺点 / 挑战

  • 公司处于机器人赛道风口,业务增长快,技术挑战大
  • 需要承担从0到1的搭建压力,初期工作强度可能较大

角色解读

  • 技术深耕方向:成为GPU集群运维架构师,主导AI基础设施设计与优化
  • 管理方向:晋升为SRE负责人,带领团队保障大规模分布式系统稳定运行
  • 横向扩展:可转向云原生平台开发或AI工程化领域
  • 负责GenieStudio平台的私有化部署,从0到1搭建GPU集群及关联组件
  • 日常运维工作,包括线上问题排查、系统稳定性保障和自动化部署优化
  • 构建成本治理体系,监控GPU/CPU/存储利用率,推动资源优化决策
  • 精通Python/Go/Shell,具备扎实的编程基础和工程化思维
  • 深入掌握Kubernetes生态(KubeEdge/OpenYurt)及任务调度框架(Prefect/Ray)
  • 熟悉Ansible/Terraform等IaC工具和Helm Chart容器化部署
  • 具备数据分析能力,能基于监控指标进行成本优化分析

申请策略

  • 了解智元机器人的产品线(如通用机器人、行业机器人)和GenieStudio平台定位,展示对AI落地场景的理解
  • 在面试中主动分享自己经历的典型故障处理案例和优化思路
  • 突出GPU集群部署和运维经验,尤其是大规模Kubernetes集群管理案例
  • 展示自动化部署项目成果,如使用Ansible/Terraform实现基础设施即代码
  • 强调成本治理或资源优化相关经历,体现数据分析和工程能力
  • 补充Ray或Prefect等任务调度框架的实战经验
  • 学习成本分析工具(如Spot实例、预留实例)和云成本管理方法论

面试指南

  • STAR法则:描述情境、任务、行动和结果,突出技术细节和量化成果
  • 先讲整体架构思路,再深入具体实现(如选型原因、优化点)
  • 遇到问题时的排查路径:先定位根因,再提出解决方案,最后复盘改进
  • 请描述一次你从0到1搭建GPU集群的完整过程及遇到的挑战
  • 如何设计Kubernetes集群的监控体系?具体会关注哪些指标?
  • 你如何推动业务团队统一容器化?遇到过哪些阻力?
  • 如何进行成本治理?请举一个资源优化的实际案例
  • 谈谈你对云原生和边缘计算(KubeEdge/OpenYurt)的理解

职位点评

71
综合评分

前沿GPU集群运维,从0到1架构设计,技术成长快但可能较辛苦。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、愿意接受挑战的运维工程师,对WLB要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值80

薪资福利

70中等

薪资未明确披露,但GPU运维岗位稀缺,预计薪酬有竞争力;未提及福利,但B轮公司可能提供期权。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

技术栈前沿(GPU云原生、KubeEdge等),有从0到1架构设计机会,成长空间大。

技术前沿前沿/新兴技术
技术栈GPU集群、Kubernetes、KubeEdge、OpenYurt、Prefect、Ray、Ansible、Terraform、Helm Chart
业务类型ambiguous

工作生活

50较低

仅现场办公,工作地点在上海,未提及WLB和弹性工作制,可能需要应对高强度运维。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

机器人行业高速增长,AI基础设施对技术发展有积极推动作用。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs