AgiBot logo
智元机器人
云原生研发工程师

云原生研发工程师

发布于 1 天前

普通员工/个人贡献者

上海市 / 北京市
中级经验
全职员工
仅现场办公
学历未注明
软件工程
Ai平台
Containerd
Koordinator
Openyurt
Operator
Rdma
Volcano
云原生
Kubeedge

AI 估算 · 25k–45k

上海/北京中级云原生工程师薪资较高,B轮融资的中大型企业薪酬有竞争力,综合市场水平估算。

职位详情

关于这个职位

作为智元机器人的云原生研发工程师,你将负责基于 Kubernetes 的 Genie Studio 平台核心系统的设计与开发,涵盖多云管理、GPU 设备优化、容器编排调度等方向

同时,你需要搭建和维护混合云场景下的基础服务,并与 SRE 团队协作确保项目顺利部署
这是一个深度参与 AI 平台云原生化、推动新技术落地的技术岗位

最低要求

具备坚实的 Golang 编程基础

具备良好的代码规范和强烈的工程意识
熟悉 Kubernetes 核心组件原理和开发,有 Operator 开发经验 (使用 Operator SDK、kubebuilder 等)
熟悉云原生主流工具的使用和调优(如 Docker/Containerd、Helm Charts、Prometheus 等)
具备 AI 平台云原生相关的研发经验,对 AI 平台所涉及的各类基础服务有一定了解
具备以下经验中的一项或多项者优先:
熟悉device-plugin、容器网络、RDMA通信
具备 调度器/容器运行时 等模块开发经验
具备云原生开源项目(如 OpenYurt、KubeEdge、Volcano、Koordinator)的开发经验

工作职责

负责混合云场景下基于 Kubernetes 的 Genie Studio 平台核心系统的设计、开发和维护,包括多云管理、边缘集群管理、私有化部署、GPU 设备管理及优化、容器编排调度、运行时优化等方向中的一项或多项,持续提升平台产品的资源利用率、稳定性和易用性

负责混合云场景下基于 Kubernetes 的 Genie Studio 平台基础服务的搭建、开发和维护,如:
网络:容器网络、RDMA、DNS、负载均衡、NAT 等
存储:文件存储、对象存储等
边缘节点:节点管理、网络通信优化等
可观测性:日志、监控、告警、链路追踪
与实施交付的 SRE 沟通协调,参与系统优化及问题定位,保证项目顺利部署实施
跟踪云原生生态发展趋势,推动云原生 Genie Studio 相关新技术落地,提升训练推理的效率、稳定性和产品竞争力
跟踪 Infrastructure as Code 领域的发展,持续提高 Genie Studio 平台的私有化部署能力,提高可用性和易用性

优先资格

熟悉主流公有云厂商云产品

有相关开源项目贡献经历
掌握 Python/Shell 语言,具备基础开发能力

AI 洞察

优缺点分析

优点

  • 接触云原生前沿技术,如 KubeEdge、Volcano 等,技能积累扎实
  • B 轮融资中大型企业,发展空间大,有机会参与核心平台建设
  • 需要同时掌握多项云原生技术栈,学习曲线较陡
  • 可能涉及多地协作和复杂混合云环境,问题定位需要较强综合能力
  • 初创阶段项目节奏较快,对工程交付速度有一定要求
  • 适合对云原生技术有浓厚兴趣、具备 Golang 和 Kubernetes 实战经验、希望在 AI 基础设施领域深入发展的工程师

缺点 / 挑战

  • 身处 AI 机器人赛道,行业前景广阔,技术挑战度高

角色解读

  • 成为云原生架构专家,深耕 Kubernetes 生态与 AI 基础设施
  • 向技术团队管理或首席云原生架构师发展,主导平台演进
  • 可横向拓展至 SRE、系统架构或 AI 平台架构师等角色
  • 负责基于 Kubernetes 的 Genie Studio 平台核心系统设计开发,涉及多云管理、GPU 优化、容器编排等方向
  • 搭建和维护混合云基础服务,包括网络、存储、可观测性等组件
  • 与 SRE 团队协作解决系统问题,推动云原生新技术落地,提升训练推理效率
  • 扎实的 Golang 编程能力,熟悉 Kubernetes 核心原理及 Operator 开发
  • 熟悉 Docker/Containerd、Helm、Prometheus 等云原生工具的使用与调优
  • 有 AI 平台云原生研发经验,了解 GPU 管理、容器网络、RDMA 等
  • 具备开源项目经验或公有云产品知识者优先

申请策略

  • 提前了解智元机器人的业务方向,在面试中体现对机器人 AI 平台的理解
  • 突出 Golang 和 Kubernetes 开发经验,特别是 Operator 开发项目
  • 展示云原生工具使用案例,如 Docker、Helm、Prometheus 的调优经历
  • 如果有 AI 平台或 GPU 相关经验,务必详细描述
  • 补充学习 OpenYurt、KubeEdge、Volcano 等开源项目的基本用法
  • 加强 Python/Shell 脚本能力,便于自动化运维

面试指南

  • 对于技术问题,先概括原理,再结合项目经验说明具体实现和优化
  • 对于挑战类问题,使用 STAR 法则(情境、任务、行动、结果)结构化回答
  • 请谈谈你对 Kubernetes Operator 的理解,以及如何构建一个 Operator?
  • 你如何优化 Kubernetes 集群中 GPU 资源的调度?
  • 在混合云场景下,你如何处理容器网络和跨集群通信?
  • 请分享一个你参与过的云原生项目,遇到的最大技术挑战是什么?
  • 你对 Infrastructure as Code 有什么看法?在私有化部署中如何实践?
  • 复习 Kubernetes 核心组件原理和 Operator 开发流程,准备一个完整的 Demo

职位点评

70
综合评分

前沿云原生技术、高成长性、B轮AI机器人公司,WLB一般

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、对云原生和 AI 基础设施有热情的工程师,愿意接受现场办公和适度工作压力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活55
使命价值60

薪资福利

70中等

职位薪资有竞争力,B轮中大型企业福利较完善,但具体薪资未披露,稳定性中等。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

职位涉及前沿云原生技术栈,如 KubeEdge、Volcano 等,技能成长空间大,有开源项目参与机会,但未明确提及晋升路径。

技术前沿前沿/新兴技术
技术栈Kubernetes、Golang、Docker、Containerd、Helm、Prometheus、Operator、OpenYurt、KubeEdge、Volcano、Koordinator、RDMA
业务类型ambiguous

工作生活

55较低

工作地点在上海/北京,需现场办公,未提及弹性工作或远程,可能有一定加班压力。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

60中等

所在 AI 机器人行业增长快,但职位偏基础设施,社会影响力有限,公司使命信号未提及。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs