
小米
AI基础设施研发工程师(Sandbox / 容器化)-MiMo
AI基础设施研发工程师(Sandbox / 容器化)-MiMo
发布于 大约 3 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
学历未注明
平台工程
Cgroup
Containerd
Go
Namespace
Sandbox
AI 估算 · 25k–45k
小米AI基础设施岗位,技术栈前沿(K8s/容器/大模型),北京互联网大厂薪资较高,结合中级经验,月薪中位约35K。
职位详情
关于这个职位
这个职位将加入小米 MiMo 大模型团队,专注于建设面向大规模强化学习训练的基础设施
你将负责设计 sandbox 执行环境、基于 Docker/Kubernetes 的容器化调度平台,并参与安全隔离、资源管理及高并发任务执行等核心系统开发
适合对云原生技术有深入理解、对 AI 基础设施感兴趣的后端/平台工程师
最低要求
熟悉 Linux 系统、进程模型、文件系统、网络、权限控制和资源隔离机制
熟悉 Docker、containerd、Kubernetes 等容器化和云原生技术,有实际生产环境使用或平台建设经验
理解 sandbox / 隔离执行环境的核心问题,包括安全边界、资源限制、网络隔离、文件系统隔离、进程生命周期管理等
熟悉至少一种后端或脚本语言,如 Go、Python、Rust、JavaScript / TypeScript、Shell 等,能够独立开发 infra 工具或平台服务
具备分布式系统和基础设施工程意识,理解任务调度、队列、服务发现、监控告警、日志系统、故障恢复等常见机制
对大模型训练、Agent 执行环境、代码运行平台或 RL 训练基础设施有兴趣,愿意深入理解训练系统对 infra 的需求
具备良好的问题定位能力,能够在复杂系统中分析性能、稳定性和资源利用率问题
工作职责
设计和建设面向 RL 训练的 sandbox 执行环境,支持代码运行、工具调用、浏览器自动化、文件系统操作、网络访问控制等能力
基于 Docker、Kubernetes 等技术,构建可大规模调度的容器化任务运行平台,支持高并发、多租户、可观测、可恢复的训练任务执行
参与大规模 RL 训练 infra 的 scaling,包括任务分发、资源调度、环境复用、状态隔离、失败恢复、日志采集和性能优化
建设安全隔离机制,降低模型生成代码、Agent 工具调用和自动化执行带来的安全风险,包括权限控制、系统调用限制、网络隔离、资源限额等
与模型训练、Agent 框架、数据和评测团队合作,将训练任务需求转化为稳定可用的执行环境和平台能力
分析大规模训练过程中的系统瓶颈和故障问题,持续优化调度效率、资源利用率、任务吞吐和环境稳定性
参与内部平台工具建设,包括任务管理、运行监控、日志查询、环境调试、指标看板和自动化运维能力
优先资格
有大规模 Kubernetes 集群、在线执行平台、CI/CD 平台、Serverless、判题系统、代码沙箱或浏览器自动化平台建设经验
熟悉 Linux namespace、cgroup、seccomp、AppArmor、SELinux、Firecracker、gVisor、Kata Containers 等隔离技术
有高并发任务调度、批处理系统、工作流引擎、训练平台或 MLOps 平台建设经验
熟悉 GPU / CPU 混合资源调度、分布式训练、Ray、Slurm、Argo Workflows、Volcano、KubeRay 等技术
熟悉可观测性体系,如 Prometheus、Grafana、OpenTelemetry、Loki、ELK 等
有安全工程经验,理解不可信代码执行、权限收敛、沙箱逃逸风险和多租户隔离
有大模型 Agent、代码执行环境、强化学习训练平台或模型评测平台相关经验者优先
AI 洞察
优缺点分析
优点
- 小米作为大型科技公司,平台资源丰富,基础设施团队规模大,可接触真实生产环境
- 技能栈覆盖容器、Kubernetes、分布式系统、安全等,市场价值高
- 与模型训练、Agent 团队紧密协作,能深入了解 AI 全链路
- 大模型训练 infra 对稳定性和性能要求极高,需应对快速变化的业务需求
- 需要同时掌握底层系统、容器、分布式、安全等多领域知识,学习曲线陡峭
- 适合对底层技术和基础设施充满热情,喜欢深入探索系统问题,并愿意投身 AI 基础设施浪潮的工程师
缺点 / 挑战
- 身处大模型和强化学习训练前沿,技术挑战大,个人成长空间广阔
- 基础设施研发通常需要处理复杂系统问题,排查难度大,可能面临较大压力
角色解读
- 在 AI 基础设施方向深耕,成为大模型训练平台和云原生技术的专家
- 可向技术专家或架构师方向发展,负责更大规模的分布式系统和平台架构设计
- 有机会横向扩展到 AI 平台、MLOps 或 Agent 基础设施等前沿领域
- 构建面向大模型强化学习训练的沙箱执行环境,支持代码运行、工具调用和浏览器自动化等任务
- 基于 Docker 和 Kubernetes 开发容器化任务调度平台,实现高并发、多租户、可观测的分布式训练任务执行
- 负责训练基础设施的扩展与优化,包括任务分发、资源调度、环境复用、失败恢复和日志采集
- 建设安全隔离机制,通过权限控制、系统调用限制和网络隔离降低不可信代码执行带来的风险
- 扎实的 Linux 系统知识,熟悉进程、文件系统、网络和资源隔离机制
- 深入理解 Docker、containerd、Kubernetes 等容器和云原生技术,并有生产实践经验
- 掌握至少一种后端语言(Go/Python/Rust 等),能独立开发基础设施工具或平台服务
- 具备分布式系统架构意识,了解任务调度、服务发现、监控告警和故障恢复等机制
申请策略
- 在简历中直接说明对 AI 基础设施的兴趣和已有积累,展示技术热情
- 面试前了解小米 MiMo 大模型团队的研究方向,思考基础设施如何支撑大规模 RL 训练
- 突出 Linux/容器/Kubernetes 相关项目经验,特别是生产环境的实际搭建或优化案例
- 强调在分布式系统、任务调度或隔离安全方面的实践,可量化性能提升或稳定性改善
- 如有大模型或 RL 相关项目(即使非 infra)也可展示,体现对业务场景的理解
- 详细描述自己解决过的复杂系统故障或性能瓶颈问题,体现排障能力
- 深入学习 Kubernetes 高级调度、多租户隔离和 Operator 开发,可动手搭建一个小型控制平面
- 熟悉至少一种沙箱/隔离技术(如 gVisor、Firecracker、Kata Containers),了解其原理
面试指南
- 对于设计类问题,先明确需求边界和核心目标,再拆解为资源管理、安全隔离、调度策略、可观测性等模块,给出分层设计
- 对于系统优化问题,结合具体案例,以发现问题-分析原因-提出方案-量化结果的结构回答
- 对底层原理问题,从机制定义出发,结合实际使用场景说明为何这样设计,并指出局限
- 如何保障多租户 Kubernetes 集群的资源隔离和安全性?
- 设计一个支持高并发代码执行的沙箱平台,你会考虑哪些关键点?
- 在大规模任务调度中,如何实现任务的高效分发和失败恢复?
- 如何定位并优化一个繁忙训练集群的性能瓶颈?
- 谈谈你对容器安全中 namespace、cgroup、seccomp 的理解及应用
职位点评
73
综合评分
大厂 AI 基础设施岗,技术前沿成长性强,薪资待定,WLB 信号不明。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最看重技术成长和技术前沿性的工程师,他们乐于投身 AI 基础设施,并能接受现场办公和可能的弹性压力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活50
使命价值75
薪资福利
70中等
职位薪资未披露,但小米作为上市大厂,薪资和福利整体具有竞争力,然而 JD 中未明确具体福利,补偿性动机满足程度中等偏上。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
92较高
该职位处于大模型基础设施前沿,技术栈围绕容器、Kubernetes、分布式系统等主流甚至新兴技术,能极大提升个人技术深度和广度,且参与从 0 到 1 的大规模系统建设,发展性动机很强。
技术前沿前沿/新兴技术
技术栈Kubernetes、Docker、containerd、sandbox、gVisor、Kata Containers、Ray、MLOps
业务类型cost_center
工作生活
50较低
职位为现场办公,JD 未提及弹性或远程政策,且基础设施岗位通常需要响应线上问题,工作节奏可能不可控,生活方式满意度一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
工作服务于大模型和强化学习训练,属于高速增长的 AI 赛道,对技术发展有较强推动作用,但直接社会价值体现相对中性,意义感动机有一定满足。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小米 的其他在招职位
相似职位推荐
Watch Jobs