MiniMax logo
稀宇科技
机器学习系统研发工程师-2027 届

机器学习系统研发工程师-2027 届

发布于 大约 3 小时前

普通员工/个人贡献者

上海市 / 北京市
无经验要求
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Gpu
Pytorch
Tensorflow
分布式系统

AI 估算 · 20k–30k

AI基础设施研发岗位稀缺,技术难度高,B轮公司竞争力强,应届生薪资处于市场高位。

职位详情

关于这个职位

该职位负责MiniMax机器学习平台的研发,包括基础设施、算法框架和工具链的设计与实现

你将参与资源调度、任务编排、模型训练等系统方向,涉及分布式系统、容器技术和机器学习框架的深度使用
适合对ML系统和高性能计算感兴趣的应届生

最低要求

熟悉Linux平台下的分布式系统的开发及运维

具有Golang/Python/C/C++等一种高级语言开发经验
熟悉计算机组成、操作系统原理
熟悉容器技术,具有Docker、Kubernetes开发或使用经验

工作职责

参与 MiniMax 机器学习平台的研发,设计和实现机器学习相关的基础设施/算法框架/工具链等,关注机器学习研发过程的稳定性、资源利用率等问题

基于机器学习系统、云原生、云计算架构等多个角度做技术问题解决和探索
覆盖机器学习系统多个子方向领域的工作,包括:资源调度、任务编排、模型训练、模型管理、数据集管理、工作流编排、ML for System等

优先资格

熟悉分布式系统原理,参与过大规模分布式系统的设计、开发和维护优先

有机器学习平台研发经验, 有大规模训练任务和推理服务的编排、在离线混部及资源调度经验者优先
了解 Pytorch/Tensorflow/JAX/PaddlePaddle/Mindspore等机器学习框架、GPU/NPU/ARM等最新异构计算系统与架构、RDMA高性能网络, 有相关系统研发经验者优先

AI 洞察

优缺点分析

优点

  • 参与前沿AI基础设施研发,积累大规模分布式系统和ML平台经验,技术价值高
  • 公司处于B轮快速成长期,个人成长空间大,有机会接触核心架构
  • AI行业持续火热,薪资竞争力强,且岗位稀缺,跳槽前景好
  • 团队技术氛围浓厚,能接触到GPU、RDMA等先进硬件和系统设计
  • 该职位适合对系统底层技术充满热情、乐于钻研分布式和ML基础设施的应届生,具备扎实的编程基础和Linux知识,愿意在AI工程化方向深耕

缺点 / 挑战

  • 涉及技术栈广泛,对分布式系统、容器、ML框架均有较高要求,学习曲线陡峭
  • 平台研发需要与算法、产品等多方协作,沟通协调成本较高
  • AI系统稳定性与性能优化极具挑战,可能需要应对线上复杂问题

角色解读

  • 从ML系统研发工程师成长为架构师,主导平台设计与技术演进
  • 横向拓展至AI Infra、高性能计算或云计算领域,成为技术专家
  • 纵向深入资源调度、模型优化或ML for System等细分方向,成为该领域领军人物
  • 设计并实现机器学习平台的基础设施,包括资源调度、任务编排、模型训练等系统组件
  • 与算法团队协作,优化训练和推理效率,提升资源利用率与系统稳定性
  • 探索云原生和分布式系统在ML领域的应用,解决大规模AI系统挑战
  • 参与ML for System方向的研究,利用机器学习优化系统自身性能
  • 扎实的编程能力,精通Golang、Python或C/C++中的至少一种
  • 深入理解Linux系统、操作系统原理和分布式系统概念
  • 熟悉容器化技术(Docker、Kubernetes),具备实践经验
  • 了解机器学习框架(如Pytorch、TensorFlow)和GPU/NPU等异构计算架构

申请策略

  • 了解MiniMax的产品方向(如AI助手、多模态模型),在面试中展现对业务场景的理解
  • 准备1-2个技术深度项目,能清晰讲述设计目标和权衡,体现系统思维
  • 突出分布式系统项目经验,如参与过大规模集群调度、数据管道或微服务架构
  • 强调容器化实践经验,包括Docker和Kubernetes的使用或二次开发
  • 展示机器学习框架的使用或修改经历,如Pytorch模型训练调优
  • 如有开源贡献(尤其与ML系统相关),务必列出
  • 补习Kubernetes调度原理和Operator模式,掌握其扩展机制
  • 学习机器学习训练流程(数据加载、分布式训练、模型管理),了解MLOps概念

面试指南

  • 对于架构设计类问题,先明确需求,再拆解模块(调度、存储、容错),最后讨论关键权衡(如一致性vs性能)
  • 对于故障排查类问题,采用“现象→可能原因→验证方法→解决措施”的结构,体现系统性思维
  • 请简述Kubernetes Pod调度流程及如何自定义调度器?
  • 设计一个分布式训练任务调度系统,需要考虑哪些关键因素?
  • 你在项目中遇到过哪些分布式系统一致性问题?如何解决?
  • 解释GPU显存管理机制,如何防止OOM?
  • 如何理解ML for System?举例说明一个应用场景
  • 复习Kubernetes核心概念(Pod、Service、Deployment等),熟悉kube-scheduler源码更佳

职位点评

74
综合评分

AI Infra核心岗,前沿技术栈,高成长高薪资,但WLB一般需现场办公。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术成长和行业前沿的求职者,愿意接受较高工作强度换取快速职业发展。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70

薪资福利

75中等

薪资具有竞争力(预计20k-30k/月),B轮公司期权或有空间,但未明确福利,整体补偿性较好。

薪资信号偏高 (20K-30K/月)

成长发展

90较高

技术栈前沿(云原生、GPU、分布式ML),能深度参与AI平台核心研发,成长性极强。

技术前沿前沿/新兴技术
技术栈Golang、Kubernetes、Pytorch、GPU、RDMA、分布式系统
业务类型ambiguous

工作生活

50较低

需要现场办公,地点上海/北京,通勤压力大,未提及WLB措施,可能加班较多。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施提升行业效率,具有一定社会价值,但职位在商业层面属于基础平台,不直接面向用户。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs