Ant Group logo
蚂蚁集团
蚂蚁集团-MLOps平台研发专家-具身智能方向

蚂蚁集团-MLOps平台研发专家-具身智能方向

发布于 大约 9 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
平台工程
Mlops
Sglang
Vllm
具身智能
分布式训练
大模型训练
推理优化
机器人

AI 估算 · 40k–70k

蚂蚁集团高级技术岗,具身智能方向稀缺,薪资对标市场高端水平。

职位详情

关于这个职位

这是一个专注于具身智能领域的MLOps平台研发职位,负责将大模型后训练流程产品化,并开发高效的训练与推理工具链

你将面临大规模分布式系统、低延迟推理和异构计算等挑战,推动机器人智能的落地
岗位要求扎实的工程能力和对MLOps生态的深刻理解

最低要求

精通 C++ 或 Python ,熟悉 Linux 开发、Docker/K8s 及微服务架构

年以上机器学习平台或大模型工程经验,具备以下至少一项:
端侧模型异构计算优化(NPU/GPU/CPU)
大规模分布式训练平台(千卡级调度)
生产级推理服务优化(高并发低延迟)
熟悉 TensorRT/ONNXRuntime/vLLM/SGLang 至少一种推理框架
理解 VLA模型(RT-2/π0/OpenVLA)或具备机器人系统(ROS2/仿真)经验

工作职责

负责具身大模型后训练(SFT/蒸馏/RLHF)产品化,优化vLLM/SGLang/自研推理引擎,实现低延迟机器人实时控制

开发MLOps工具链,包括AI资产管理、实验追踪、模型血缘、自动评测,构建数据-模型闭环
搭建大规模弹性训练、推理调度服务,设计机器人后训练与推理SDK,封装C++/Python双语言API,提供完整技术文档

优先资格

平台级开发/优化经验

精通CUTLASS/CUTE/Triton,能手写高性能CUDA算子
掌握 FlashAttention 、计算通信 Overlap 、量化压缩(AWQ/GPTQ)
有 VLLM/DeepSpeed/Megatron-LM 等核心项目开源贡献

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台背书,资源丰富,能接触大规模分布式系统
  • 具身智能是前沿赛道,技术成长空间大,项目含金量高
  • 工作内容覆盖全栈MLOps,技能积累全面,市场稀缺度高
  • 技术栈涉及分布式、推理优化、异构计算,学习曲线陡峭
  • 强依赖C++和底层性能优化,对工程能力要求极高
  • 适合有扎实后端或MLOps经验,对大规模分布式系统和性能优化充满热情,希望在具身智能前沿领域深耕的资深工程师

缺点 / 挑战

  • 业务落地压力大,需快速迭代以适应机器人实时控制需求

角色解读

  • 可向MLOps架构师或具身智能技术负责人方向发展,主导平台设计与演进
  • 有机会成为大模型工程专家,深耕后训练、推理和性能优化
  • 跨领域发展至机器人系统或自动驾驶等方向,拓展技术广度
  • 负责具身大模型后训练流程的产品化,包括SFT、蒸馏和RLHF,优化推理引擎以降低机器人控制延迟
  • 开发MLOps工具链,涵盖资产管理、实验追踪、模型血缘和自动评测,构建数据与模型的闭环迭代
  • 搭建大规模弹性训练与推理调度服务,设计机器人后训练及推理SDK,封装C++/Python双语言API
  • 精通C++或Python,熟悉Linux、Docker/K8s及微服务架构
  • 年以上机器学习平台或大模型工程经验,具备分布式训练、推理优化或异构计算等至少一项专长
  • 熟悉主流推理框架(如vLLM、SGLang、TensorRT)或机器人系统(ROS2)

申请策略

  • 提前了解蚂蚁集团在具身智能方向的布局(如机器人、自动驾驶团队),在面试中展示技术匹配度
  • 准备一个端到端MLOps或推理优化案例,突出技术难点和解决方案
  • 突出MLOps平台建设或大模型训练/推理优化经验,包含具体指标(如吞吐量提升、延迟降低)
  • 强调分布式系统、K8s调度、高性能计算相关项目,展示架构设计能力
  • 如有机器人系统或VLA模型经验,务必重点描述
  • 补充CUDA编程和推理框架(vLLM、TensorRT)实践
  • 学习具身智能基础(如RT-2、ROS2),提升跨领域理解

面试指南

  • 先明确需求场景和约束(延迟、吞吐、成本),再对比不同方案(如框架选型、量化、算子融合),最后给出具体设计
  • 结合项目经验,按“问题-方案-效果”结构展开,量化指标
  • 如何设计一个低延迟的推理服务?请从架构和优化角度说明
  • 解释分布式训练中的通信重叠策略,以及如何实现千卡级调度
  • 你如何定义MLOps工具链的关键组件?请描述一个你参与设计的平台
  • 对vLLM或SGLang的架构了解多少?如何实现PagedAttention?
  • 如果让你优化机器人实时控制模型的推理,你会从哪些方面入手?
  • 复习分布式训练原理(AllReduce、FSDP、Megatron-LM)和推理优化技术(量化、KV Cache、TensorRT)

职位点评

73
综合评分

蚂蚁集团具身智能MLOps专家,前沿技术栈,成长空间大,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合重视技术成长和职业发展的求职者,不介意现场办公和潜在加班。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活40
使命价值70

薪资福利

80较高

蚂蚁集团薪资福利行业领先,但职位未明确薪资,且未提及福利细节。综合判断补偿性动机满足程度较高。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

职位涉及具身智能前沿技术,MLOps全链路开发、分布式系统优化,技能成长空间极大,且蚂蚁集团提供丰富的学习和晋升机会。

技术前沿前沿/新兴技术
技术栈MLOps、vLLM、SGLang、具身智能、分布式训练、推理优化、CUDA
业务类型profit_center

工作生活

40较低

仅现场办公,未提及弹性工作或WLB,大厂研发可能面临较高强度,但蚂蚁集团相对规范。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

具身智能是AI落地的重要方向,蚂蚁集团投入资源,有社会影响力。但职位偏重工程实现,直接使命感不强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs