Meituan logo
美团
训练系统专家

训练系统专家

发布于 大约 3 小时前

中层管理(经理/总监)

北京市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Deepspeed
Fsdp
Gpu
Nccl
Pytorch
Rdma
分布式训练
自动驾驶

AI 估算 · 60k–90k

自动驾驶核心系统、深度学习基础设施方向,技术稀缺,薪资高于市场平均,美团年终奖通常3-4个月。

职位详情

关于这个职位

作为美团无人车训练系统专家,你将负责自动驾驶模型训练效率与算法迭代效率的技术规划与团队管理,主导大规模分布式训练性能优化和训练平台的架构建设

该岗位深度参与多模态大模型、世界模型等下一代技术,是无人车核心基础设施的关键角色

最低要求

计算机、人工智能、软件工程等相关专业本科及以上学历,具有机器学习系统、分布式训练或相关工程经验,有 Tech Lead 或小团队管理经验

深入理解 PyTorch 等主流深度学习框架及分布式训练机制,熟悉 DDP、FSDP、DeepSpeed、Megatron-LM 等技术中的一种或多种
熟悉 Linux、Python,并具备良好的系统开发能力
理解 CUDA、NCCL、RDMA、InfiniBand/RoCE、GPU 架构等相关技术
具备较强的训练性能分析与系统优化能力、技术判断和跨团队推动能力,能够将单点性能问题抽象并沉淀为可复用的平台能力,对最终算法研发效率负责

工作职责

负责自动驾驶模型训练效率与算法迭代效率方向的技术规划和团队管理,持续优化从实验提交、训练执行到评测结果产出的端到端周期

负责大规模分布式训练性能优化,围绕计算、显存、通信、数据加载、存储等环节定位瓶颈,持续提升训练吞吐、GPU 利用率、扩展效率和训练产出
建设和优化统一训练能力,包括但不限于分布式训练框架、训练 Profiling、故障诊断、Checkpoint/容错恢复、实验管理及性能回归分析等工具和平台能力
深入感知、端到端、世界模型等算法研发流程,与算法、数据、存储和算力平台团队协作,推动重点模型训练效率专项并沉淀为通用能力
建立训练效率和研发迭代效率指标体系,以训练耗时、任务成功率、资源利用率、实验迭代周期等指标衡量并持续改善平台效果

AI 洞察

优缺点分析

优点

  • 深度参与自动驾驶与前沿大模型技术结合,技术成长空间大
  • 美团无人车团队背景强,数据规模大,业务落地场景丰富
  • 负责核心ML Infra建设,影响力辐射整个算法团队
  • 薪资和福利在行业内具有竞争力
  • 需要同时具备技术深度和团队管理能力,对综合能力要求高
  • 自动驾驶场景复杂,训练系统优化难度大,需要处理大规模工程问题
  • 与其他团队协作多,需要较强的跨团队推动能力
  • 适合有多年分布式训练经验、希望向技术管理方向发展、对自动驾驶和AI基础设施有热情的工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从技术专家成长为技术管理/架构师,带领更大团队负责核心基础设施
  • 深度学习基础设施方向市场需求大,可延伸至云计算、大模型平台等更广领域
  • 在自动驾驶行业深耕,结合AI Native技术趋势成为行业稀缺人才
  • 负责自动驾驶模型训练系统的整体技术规划与团队管理,优化从实验提交到评测结果的端到端效率
  • 主导大规模分布式训练的性能优化,分析计算、显存、通信等瓶颈,提升GPU利用率和训练吞吐
  • 建设统一训练平台,包括分布式训练框架、故障诊断、容错恢复等工具,并推动跨团队协作
  • 深入理解PyTorch及分布式训练机制,熟悉DDP、FSDP、DeepSpeed等框架
  • 扎实的系统开发能力,熟悉Linux、Python,了解CUDA、NCCL、RDMA等底层技术
  • 具备训练性能分析与系统优化能力,能抽象问题为平台能力并推动落地

申请策略

  • 准备展示你对训练系统效率指标的思考,体现系统性思维
  • 了解美团无人车业务背景和技术栈,面试时结合业务场景回答
  • 突出分布式训练性能优化的具体案例,包括优化前后指标提升
  • 强调管理经验,如带领小团队或技术主导项目的经历
  • 展示对PyTorch、CUDA等底层技术的理解深度
  • 如有自动驾驶相关经验或大模型训练经验,重点提及
  • 如果对RDMA/InfiniBand等网络技术不熟,可以提前学习
  • 了解主流大模型训练框架(如Megatron-LLM)和训练优化前沿

面试指南

  • 对于性能优化问题,应按照'监控-定位-优化-验证'的流程,结合具体数据指标说明
  • 对于系统设计问题,可以提出分层架构,强调可复用性和可观测性
  • 跨团队协作问题,强调沟通机制、目标对齐和迭代式交付
  • 如何定位大规模分布式训练中的性能瓶颈?请举例说明优化思路
  • PyTorch DDP和FSDP的优缺点及适用场景是什么?
  • 如何设计一个可扩展的训练平台,支持多种模型和规模?
  • 你如何协调算法、数据和平台团队,推动训练效率专项落地?
  • 假设训练任务成功率低,你会如何排查和解决?

职位点评

76
综合评分

美团自动驾驶核心系统专家岗,技术前沿、成长空间大,但工作强度和地点灵活性一般

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和职业成长、能接受高强度工作的资深工程师
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活60
使命价值70

薪资福利

75中等

JD未透露具体薪资,但鉴于美团自动驾驶业务的核心地位和专家级岗位,预计薪酬福利具备较强竞争力。

薪资信号未披露(AI估算:60K-90K/月)

成长发展

90较高

岗位深度参与下一代自动驾驶基础模型和AI Native体系建设,技术栈先进,成长空间巨大。

技术前沿前沿/新兴技术
技术栈PyTorch、分布式训练、CUDA、NCCL、RDMA、DeepSpeed、FSDP、多模态大模型、世界模型
业务类型cost_center

工作生活

60中等

仅现场办公,JD未说明弹性工作或加班情况,工作强度大概率较高,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

自动驾驶行业是高速增长赛道,但该岗位更偏技术基础设施,社会直接价值感一般。

行业发展高速增长赛道
社会影响中性/一般
使命信号用科技推动即时零售再升级
创新程度积极采用新技术
Watch Jobs