Meituan logo
美团
无人车业务部-多模态大模型Infra工程师

无人车业务部-多模态大模型Infra工程师

发布于 大约 13 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Deepspeed
Pytorch
Tensorrt
Vllm
世界模型
分布式训练
多模态大模型
推理加速
数据Pipeline

AI 估算 · 35k–65k

AI大模型基础设施方向,北京大厂,硕士+1-5年经验,薪资竞争力强。

职位详情

关于这个职位

作为美团无人车业务部的多模态大模型Infra工程师,你将负责构建和优化世界模型的训练与推理基础设施,涵盖分布式训练、推理加速、数据Pipeline等核心技术

与顶尖算法团队紧密协作,将前沿研究成果高效落地到实际产品中,支撑自动配送场景下的智能决策

最低要求

计算机科学、软件工程等相关专业硕士及以上学历,1-5年相关工作经验

扎实的系统工程能力,精通Python,熟悉C++/CUDA,具备高性能计算或系统优化经验
熟悉主流深度学习框架(PyTorch)的训练与推理流程,有大模型/生成模型训练或推理优化的实际经验
熟悉分布式训练技术(DeepSpeed、FSDP、Megatron-LM等)或推理加速技术(TensorRT、vLLM、Triton等)中的至少一项
具备大规模数据处理能力,熟悉数据Pipeline构建工具(Spark、Ray、Airflow等),有处理TB级以上多模态数据的经验
良好的工程习惯,重视代码质量、系统可靠性和可维护性

工作职责

负责世界模型训练与推理基础设施的建设与优化,支撑大规模生成模型(扩散模型、视频生成模型等)的高效训练与部署

设计和优化分布式训练方案,包括数据并行、模型并行、流水线并行等策略,提升多节点多卡训练的吞吐效率和稳定性
构建高性能模型推理服务,针对生成模型特点进行推理加速优化(量化、算子融合、显存优化、批处理调度等),满足离线批量生成和在线服务的性能需求
搭建并维护端到端的数据Pipeline,覆盖大规模多模态数据(图像、视频、点云)的采集、清洗、标注、存储与高效加载,保障训练数据的质量和供给效率
与算法工程师紧密协作,将前沿算法研究成果高效工程化落地,推动从原型验证到生产级部署的全流程

AI 洞察

优缺点分析

优点

  • 技术前沿:多模态大模型和世界模型是当前AI领域最热门的方向,能积累极具价值的经验
  • 平台优势:美团无人车团队有行业顶尖成员和丰富场景,数据和应用落地机会多
  • 成长空间:岗位涉及训练、推理、数据全链路,技术深度和广度都有很大提升
  • 薪资竞争力:大厂高薪,且AI Infra人才稀缺
  • 技术复杂度高:需要同时掌握分布式训练、推理优化、数据处理等多领域知识,学习曲线陡

缺点 / 挑战

  • 工作强度可能较高:互联网大厂节奏快,且基础设施问题可能需要随时响应,有一定压力
  • 业务压力:支撑核心业务,需要快速迭代,对工程化能力和稳定性要求高
  • 适合热爱底层技术、喜欢挑战大规模系统问题,对AI基础设施有浓厚兴趣的资深工程师,尤其是有分布式系统和性能优化经验的人

角色解读

  • 从Infra工程师向AI基础设施专家或架构师发展,成为大模型训练/推理平台的核心负责人
  • 可转向算法团队,凭借对底层的深入理解,从事模型优化或前沿算法研究
  • 在无人车和自动驾驶领域深耕,成为智能系统的关键角色,技术影响力辐射全公司
  • 负责多模态大模型(如世界模型、扩散模型)训练和推理基础设施的搭建与优化,确保大规模训练高效稳定
  • 设计和实现分布式训练方案,包括数据并行、模型并行、流水线并行等,提升多节点多卡训练吞吐
  • 构建高性能推理服务,通过量化、算子融合、显存优化等手段加速生成模型的在线和离线推理
  • 搭建端到端数据Pipeline,处理图像、视频、点云等海量多模态数据,支撑训练数据供给
  • 扎实的编程能力:精通Python,熟悉C++/CUDA,能进行高性能计算和系统优化
  • 深度学习框架:熟悉PyTorch训练和推理流程,有大模型或生成模型实际优化经验
  • 分布式技术:掌握DeepSpeed、FSDP、Megatron-LM等至少一种分布式训练框架,或推理加速工具如TensorRT、vLLM
  • 数据处理:熟悉Spark、Ray、Airflow等数据Pipeline工具,有TB级多模态数据处理经验

申请策略

  • 了解美团无人车业务和自动配送场景,面试中展示对技术如何落地到实际业务的思考
  • 准备好系统设计题,尤其是分布式训练和推理服务架构设计
  • 突出大模型或生成模型训练/推理优化的实际项目,量化性能提升(如吞吐、延迟指标)
  • 详细描述分布式训练实践,如使用DeepSpeed/FSDP的经验,包括模型规模、集群规模、遇到的问题
  • 展示系统底层优化能力,如CUDA编程、算子融合、显存优化等具体案例
  • 强调数据处理能力,特别是TB级多模态数据的处理经验
  • 精通PyTorch底层机制,熟悉torch.distributed和collective communication
  • 学习NVIDIA工具链,如TensorRT、Triton Inference Server,并动手实践

面试指南

  • STAR法则:描述情景、任务、行动和结果,突出量化成果
  • 问题拆解法:先识别瓶颈,再针对性优化,并权衡利弊
  • 经验结合原理:解释技术背后的原理,展示深度理解
  • 请描述你设计过的分布式训练方案,如何解决通信瓶颈和负载不均衡?
  • 如何优化一个大模型的推理延迟?请给出具体的加速方法
  • 如果训练数据规模达到TB级,你会如何构建数据Pipeline来保证高效加载?
  • 介绍一下你对PyTorch中DDP和FSDP的理解,它们有什么区别和适用场景?
  • 如何保证训练任务的稳定性和容错?

职位点评

75
综合评分

前沿技术、高成长性,薪资优厚但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿、希望在AI基础设施领域快速成长,能接受现场办公和一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展92
工作生活55
使命价值75

薪资福利

72中等

薪资未明确披露,但美团作为大厂,AI基础设施岗位薪酬通常具有较强竞争力,且福利体系完善。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

92较高

岗位涉及多模态大模型、世界模型等前沿技术,与顶尖团队合作,有极佳的技术成长空间和挑战性。

技术前沿前沿/新兴技术
技术栈PyTorch、DeepSpeed、TensorRT、vLLM、分布式训练、推理加速、多模态大模型、世界模型
业务类型ambiguous

工作生活

55较低

仅现场办公,未提及弹性工作或远程,北京工作节奏可能较快,WLB信号不明确。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

参与自动配送和即时零售升级,技术落地场景具有社会价值,但岗位偏基础设施,社会影响力间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs