
美团
无人车业务部-多模态大模型Infra工程师
无人车业务部-多模态大模型Infra工程师
发布于 大约 13 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Deepspeed
Pytorch
Tensorrt
Vllm
世界模型
分布式训练
多模态大模型
推理加速
数据Pipeline
AI 估算 · 35k–65k
AI大模型基础设施方向,北京大厂,硕士+1-5年经验,薪资竞争力强。
职位详情
关于这个职位
作为美团无人车业务部的多模态大模型Infra工程师,你将负责构建和优化世界模型的训练与推理基础设施,涵盖分布式训练、推理加速、数据Pipeline等核心技术
与顶尖算法团队紧密协作,将前沿研究成果高效落地到实际产品中,支撑自动配送场景下的智能决策
最低要求
计算机科学、软件工程等相关专业硕士及以上学历,1-5年相关工作经验
扎实的系统工程能力,精通Python,熟悉C++/CUDA,具备高性能计算或系统优化经验
熟悉主流深度学习框架(PyTorch)的训练与推理流程,有大模型/生成模型训练或推理优化的实际经验
熟悉分布式训练技术(DeepSpeed、FSDP、Megatron-LM等)或推理加速技术(TensorRT、vLLM、Triton等)中的至少一项
具备大规模数据处理能力,熟悉数据Pipeline构建工具(Spark、Ray、Airflow等),有处理TB级以上多模态数据的经验
良好的工程习惯,重视代码质量、系统可靠性和可维护性
工作职责
负责世界模型训练与推理基础设施的建设与优化,支撑大规模生成模型(扩散模型、视频生成模型等)的高效训练与部署
设计和优化分布式训练方案,包括数据并行、模型并行、流水线并行等策略,提升多节点多卡训练的吞吐效率和稳定性
构建高性能模型推理服务,针对生成模型特点进行推理加速优化(量化、算子融合、显存优化、批处理调度等),满足离线批量生成和在线服务的性能需求
搭建并维护端到端的数据Pipeline,覆盖大规模多模态数据(图像、视频、点云)的采集、清洗、标注、存储与高效加载,保障训练数据的质量和供给效率
与算法工程师紧密协作,将前沿算法研究成果高效工程化落地,推动从原型验证到生产级部署的全流程
AI 洞察
优缺点分析
优点
- 技术前沿:多模态大模型和世界模型是当前AI领域最热门的方向,能积累极具价值的经验
- 平台优势:美团无人车团队有行业顶尖成员和丰富场景,数据和应用落地机会多
- 成长空间:岗位涉及训练、推理、数据全链路,技术深度和广度都有很大提升
- 薪资竞争力:大厂高薪,且AI Infra人才稀缺
- 技术复杂度高:需要同时掌握分布式训练、推理优化、数据处理等多领域知识,学习曲线陡
缺点 / 挑战
- 工作强度可能较高:互联网大厂节奏快,且基础设施问题可能需要随时响应,有一定压力
- 业务压力:支撑核心业务,需要快速迭代,对工程化能力和稳定性要求高
- 适合热爱底层技术、喜欢挑战大规模系统问题,对AI基础设施有浓厚兴趣的资深工程师,尤其是有分布式系统和性能优化经验的人
角色解读
- 从Infra工程师向AI基础设施专家或架构师发展,成为大模型训练/推理平台的核心负责人
- 可转向算法团队,凭借对底层的深入理解,从事模型优化或前沿算法研究
- 在无人车和自动驾驶领域深耕,成为智能系统的关键角色,技术影响力辐射全公司
- 负责多模态大模型(如世界模型、扩散模型)训练和推理基础设施的搭建与优化,确保大规模训练高效稳定
- 设计和实现分布式训练方案,包括数据并行、模型并行、流水线并行等,提升多节点多卡训练吞吐
- 构建高性能推理服务,通过量化、算子融合、显存优化等手段加速生成模型的在线和离线推理
- 搭建端到端数据Pipeline,处理图像、视频、点云等海量多模态数据,支撑训练数据供给
- 扎实的编程能力:精通Python,熟悉C++/CUDA,能进行高性能计算和系统优化
- 深度学习框架:熟悉PyTorch训练和推理流程,有大模型或生成模型实际优化经验
- 分布式技术:掌握DeepSpeed、FSDP、Megatron-LM等至少一种分布式训练框架,或推理加速工具如TensorRT、vLLM
- 数据处理:熟悉Spark、Ray、Airflow等数据Pipeline工具,有TB级多模态数据处理经验
申请策略
- 了解美团无人车业务和自动配送场景,面试中展示对技术如何落地到实际业务的思考
- 准备好系统设计题,尤其是分布式训练和推理服务架构设计
- 突出大模型或生成模型训练/推理优化的实际项目,量化性能提升(如吞吐、延迟指标)
- 详细描述分布式训练实践,如使用DeepSpeed/FSDP的经验,包括模型规模、集群规模、遇到的问题
- 展示系统底层优化能力,如CUDA编程、算子融合、显存优化等具体案例
- 强调数据处理能力,特别是TB级多模态数据的处理经验
- 精通PyTorch底层机制,熟悉torch.distributed和collective communication
- 学习NVIDIA工具链,如TensorRT、Triton Inference Server,并动手实践
面试指南
- STAR法则:描述情景、任务、行动和结果,突出量化成果
- 问题拆解法:先识别瓶颈,再针对性优化,并权衡利弊
- 经验结合原理:解释技术背后的原理,展示深度理解
- 请描述你设计过的分布式训练方案,如何解决通信瓶颈和负载不均衡?
- 如何优化一个大模型的推理延迟?请给出具体的加速方法
- 如果训练数据规模达到TB级,你会如何构建数据Pipeline来保证高效加载?
- 介绍一下你对PyTorch中DDP和FSDP的理解,它们有什么区别和适用场景?
- 如何保证训练任务的稳定性和容错?
职位点评
75
综合评分
前沿技术、高成长性,薪资优厚但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、希望在AI基础设施领域快速成长,能接受现场办公和一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展92
工作生活55
使命价值75
薪资福利
72中等
薪资未明确披露,但美团作为大厂,AI基础设施岗位薪酬通常具有较强竞争力,且福利体系完善。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
92较高
岗位涉及多模态大模型、世界模型等前沿技术,与顶尖团队合作,有极佳的技术成长空间和挑战性。
技术前沿前沿/新兴技术
技术栈PyTorch、DeepSpeed、TensorRT、vLLM、分布式训练、推理加速、多模态大模型、世界模型
业务类型ambiguous
工作生活
55较低
仅现场办公,未提及弹性工作或远程,北京工作节奏可能较快,WLB信号不明确。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
参与自动配送和即时零售升级,技术落地场景具有社会价值,但岗位偏基础设施,社会影响力间接。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
美团 的其他在招职位
相似职位推荐
Watch Jobs