
美团
机器学习平台研发工程师
机器学习平台研发工程师
发布于 大约 8 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
学历未注明
软件工程
Hudi
Pytorch
Tensorflow
云原生
AI 估算 · 30k–55k
美团是上市巨头,机器学习平台研发属于高薪技术岗,参考北京市场,中级经验薪资范围在30-55k/月,考虑股票等。
职位详情
关于这个职位
作为机器学习平台研发工程师,你将参与建设美团核心的机器学习平台,涵盖特征工程、算法开发流水线、训练任务调度以及模型服务部署等全流程
你将面对百亿级数据、万亿级推理调用的技术挑战,与顶尖工程师一起推动算法工程实践和效率提升
最低要求
计算机基础知识良好,熟悉Java/Python/C++之一,对机器学习感兴趣
对后台开发技术栈有深刻理解,有较强抽象能力,有大型系统开发经历
具有主流深度学习引擎和大数据计算引擎(包括但不限于TensorFlow/PyTorch、Spark/Flink、Hudi/Iceberg等)的实际应用经验和原理了解,有引擎优化或平台化的经历
有较强的技术好奇心和自驱力,了解行业最佳实践
工作职责
建设特征/样本工程,设计包括从特征打印到特征服务的完整实时+离线特征/样本生产流程,设计大规模分布式特征存储系统,支撑百亿级数据实时处理,提升特征/样本的生产效率、质量和访问性能,进而提升算法迭代效率和效果
对算法开发过程进行抽象,将常用的机器学习、深度学习过程沉淀为组件,建设算法开发pipeline,设计代码与可视化组件相结合的编程范式,提供便捷稳固的一站式环境托管,提升算法迭代效率
建设训练任务的托管能力,设计异构、多地域、多系统资源池、多租户分组的实验编排调度系统,建立模型实验效果评估体系,支撑几十个业务线、千级模型同时进行训练,保障模型及时产出,提升资源利用率,帮助业务优化模型效果
探索云原生下的模型服务部署架构,设计高可用、多角色的模型服务框架,制定流量分发、模型/服务治理策略,支撑万亿级推理调用量,提升模型部署成功率、推理请求成功率和性能
AI 洞察
优缺点分析
优点
- 美团核心平台,业务场景丰富(外卖、酒旅、配送等),数据量大,有足够的成长空间
- 团队技术氛围浓厚,有丰富的学习资源和社区贡献,适合持续学习
- 上市大公司,薪资福利稳定,且有期权等长期激励
- 工作强度较大,需要应对复杂的在线服务和海量数据处理,可能需要弹性工作
缺点 / 挑战
- 参与超大规模分布式系统建设,技术挑战极高,有利于个人技术积累
- 技术要求全面,不仅要懂工程,还要对机器学习算法有深入理解,入门门槛较高
- 平台研发需要与多个业务线协作,沟通协调成本较高
- 适合有扎实工程背景、对机器学习平台感兴趣、喜欢挑战高并发和分布式系统的后端工程师,尤其是希望在算法工程化方向深入发展的候选人
角色解读
- 技术深耕:从平台研发工程师成长为领域专家,主导核心组件设计与优化
- 架构演进:转向系统架构师,负责机器学习平台的顶层架构和演进路线
- 管理方向:带领团队负责机器学习平台的多个模块,晋升为技术经理或负责人
- 设计并实现大规模特征工程系统,处理百亿级实时数据,提升特征生产效率和质量
- 抽象算法开发流程,构建可复用的机器学习pipeline组件,提供可视化编程环境
- 搭建分布式训练任务调度平台,管理多资源池、多租户的模型训练,保障千级模型同时运行
- 探索云原生模型服务架构,设计高可用推理服务框架,支撑万亿级调用量
- 精通至少一种编程语言(Java/Python/C++),具备扎实的计算机基础
- 深入理解分布式系统、大数据计算引擎(Spark/Flink等)和深度学习框架(TF/PyTorch)
- 具备大型系统开发经验,有良好的抽象能力和系统设计能力
- 对MLOps和云原生技术有了解,熟悉容器化、Kubernetes等
申请策略
- 提前了解美团的业务和技术栈,面试时展现对平台价值的认同
- 准备一个完整的项目案例,从问题定义、架构设计到落地效果的详细阐述
- 重点突出大型分布式系统的开发经验,尤其是特征工程、训练平台或推理服务相关项目
- 展示对深度学习框架和大数据引擎的实际应用与优化经历,如调优、二次开发等
- 体现技术好奇心,如在开源社区的贡献、技术博客或个人项目
- 强调结果导向,用具体数据说明系统性能提升或效率改进
- 如果对MLOps不熟悉,可以学习Kubeflow、MLflow等平台工具
- 深入理解Spark/Flink的内部机制,尝试阅读源码或进行性能调优
面试指南
- 对于系统设计题,先明确需求和约束,然后给出分层架构,并解释关键决策(如选型、容错、扩展性)
- 对于性能优化,用具体案例说明问题定位、分析瓶颈、提出优化方案并量化效果
- 对于开放性概念题,先给出定义,然后结合自己的实际经验阐述,并举例子
- 请设计一个实时特征计算系统,支持百亿级数据,如何保证低延迟和高可用?
- 如何优化Spark/Flink的作业性能?请举例说明
- 在TensorFlow/PyTorch分布式训练中,如何处理数据并行和模型并行的通信开销?
- 你如何设计一个实验调度系统,支持多租户和资源隔离?
- 说说你对MLOps的理解,以及如何评估模型训练的效率和效果
职位点评
70
综合评分
美团核心平台,技术前沿、挑战大、薪资面议,WLB一般,适合技术极客。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和挑战、能够适应高强度工作的求职者,不太适合追求工作生活平衡的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值60
薪资福利
75中等
美团作为上市大厂,薪资待遇在行业内具有竞争力,但JD未明确薪资,需面议;福利方面未提及具体项。
薪资信号面议 (30K-55K/月)
成长发展
90较高
岗位涉及最前沿的机器学习平台技术,技术挑战大,团队学习氛围浓厚,有明确的成长路径,并且JD提到“参与大模型算法工程建设”等前沿方向。
技术前沿前沿/新兴技术
技术栈分布式存储、实时特征、MLOps、云原生、Kubernetes、大模型
成长机会技术氛围、学习生态圈、非线形成长
业务类型ambiguous
工作生活
40较低
JD未提及弹性工作或远程,工作地点在北京,可能需要现场办公;没有WLB相关信息,互联网公司通常有一定压力。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
岗位属于美团核心业务的技术平台,对零售+科技战略有支撑作用,但直接社会贡献不明显;行业属于互联网生活服务,稳定增长。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
美团 的其他在招职位
相似职位推荐
Watch Jobs