Ant Group logo
蚂蚁集团
蚂蚁集团-端侧异构计算工程师-具身智能方向

蚂蚁集团-端侧异构计算工程师-具身智能方向

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Onnxruntime
Tensorrt
具身智能
大模型推理
异构计算
性能优化
深度学习
Gpu/Npu/Dsp

AI 估算 · 40k–70k

上海大厂高级AI工程师,5年经验,技能稀缺,市场薪资偏高,15薪左右。

职位详情

关于这个职位

参与蚂蚁集团端侧AI推理引擎的研发,负责将大模型和视觉算法高效部署到嵌入式硬件平台,通过异构计算优化GPU/NPU/DSP等核心性能

工作内容涵盖推理引擎开发、性能分析与调优、以及下一代机器人OS架构探索
适合对底层系统优化和AI基础设施有浓厚兴趣的工程师

最低要求

计算机相关专业本科以上学历,在NPU、GPU等异构计算方面有5年以上工作经验

扎实的编程功底,熟悉C++、Python等编程语言,具备良好的数据结构、算法基础和规范的工程化能力
掌握深度学习/计算机视觉基本原理,熟悉至少一种机器学习推理框架如TensorRT、ONNXRuntime、vLLM、SGLang或者其他自研框架,熟悉常用的图像处理算法及其硬件加速技巧
熟悉性能建模、性能分析与优化,深度参与过端侧模型的异构计算优化工作,具备出色的问题分析与解决能力
具备良好的团队合作能力,能够跨团队协作推动项目进展

工作职责

参与行业领先的算法模型在嵌入式硬件平台的落地,构建统一的端侧异构推理引擎,适配算法到GPU/NPU/DSP等异构加速核,向上提供统一的调用接口,内部完成高效稳定的算法实现

端侧异构算法调度引擎的开发,利用多核异构芯片的加速器,从图像处理、视频编解码、集合通信、模型推理等全局视角,充分发挥GPU/DSP/CPU/PVA等异构平台的算力,并且结合算法逻辑持续优化调度框架的静态编译能力、动态调度能力
采用Profiling工具(如Nsys/Perf/火焰图等),对AI系统进行软硬综合调优、系统级性能分析和瓶颈定位,并基于硬件特性和算法演进方向进行软件适配和优化
洞察大模型的发展趋势和技术演进,结合业务发展,为下一代机器人OS提供架构改进方案

优先资格

加分项:

熟悉NVIDIA编译优化技术栈底层原理,如cutlass、cute、triton等工具
掌握大模型相关计算优化技术,如FlashAttention、FlashDecoding、计算通信Overlap等
有大模型推理引擎优化经验,包括并行计算、图优化、内存管理及低比特计算等技术
扎实的计算优化理论基础和高性能计算系统优化实践经验

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大,业务场景丰富,具身智能是前沿方向,技术成长空间大
  • 涉及底层硬件和AI结合,技能壁垒高,市场稀缺性强
  • 团队氛围和技术氛围通常较浓,可接触前沿的大模型优化技术
  • 薪资和福利在业内具有竞争力
  • 异构计算领域技术栈深,需要持续学习和跟进硬件演进
  • 端侧资源受限,优化难度大,对问题定位和分析能力要求高

缺点 / 挑战

  • 工作强度可能较高,需要应对复杂的技术难题和紧急上线压力
  • 适合对底层系统优化充满热情、喜欢挑战高性能计算难题、并愿意在AI基础设施领域长期深耕的工程师

角色解读

  • 技术深耕方向:成为端侧AI计算优化领域的专家,主导核心推理引擎的设计与演进
  • 管理方向:带团队负责整个端侧计算平台,从工程师晋升为技术负责人
  • 横向拓展:向机器人操作系统架构师或AI基础设施架构师方向发展
  • 负责将AI算法模型(如大模型、视觉模型)部署到嵌入式硬件平台,开发统一的端侧异构推理引擎
  • 利用GPU/NPU/DSP等多核异构芯片的加速能力,进行图像处理、视频编解码、模型推理等全链路性能优化
  • 使用Profiling工具进行系统级性能分析,定位瓶颈并实施软硬协同调优
  • 结合大模型趋势和业务需求,为下一代机器人操作系统提供架构改进方案
  • 扎实的C++和Python编程能力,精通数据结构和算法,具备规范的工程化能力
  • 熟悉至少一种推理框架(如TensorRT、ONNXRuntime、vLLM等),并理解其底层实现
  • 熟悉GPU/NPU/DSP等硬件架构,掌握性能建模与分析方法,有实际异构计算优化经验
  • 具备深度学习和计算机视觉基本知识,熟悉常用图像处理算法及硬件加速技巧

申请策略

  • 了解蚂蚁集团在具身智能和机器人方向的最新布局,在面试中展现对该领域的热情和见解
  • 准备1-2个深入的项目故事,详细描述问题背景、分析过程、优化方案和量化结果
  • 突出异构计算项目经历,如使用TensorRT/ONNXRuntime做模型加速的具体成果(延迟、吞吐提升)
  • 强调C++/Python编程功底和系统级调优能力,展示在Profiling和性能瓶颈定位方面的实战案例
  • 如果有大模型推理优化(如FlashAttention、vLLM)经验,务必重点体现
  • 展示对硬件架构(GPU/NPU/DSP)的理解,以及跨团队协作推动项目的经验
  • 补充NVIDIA编译优化技术栈(如CUDA、cutlass、cute)的知识,加深对底层原理的理解
  • 学习主流大模型推理引擎的源码,掌握并行计算、内存管理、低比特计算等优化技术

面试指南

  • 回答技术问题时,建议采用STAR结构(情境-任务-行动-结果),突出量化指标
  • 对于系统设计题,先明确约束(算力、内存、功耗),再分模块讨论方案
  • 展示思考过程比给出最终答案更重要,要体现分析问题的逻辑性
  • 请讲讲你过去做过的端侧模型优化项目,遇到了哪些瓶颈,如何定位和解决的?
  • 如何选择GPU/NPU/DSP不同的加速核来分配任务?请举例说明你的调度策略
  • 你如何理解FlashAttention?它在端侧部署时有什么挑战?
  • 在资源受限的嵌入式平台上,如何平衡模型精度和推理速度?
  • 介绍一下你对下一代机器人OS架构的看法,端侧计算应如何设计?

职位点评

77
综合评分

前沿技术驱动的端侧AI优化岗,高薪高成长,但工作压力和通勤较普通。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合看重技术成长和薪资回报、能接受高强度工作的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值70

薪资福利

85较高

薪资在市场中位于偏高区间,福利完善,属于高补偿性职位。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

该职位涉及具身智能、大模型、异构计算等前沿技术,学习机会多,成长路径清晰。

技术前沿前沿/新兴技术
技术栈GPU/NPU/DSP、TensorRT、ONNXRuntime、vLLM、FlashAttention、大模型
业务类型ambiguous

工作生活

50较低

工作地点在上海市区,但未提及弹性工作或远程,且技术岗位压力可能较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

具身智能是未来趋势,有一定使命感,但JD未强调社会价值,意义感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs