Ant Group logo
蚂蚁集团
蚂蚁集团-具身智能推理优化与算子开发工程师-上海

蚂蚁集团-具身智能推理优化与算子开发工程师-上海

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Nccl
Tensorrt
Trt-Llm
具身智能
多模态模型
并行计算
深度学习推理
Gpu性能优化

AI 估算 · 35k–65k

具身智能前沿方向,蚂蚁平台大,技术要求高,薪资竞争力强,资深优化岗位月薪可达5万左右。

职位详情

关于这个职位

该职位负责蚂蚁集团具身智能、多模态VLA/VLM及机器人策略模型的推理优化与算子开发

你将专注于CUDA/C++高性能算子设计、GPU端到端性能优化,以及TensorRT/TRT-LLM等推理引擎的部署流程打通
适合对底层性能优化有浓厚兴趣、熟悉GPU并行计算的工程师,能接触到前沿的具身智能技术落地场景

最低要求

计算机及相关专业,本科及以上学历

具备扎实的 C/C++ 编程能力,良好的数据结构和算法基础
理解操作系统、计算机体系结构和 GPU 并行计算基础
熟悉 CUDA 编程,有性能分析和优化经验
熟悉 TensorRT/TRT-LLM,或其他 LLM 推理优化相关算子库
具备良好的团队沟通、协作能力和责任心

工作职责

面向具身智能、多模态 VLA/VLM、机器人策略模型等推理场景,设计并实现高性能 CUDA/C++ 算子

针对 H系列 GPU 与 RTX 4090 等硬件平台,进行端到端推理性能优化,包括延迟、吞吐、显存占用和稳定性优化
打通具身模型推理机部署流程,支持模型导出、量化、TensorRT/TRT-LLM 编译、服务化部署与性能 profiling
有 LLM/VLM/VLA 推理链路中的关键模块的优化经验,包括 attention、KV cache、视觉编码器、动作头、后处理等
针对跨卡、跨机推理通信场景,开发和优化 NCCL/RDMA/NVLink/PCIe 相关通信算子与调度策略

优先资格

加分项:

有 ICPC、ASC、OI、MO 等竞赛获奖经历
有 CUDA kernel、TensorRT plugin、Triton kernel 或通信算子开发经验
有具身智能、机器人、多模态模型推理部署经验

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大,技术资源丰富,能接触顶尖的AI基础设施
  • 具身智能是未来AI重要方向,技术壁垒高,职业发展前景好
  • 工作中涉及CUDA、TensorRT等底层优化,技能含金量高,市场认可度强
  • 对底层技术深度要求极高,需要精通CUDA和性能优化,学习曲线陡峭
  • 跨团队协作和多硬件平台适配需求,要求较强的沟通和问题解决能力

缺点 / 挑战

  • 团队协作与技术氛围浓厚,适合热爱挑战的工程师
  • 高性能优化工作迭代快、压力大,可能面临较多的调试与调优任务
  • 适合对GPU并行计算和推理优化有浓厚兴趣,具备扎实底层功底的工程师,能适应高强度技术挑战

角色解读

  • 在具身智能和AI推理优化领域积累前沿技术,成为GPU高性能计算专家
  • 可向技术专家或架构师方向发展,负责核心推理引擎的架构设计与优化
  • 有机会深入多模态大模型和机器人AI的落地场景,拓宽技术广度
  • 设计和实现高性能CUDA/C++算子,用于具身智能、VLA/VLM等模型的推理加速
  • 针对H系列GPU和RTX 4090等硬件平台,优化推理延迟、吞吐、显存占用和稳定性
  • 打通模型部署流程,包括导出、量化、TensorRT/TRT-LLM编译、服务化部署和性能分析
  • 开发跨卡跨机通信优化,涉及NCCL/RDMA/NVLink/PCIe等底层通信技术
  • 扎实的C/C++编程能力,熟悉数据结构和算法
  • 深入理解计算机体系结构、操作系统和GPU并行计算原理
  • 精通CUDA编程,具备性能分析和调优的实际经验
  • 熟悉TensorRT/TRT-LLM或其他LLM推理优化库,了解推理链路的关键模块

申请策略

  • 关注蚂蚁在具身智能和AI基础设施方面的业务布局,在简历中表达兴趣和匹配度
  • 准备项目作品集,展示性能优化的量化成果和技术深度
  • 突出CUDA编程经验和具体性能优化案例(如延迟降低、吞吐提升等量化结果)
  • 展示TensorRT/TRT-LLM或其他推理引擎的使用经验,以及部署流程的完整项目
  • 如果有竞赛获奖经历(ICPC、ASC等),务必突出
  • 强调对计算机体系结构、操作系统等底层知识的掌握
  • 系统学习CUDA编程模型和GPU架构,实践kernel编写与性能调优
  • 熟悉TensorRT/TRT-LLM的API和原理,了解量化、图优化等关键技术

面试指南

  • 用STAR法则回答项目经历:情境-任务-行动-结果,突出个人贡献和技术细节
  • 对于原理性问题,先讲核心概念,再结合具体实现和权衡,最后提优化方向
  • 性能优化问题,先定位瓶颈(profiling),再分层优化(算法、访存、并行度),最后验证收益
  • 请介绍一个你做过的最成功的CUDA性能优化案例,具体做了什么?如何量化结果?
  • 解释FlashAttention的原理和优势,如何用CUDA实现一个简单版本?
  • TensorRT和TRT-LLM的优化流程有哪些?如何针对具体模型进行优化?
  • 在多卡推理场景下,如何优化NCCL通信?遇到过哪些问题?
  • 给定一个内存访问不连续的kernel,你会如何分析并优化?

职位点评

68
综合评分

具身智能前沿方向,技术含量高,薪资竞争力强,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长和前沿挑战的求职者,愿意投入高强度的底层优化工作,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展92
工作生活40
使命价值70

薪资福利

65中等

JD未明确薪资和福利,但蚂蚁集团作为行业巨头,通常提供有竞争力的薪酬和福利,但具体数值未知。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

92较高

该岗位聚焦具身智能、多模态模型等前沿领域,涉及CUDA、TensorRT等底层技术,技能成长空间很大,属于极具发展潜力的方向。

技术前沿前沿/新兴技术
技术栈CUDA、TensorRT、TRT-LLM、具身智能、VLA、NCCL、GPU优化
业务类型ambiguous

工作生活

40较低

工作地点上海,JD未提及远程或弹性办公,推测为现场办公。高性能优化岗位可能工作强度较大,但无明确WLB信息。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

具身智能是AI领域的前沿方向,具有很高的技术价值和社会影响潜力,但JD未特别强调使命感或行业愿景。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs