AgiBot logo
智元机器人
模型推理AI Infra开发工程师

模型推理AI Infra开发工程师

发布于 1 天前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Cuda
Gnn
Mamba
Mlir
Tensorrt
Vllm
算子优化
量化

AI 估算 · 35k–60k

AI Infra方向技术壁垒高,具身机器人赛道热门,上海大厂薪资水平,中高层IC岗位薪资竞争力强。

职位详情

关于这个职位

该职位专注于具身机器人领域的模型推理优化,负责设计轻量化高性能推理框架,开发多模态算子并实施量化工具链

你将深入GPU/NPU底层,通过内存复用、算子融合等策略加速模型推理,同时跟踪VLA、世界模型等前沿算法
适合对AI Infra有激情、熟悉CUDA和推理引擎的技术专家

最低要求

熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验

深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构
熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链
熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等)
熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架

工作职责

设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构

面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略
对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略
实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度)
跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术

AI 洞察

优缺点分析

优点

  • 涉及从算子到框架的全栈优化,技术深度和广度兼备,能快速提升底层能力
  • 公司处于B轮融资阶段,成长空间大,有机会参与核心技术决策
  • 要求的技术栈非常广泛(CUDA、推理引擎、量化、编译等),学习曲线陡峭
  • 具身机器人硬件资源受限,优化需兼顾功耗和实时性,对细节要求极高
  • 赛道竞争激烈,技术迭代快,需持续跟进VLA、世界模型等前沿动态
  • 适合对底层系统充满热情、有极客精神、喜欢从零构建高性能引擎的资深工程师

缺点 / 挑战

  • 身处具身机器人赛道,AI与实际物理世界结合,技术前景广阔且具有挑战性

角色解读

  • 技术深耕:成为AI Infra领域的专家,主导推理框架架构设计与性能调优
  • 横向扩展:向具身机器人全栈技术发展,结合模型算法和硬件实现软硬协同创新
  • 管理路线:未来带领团队负责AI推理引擎的研发,或转向系统架构师角色
  • 设计和开发面向具身机器人的轻量化推理框架,支持CNN、Transformer等多种主流网络结构
  • 针对GPU/NPU进行算子级性能优化,包括内存复用、算子融合、多流并行等加速策略
  • 构建量化工具链,实现INT8/INT4/FP8等混合精度量化,并分析模型推理的时间、功耗和内存瓶颈
  • 跟踪VLA、世界模型等前沿算法,探索KernelGen、投机推理等高效适配技术
  • 精通C/C++/Python,具备丰富的CUDA/OpenCL/CANN编程经验
  • 深入理解至少一种推理引擎(TensorRT、vLLM等)的内部架构和优化方法
  • 熟悉模型量化原理与常见算法(KL散度、LSQ、AWQ等),并能独立实现量化工具链
  • 掌握AI编译框架(MLIR、Triton、IREE等),了解算子调度与代码生成

申请策略

  • 了解智元机器人的具体产品和路线,思考你的技能如何推动具身智能落地
  • 准备一个技术分享,展示你在推理优化方面的深度思考,而非罗列技能
  • 突出CUDA/OpenCL等并行编程项目,特别是性能提升数据(如延迟降低百分比)
  • 详细描述参与过的推理引擎二次开发或优化经历,尤其是TensorRT或vLLM相关
  • 展示量化工具链的实践经验,包括量化方法选择、精度与速度的权衡分析
  • 如果有AI编译器(MLIR/Triton)使用经验,要重点提及
  • 补充AI编译器知识,动手练习Triton编写自定义算子或MLIR dialect
  • 加深对硬件架构的理解,比如NVIDIA GPU架构(Ampere、Hopper)的内存层次和计算单元

面试指南

  • 结构化思考:先明确目标(延迟、吞吐、功耗),再分层面(算子、调度、内存)提出优化方案
  • 量化问题:从原理(校准、KL散度)到实操(工具链选择),结合具体案例说明精度恢复方法
  • 项目经验:使用STAR法则(情境-任务-行动-结果),强调个人贡献和可量化的成果
  • 如何优化一个典型的Transformer模型在GPU上的推理延迟?请给出具体策略
  • 解释INT8量化中的校准方法和精度损失原因,如何平衡速度与精度?
  • 描述你过去使用TensorRT或类似工具的项目,遇到过什么困难?如何解决?
  • 你对VLA(视觉-语言-行动)模型在机器人上的推理有什么优化思路?
  • 复习GPU编程模型,熟悉PTX/SASS指令集和profiling工具(Nsight)

职位点评

70
综合评分

技术前沿、成长迅猛、薪资优厚,但工作强度较高且办公灵活性有限。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合发展性动机强的求职者,关注技术成长和前沿探索,能接受较高强度工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值75

薪资福利

70中等

上海AI Infra岗位薪资具有竞争力,但B轮公司股权激励有不确定性;未提及具体福利,但行业惯例有补充公积金等,整体补偿性中等偏上。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

90较高

技术栈前沿(VLA、世界模型、AI编译),涵盖推理引擎和算子优化的全链路,成长性极强,且岗位紧跟学术界最新趋势。

技术前沿前沿/新兴技术
技术栈CUDA、TensorRT、vLLM、MLIR、Triton、量化、VLA、世界模型
业务类型profit_center

工作生活

40较低

仅现场办公,上海办公,未提及弹性或远程;具身机器人研发涉及硬件调试,可能需较高时间投入,WLB一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

75中等

具身智能赛道处于高速增长期,但岗位偏底层基础设施,社会影响力通过赋能机器人产品间接体现,使命信号不明。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs