
智元机器人
模型推理AI Infra开发工程师
模型推理AI Infra开发工程师
发布于 1 天前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Cuda
Gnn
Mamba
Mlir
Tensorrt
Vllm
算子优化
量化
AI 估算 · 35k–60k
AI Infra方向技术壁垒高,具身机器人赛道热门,上海大厂薪资水平,中高层IC岗位薪资竞争力强。
职位详情
关于这个职位
该职位专注于具身机器人领域的模型推理优化,负责设计轻量化高性能推理框架,开发多模态算子并实施量化工具链
你将深入GPU/NPU底层,通过内存复用、算子融合等策略加速模型推理,同时跟踪VLA、世界模型等前沿算法
适合对AI Infra有激情、熟悉CUDA和推理引擎的技术专家
最低要求
熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验
深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构
熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链
熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等)
熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架
工作职责
设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构
面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略
对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略
实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度)
跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术
AI 洞察
优缺点分析
优点
- 涉及从算子到框架的全栈优化,技术深度和广度兼备,能快速提升底层能力
- 公司处于B轮融资阶段,成长空间大,有机会参与核心技术决策
- 要求的技术栈非常广泛(CUDA、推理引擎、量化、编译等),学习曲线陡峭
- 具身机器人硬件资源受限,优化需兼顾功耗和实时性,对细节要求极高
- 赛道竞争激烈,技术迭代快,需持续跟进VLA、世界模型等前沿动态
- 适合对底层系统充满热情、有极客精神、喜欢从零构建高性能引擎的资深工程师
缺点 / 挑战
- 身处具身机器人赛道,AI与实际物理世界结合,技术前景广阔且具有挑战性
角色解读
- 技术深耕:成为AI Infra领域的专家,主导推理框架架构设计与性能调优
- 横向扩展:向具身机器人全栈技术发展,结合模型算法和硬件实现软硬协同创新
- 管理路线:未来带领团队负责AI推理引擎的研发,或转向系统架构师角色
- 设计和开发面向具身机器人的轻量化推理框架,支持CNN、Transformer等多种主流网络结构
- 针对GPU/NPU进行算子级性能优化,包括内存复用、算子融合、多流并行等加速策略
- 构建量化工具链,实现INT8/INT4/FP8等混合精度量化,并分析模型推理的时间、功耗和内存瓶颈
- 跟踪VLA、世界模型等前沿算法,探索KernelGen、投机推理等高效适配技术
- 精通C/C++/Python,具备丰富的CUDA/OpenCL/CANN编程经验
- 深入理解至少一种推理引擎(TensorRT、vLLM等)的内部架构和优化方法
- 熟悉模型量化原理与常见算法(KL散度、LSQ、AWQ等),并能独立实现量化工具链
- 掌握AI编译框架(MLIR、Triton、IREE等),了解算子调度与代码生成
申请策略
- 了解智元机器人的具体产品和路线,思考你的技能如何推动具身智能落地
- 准备一个技术分享,展示你在推理优化方面的深度思考,而非罗列技能
- 突出CUDA/OpenCL等并行编程项目,特别是性能提升数据(如延迟降低百分比)
- 详细描述参与过的推理引擎二次开发或优化经历,尤其是TensorRT或vLLM相关
- 展示量化工具链的实践经验,包括量化方法选择、精度与速度的权衡分析
- 如果有AI编译器(MLIR/Triton)使用经验,要重点提及
- 补充AI编译器知识,动手练习Triton编写自定义算子或MLIR dialect
- 加深对硬件架构的理解,比如NVIDIA GPU架构(Ampere、Hopper)的内存层次和计算单元
面试指南
- 结构化思考:先明确目标(延迟、吞吐、功耗),再分层面(算子、调度、内存)提出优化方案
- 量化问题:从原理(校准、KL散度)到实操(工具链选择),结合具体案例说明精度恢复方法
- 项目经验:使用STAR法则(情境-任务-行动-结果),强调个人贡献和可量化的成果
- 如何优化一个典型的Transformer模型在GPU上的推理延迟?请给出具体策略
- 解释INT8量化中的校准方法和精度损失原因,如何平衡速度与精度?
- 描述你过去使用TensorRT或类似工具的项目,遇到过什么困难?如何解决?
- 你对VLA(视觉-语言-行动)模型在机器人上的推理有什么优化思路?
- 复习GPU编程模型,熟悉PTX/SASS指令集和profiling工具(Nsight)
职位点评
70
综合评分
技术前沿、成长迅猛、薪资优厚,但工作强度较高且办公灵活性有限。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合发展性动机强的求职者,关注技术成长和前沿探索,能接受较高强度工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值75
薪资福利
70中等
上海AI Infra岗位薪资具有竞争力,但B轮公司股权激励有不确定性;未提及具体福利,但行业惯例有补充公积金等,整体补偿性中等偏上。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
90较高
技术栈前沿(VLA、世界模型、AI编译),涵盖推理引擎和算子优化的全链路,成长性极强,且岗位紧跟学术界最新趋势。
技术前沿前沿/新兴技术
技术栈CUDA、TensorRT、vLLM、MLIR、Triton、量化、VLA、世界模型
业务类型profit_center
工作生活
40较低
仅现场办公,上海办公,未提及弹性或远程;具身机器人研发涉及硬件调试,可能需较高时间投入,WLB一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
75中等
具身智能赛道处于高速增长期,但岗位偏底层基础设施,社会影响力通过赋能机器人产品间接体现,使命信号不明。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs