AgiBot logo
智元机器人
算法优化工程师

算法优化工程师

发布于 大约 9 小时前

普通员工/个人贡献者

上海市 / 北京市
高级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Cuda
Mnn
Tensorrt
Tflite
Vla
Vlm
剪枝
蒸馏
量化

AI 估算 · 25k–45k

一线城市高级算法岗,技术栈前沿,市场竞争力强,结合B轮中大型企业薪资水平。

职位详情

关于这个职位

该职位负责端侧推理引擎的研发与优化,重点针对NVIDIA平台进行算子适配和性能调优,包括内存优化、降低功耗和延迟

同时参与模型优化工具链的设计开发,与算法团队协作,确保模型在端侧的高效运行
适合对底层推理引擎和模型压缩技术有深入理解、精通C++/Python的算法工程师

最低要求

对主流推理引擎(如 TensorRT、TFLite、MNN等)有深入的理解,熟悉其底层加速原理与运行机制,能够灵活运用并进行二次开发

精通python/c++编程,熟练使用huggingface、torch等框架进行模型微调,并有过模型优化落地经验
熟悉模型优化常用技术如量化、剪枝、蒸馏的内部原理,并可以熟练使用优化框架如torchao,transformer engine,model optimizer等对模型进行压缩与交付
了解transformer结构,有过vlm,vla等端侧部署与优化经验
了解cuda算子开发,有过量化算子开发经验

工作职责

参与端侧引擎的研发工作,确保其能在各类设备上流畅运行

针对NV平台进行深入的算子适配与性能优化,内存占用优化,降低功耗,减少推理延迟,全方位提升端侧推理的性能表现
定位并解决现有NV生态体系中模型优化的问题,提出修改意见并落地到自研模型优化框架中,在算法精度损失可接受的情况下提升模型推理性能
深入调研多种模型优化框架与算法,设计开发模型优化工具链与评测工具,打造业界SOTA的模型优化工具链
与算法团队密切配合,深度参与模型到端侧引擎的转换与验证工作
从工程实现的角度,为算法优化提供专业建议,确保模型在端侧的高效运行与精度保障

AI 洞察

优缺点分析

优点

  • 接触前沿的端侧AI推理技术,涉及量化、剪枝、CUDA等核心领域,技能积累价值高
  • 公司处于B轮融资阶段,成长空间大,有机会参与从0到1的工具链建设
  • 与算法团队紧密合作,能深入理解模型设计与工程实现的结合点,综合能力提升快
  • 对底层性能优化要求高,需要扎实的C++/CUDA功底,调试难度大
  • 需同时应对多种推理引擎和硬件平台,技术栈复杂度高,学习曲线陡峭
  • 端侧资源受限,需要在精度和速度之间反复权衡,工作容错空间小
  • 适合对底层系统性能有极致追求、享受从算子级别优化到模型部署全流程的资深算法工程师,尤其是具备CUDA和模型压缩经验的人

缺点 / 挑战

暂无明显挑战项

角色解读

  • 深入端侧AI优化领域,成为模型压缩与推理加速专家
  • 可向算法架构师或技术Leader发展,主导优化工具链设计
  • 横向扩展至其他硬件平台(如ARM、NPU)或参与AI芯片设计合作
  • 针对NVIDIA平台进行端侧推理引擎的算子适配与性能优化,降低内存占用和功耗,减少推理延迟
  • 解决模型优化问题,设计并落地自研优化框架,在精度损失可控前提下提升推理速度
  • 开发模型优化工具链与评测工具,保持业界领先水平
  • 与算法团队协作,完成模型到端侧引擎的转换验证,从工程角度提供优化建议
  • 深入理解主流推理引擎(TensorRT、TFLite、MNN等)的底层原理和二次开发能力
  • 精通C++/Python,熟悉huggingface、PyTorch等框架,有模型微调与优化落地经验
  • 掌握量化、剪枝、蒸馏等模型压缩技术,能使用torchao、transformer engine等工具
  • 了解Transformer结构,有VLM/VLA等端侧部署经验,以及CUDA算子开发经验

申请策略

  • 在面试中准备一个完整的端侧优化案例,从模型分析到引擎适配再到性能调优的完整故事
  • 关注智元机器人产品方向,了解其机器人端侧AI的应用场景,展现对该领域的热情
  • 突出在TensorRT、MNN等引擎上的二次开发或性能优化具体案例,附上量化指标(如延迟降低百分比、显存节省量)
  • 展示模型压缩(量化、剪枝、蒸馏)的落地项目,包括精度损失和提速对比
  • 强调CUDA算子开发经历,特别是量化算子的实现细节
  • 提及VLM/VLA等端侧部署经验,说明遇到的挑战和解决方案
  • 若缺少CUDA算子开发经验,可系统学习CUDA编程并实践量化算子(如INT8、FP8)
  • 熟悉torchao、transformer engine等工具链的用法,尝试复现模型优化流程

面试指南

  • 对于技术原理类问题,采用“原理+案例+量化结果”的结构:先说概念,再结合项目经验,最后用数据证明效果
  • 对于开放性问题,从问题定义、现有方案、改进思路、验证方法四步走,体现系统思维
  • 对于优化类问题,先明确约束条件(硬件、延迟、精度),然后按“分析瓶颈-提出方案-对比实验-迭代”流程回答
  • 请解释TensorRT的层融合策略和显存优化机制,并举例如何针对具体模型进行调优
  • 描述一个你使用量化技术的项目,如何处理精度损失并最终提升推理速度?
  • 如果要在端侧部署一个VLM模型,你会从哪些方面考虑并优化?
  • 你在CUDA算子开发中遇到过哪些性能瓶颈,如何分析和解决的?
  • 如何评估一种新的模型压缩技术是否适用于你的端侧引擎?

职位点评

68
综合评分

前沿技术栈、高成长性,但WLB一般,适合追求技术深度的算法工程师。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
特别适合重视技术成长和前沿挑战的求职者,但需要接受现场办公和一定的工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值60

薪资福利

70中等

薪资估算处于一线城市算法岗中上水平,B轮公司可能提供期权,但具体福利未在JD中提及,因此补偿性动机满足程度中等偏上。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

涉及推理引擎、CUDA、模型压缩等前沿技术,与算法团队合作机会多,可深度参与工具链设计,发展空间大。

技术前沿前沿/新兴技术
技术栈TensorRT、CUDA、量化、剪枝、蒸馏、VLM、VLA、端侧推理
业务类型ambiguous

工作生活

40较低

要求现场办公(上海或北京),未提及弹性工作或远程,且职位涉及高强度优化工作,WLB可能一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

机器人行业处于高速增长期,端侧AI优化有较强的技术意义,但JD未强调社会价值或使命感,意义感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs