AgiBot logo
智元机器人
低精度量化/模型压缩算法工程师

低精度量化/模型压缩算法工程师

发布于 大约 15 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Awq
Gptq
Npu
Onnx Runtime
Pytorch
Smoothquant
Tensorrt-Llm
Vllm
模型压缩

AI 估算 · 30k–50k

上海、硕士、2年+经验,具身智能赛道火热,量化压缩方向稀缺,薪资竞争力强,B轮中大型企业通常14薪左右。

职位详情

关于这个职位

该职位负责大模型、多模态模型及具身智能模型的低精度量化、压缩、蒸馏、剪枝与稀疏化算法研发与落地

你将研究并实现GPTQ、AWQ、SmoothQuant等主流量化方案,并与推理引擎团队协同,优化TensorRT-LLM、vLLM、ONNX Runtime等推理栈,最终在机器人端侧资源受限场景实现高效部署
适合对模型压缩和推理优化有浓厚兴趣的算法工程师

最低要求

硕士及以上,计算机/人工智能/电子/数学相关,2年以上模型量化或压缩经验

精通深度学习模型结构:Transformer、Attention、FFN、Norm、激活函数
熟悉主流量化算法:PTQ、QAT、GPTQ、AWQ、SmoothQuant、LLM.int8()、FP8 量化
熟悉模型压缩技术:剪枝、知识蒸馏、动态稀疏、低秩分解(LoRA/QLoRA)
熟练使用 PyTorch,具备模型训练、微调、精度调试能力
具备良好的算法推导、实验设计、问题定位能力

工作职责

负责大模型、多模态模型、具身智能模型的低精度量化、模型压缩、蒸馏、剪枝、稀疏化算法研发与落地

研究并实现 INT4/NVFP4/INT8/FP8 等量化方案:GPTQ、AWQ、SmoothQuant、GPTQ-For-LLaMA、bitsandbytes 等
负责模型压缩算法在训练、推理、端边、云端不同场景的精度保持与性能收益
与推理引擎、算子团队协同,将量化 / 压缩算法对接 TensorRT-LLM、vLLM、ONNX Runtime、NPU/GPU等硬件与推理栈
构建自动化量化工具链、精度评估体系、压缩后模型稳定性验证流程
针对机器人端侧(Jetson/Thor/Orin/NPU)等资源受限场景,实现极小内存、极低功耗下的模型部署
输出算法方案、实验报告、性能 / 精度对比,支撑业务规模化降本增效

优先资格

了解 GPU/NPU 底层特性,熟悉量化算子、Kernel 对齐、推理引擎流程优先

有LLM/VLM/具身智能模型量化落地经验者优先

AI 洞察

优缺点分析

优点

  • 行业前景好:具身智能和机器人是当前热门赛道,公司处于B轮,发展潜力大
  • 技术含量高:涉及量化、压缩、推理优化等前沿技术,技能积累深厚,市场稀缺性强
  • 平台优势:与推理引擎和硬件团队深度协作,能接触到端到端部署全流程
  • 技术难度大:需要同时理解算法模型、推理引擎和硬件特性,知识面要求广

缺点 / 挑战

  • 薪资竞争力强:上海地区算法工程师薪资较高,且该方向人才供不应求
  • 落地压力大:需要将算法在资源受限的机器人端侧实际部署,需要解决实际工程问题
  • 工作强度可能较高:B轮公司节奏快,可能需要应对多项目并行和紧急的版本迭代
  • 适合对模型压缩和推理优化有强烈兴趣,喜欢挑战技术难题,并愿意在具身智能领域深耕的算法工程师

角色解读

  • 可以深耕模型压缩与量化方向,成为算法专家,负责更复杂的模型优化策略
  • 可向推理引擎、AI芯片方向拓展,成为软硬件协同优化专家,参与芯片和编译器设计
  • 有望成长为技术团队负责人,带领算法团队推动具身智能模型的高效部署和应用落地
  • 研发大模型、多模态模型和具身智能模型的量化与压缩算法,包括GPTQ、AWQ、SmoothQuant等方案
  • 将模型压缩技术落地到不同推理场景,与推理引擎和算子团队协作,确保精度和性能收益
  • 针对机器人端侧硬件(如Jetson、NPU)进行极致的内存和功耗优化,实现高效部署
  • 构建自动化量化工具链和精度评估体系,输出实验报告和性能对比,支撑业务规模化应用
  • 精通深度学习模型结构和主流量化算法,如PTQ、QAT、GPTQ、AWQ、SmoothQuant等
  • 熟练使用PyTorch,具备模型训练、微调和精度调试能力,了解GPU/NPU底层特性
  • 熟悉模型压缩技术,如剪枝、蒸馏、稀疏化和低秩分解(LoRA/QLoRA)
  • 了解推理引擎(TensorRT-LLM、vLLM、ONNX Runtime)和算子内核对齐的流程

申请策略

  • 在简历中清晰区分是必须技能还是加分技能,尽量展现对量化工具链的自主搭建经验
  • 了解智元机器人的产品方向(如人形机器人),在面试中能结合其业务场景提出部署优化思路
  • 突出量化/压缩相关的项目经验,如使用GPTQ、AWQ等算法实现模型加速和体积缩减的具体案例和数据
  • 强调对大模型结构(Transformer等)和训练调优能力的掌握,可附上相关代码库或开源贡献
  • 展示与推理引擎协作的经验,如TensorRT-LLM或vLLM的集成、算子对齐、性能调优等
  • 如有端侧部署经验(如Jetson、NPU),务必重点突出,这是加分项
  • 补充学习FP8、NVFP4等新型量化格式的原理和工具方法,关注业界最新进展
  • 熟悉至少一种推理引擎的源码和优化技巧,如vLLM的PagedAttention或TensorRT-LLM的量化流程

面试指南

  • 对于算法原理问题,先阐述核心思路,再结合自己的项目经验说明实际应用和效果,最后谈一下局限性和改进方向
  • 对于工程落地问题,从整体流程出发:需求分析、方案选型、实现细节、性能评估、迭代优化,突出对性能与精度平衡的把握
  • 对于开放性问题,可先分点列举挑战,再提出解决方案,并强调自己是主动思考、系统性解决问题的工程师
  • 请详细讲讲你使用GPTQ或AWQ的量化流程,如校准数据集的选择、权重处理、精度损失如何恢复?
  • 如何在大模型推理中平衡量化的精度和速度?请说明你的评估方法和优化策略
  • 在端侧设备(如Jetson)部署模型时,你会如何选择量化方案和推理引擎?为什么?
  • 解释一下SmoothQuant的原理,以及它在哪些场景下更有效?
  • 对于机器人具身智能模型,你认为模型压缩的主要挑战是什么?

职位点评

71
综合评分

前沿具身智能AI算法岗,技术挑战大,薪资竞争力强,但工作生活平衡一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合对技术成长有强烈追求的求职者,渴望在模型压缩和量化领域深耕,并能接受较快的工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值75

薪资福利

65中等

职位未明确薪资福利,但上海地区、硕士学历、2年以上经验,且具身智能赛道人才稀缺,薪资预计有较强竞争力,但具体稳定性未体现。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

该岗位涉及前沿量化压缩技术和具身智能领域,技术挑战大,可深度积累模型部署与优化能力,成长空间广阔。

技术前沿前沿/新兴技术
技术栈GPTQ、AWQ、SmoothQuant、FP8、TensorRT-LLM、vLLM、ONNX Runtime、NPU、PyTorch
业务类型ambiguous

工作生活

50较低

仅现场办公,未提及弹性工时或远程工作,且B轮公司节奏可能较快,工作生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

具身智能机器人行业高速增长,工作具有较高的技术使命感和产业价值,但社会影响中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs