AgiBot logo
智元机器人
优才-低精度量化/模型压缩算法工程师

优才-低精度量化/模型压缩算法工程师

发布于 大约 15 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Awq
Gptq
Npu
Onnx Runtime
Pytorch
Smoothquant
Tensorrt-Llm
Vllm
模型压缩

AI 估算 · 25k–50k

硕士2年以上量化经验稀缺,上海算法岗薪资高,具身智能赛道有溢价。

职位详情

关于这个职位

该职位负责智元机器人旗下大模型、多模态模型和具身智能模型的低精度量化与压缩算法研发,包括INT4/FP8量化、剪枝、蒸馏等,需与推理引擎团队协作,最终在机器人端侧实现高效部署

适合对模型压缩有深入经验、熟悉PyTorch和主流量化工具的算法工程师

最低要求

硕士及以上,计算机/人工智能/电子/数学相关,2年以上模型量化或压缩经验

精通深度学习模型结构:Transformer、Attention、FFN、Norm、激活函数
熟悉主流量化算法:PTQ、QAT、GPTQ、AWQ、SmoothQuant、LLM.int8 ()、FP8 量化
熟悉模型压缩技术:剪枝、知识蒸馏、动态稀疏、低秩分解(LoRA/QLoRA)
熟练使用 PyTorch,具备模型训练、微调、精度调试能力
具备良好的算法推导、实验设计、问题定位能力

工作职责

负责大模型、多模态模型、具身智能模型的低精度量化、模型压缩、蒸馏、剪枝、稀疏化算法研发与落地

研究并实现 INT4/NVFP4/INT8/FP8 等量化方案:GPTQ、AWQ、SmoothQuant、GPTQ-For-LLaMA、bitsandbytes 等
负责模型压缩算法在训练、推理、端边、云端不同场景的精度保持与性能收益
与推理引擎、算子团队协同,将量化 / 压缩算法对接 TensorRT-LLM、vLLM、ONNX Runtime、NPU/GPU等硬件与推理栈
构建自动化量化工具链、精度评估体系、压缩后模型稳定性验证流程
针对机器人端侧(Jetson//Thor/Orin/NPU)等资源受限场景,实现极小内存、极低功耗下的模型部署
输出算法方案、实验报告、性能 / 精度对比,支撑业务规模化降本增效

优先资格

了解 GPU/NPU 底层特性,熟悉量化算子、Kernel 对齐、推理引擎流程优先

有LLM/VLM/具身智能模型量化落地经验者优先

AI 洞察

优缺点分析

优点

  • 处于大模型和具身智能交叉领域,技术前沿且人才稀缺
  • 能接触到完整的模型部署链路,硬件和算法结合能力强
  • 公司处于B轮,发展快,有较大成长空间
  • 量化压缩是降本增效的核心技术,业务价值高
  • 需要同时掌握算法和底层硬件知识,学习曲线陡峭
  • 机器人端侧部署环境复杂,问题定位难度大

缺点 / 挑战

  • 工作强度可能较高,需要快速迭代和实验验证
  • 适合对模型压缩和推理优化有浓厚兴趣,喜欢钻研底层技术,能承受一定工作压力的算法工程师

角色解读

  • 从量化算法工程师成长为模型压缩技术专家,深入掌握底层硬件与算法结合
  • 可向AI基础设施方向拓展,成为推理引擎或部署平台的核心架构师
  • 在具身智能赛道积累稀缺经验,未来可转向技术管理或创业
  • 负责大模型、多模态模型和具身智能模型的低精度量化与压缩算法研发,设计INT4/FP8等量化方案
  • 与推理引擎和算子团队协作,将量化算法适配到TensorRT-LLM、vLLM、ONNX Runtime等推理栈
  • 构建自动化量化工具链和精度评估体系,确保压缩后模型的性能与精度
  • 针对机器人端侧资源受限场景,实现模型在Jetson/Orin等设备上的低内存低功耗部署
  • 精通深度学习模型结构(Transformer、Attention等)和主流量化算法(GPTQ、AWQ、SmoothQuant等)
  • 熟练使用PyTorch,具备模型训练、微调和精度调试能力
  • 了解GPU/NPU底层特性,熟悉量化算子、Kernel对齐和推理引擎流程
  • 具备良好的算法推导、实验设计和问题定位能力

申请策略

  • 了解智元机器人的具身智能产品线,在面试中展示对机器人场景的理解
  • 准备一个完整的量化项目案例,从问题到方案到结果的讲述
  • 突出量化压缩项目经验,包括使用的量化方法、精度提升和性能收益
  • 强调对Transformer结构和PyTorch的熟练掌握,可展示相关代码或模型
  • 如果有推理引擎(TensorRT-LLM/vLLM)或端侧部署经验,务必重点体现
  • 附上实验报告或博客,证明算法推导和问题定位能力
  • 熟悉GPTQ、AWQ、SmoothQuant的实现细节,可自己复现
  • 学习GPU/NPU底层架构,了解算子kernel优化

面试指南

  • 对于原理类问题,先定义概念,再讲数学原理,最后对比联系实际场景
  • 对于经验类问题,使用STAR法则:情境、任务、行动、结果
  • 对于解决方案类问题,从问题分析、方案设计、实验验证、优化迭代等结构回答
  • 请解释GPTQ和AWQ的基本原理及它们的主要区别
  • 如何在大模型量化后保持精度?你会如何评估压缩后的模型?
  • 描述一次你处理模型量化中精度下降问题的经历
  • 在资源受限的端侧设备上,你会如何选择量化方案?
  • 你了解TensorRT-LLM或vLLM的量化支持吗?请谈谈

职位点评

72
综合评分

前沿量化算法岗位,技术成长快,薪资未披露,工作强度未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求前沿技术成长、愿意应对挑战,对具身智能领域有热情的算法工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展85
工作生活60
使命价值80

薪资福利

65中等

该岗位技术要求高,市场薪资通常有竞争力,但JD未披露薪资和福利,且公司处于B轮存在不确定性。

薪资信号未披露(AI估算:25K-50K/月)

成长发展

85较高

该岗位涉及大模型量化等前沿技术,技能成长空间大,但JD未明确晋升和培训体系。

技术前沿前沿/新兴技术
技术栈GPTQ、AWQ、SmoothQuant、PyTorch、TensorRT-LLM、vLLM、ONNX Runtime、NPU
业务类型cost_center

工作生活

60中等

工作地点上海,JD未提及弹性工作或远程,可能需要现场办公,工作强度未知。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

从事具身智能机器人相关算法,行业前景好,技术有社会价值,但JD未明确使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs