
智元机器人
低精度量化/模型压缩算法工程师
低精度量化/模型压缩算法工程师
发布于 大约 15 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Awq
Gptq
Npu
Onnx Runtime
Pytorch
Smoothquant
Tensorrt-Llm
Vllm
模型压缩
AI 估算 · 30k–50k
上海、硕士、2年+经验,具身智能赛道火热,量化压缩方向稀缺,薪资竞争力强,B轮中大型企业通常14薪左右。
职位详情
关于这个职位
该职位负责大模型、多模态模型及具身智能模型的低精度量化、压缩、蒸馏、剪枝与稀疏化算法研发与落地
你将研究并实现GPTQ、AWQ、SmoothQuant等主流量化方案,并与推理引擎团队协同,优化TensorRT-LLM、vLLM、ONNX Runtime等推理栈,最终在机器人端侧资源受限场景实现高效部署
适合对模型压缩和推理优化有浓厚兴趣的算法工程师
最低要求
硕士及以上,计算机/人工智能/电子/数学相关,2年以上模型量化或压缩经验
精通深度学习模型结构:Transformer、Attention、FFN、Norm、激活函数
熟悉主流量化算法:PTQ、QAT、GPTQ、AWQ、SmoothQuant、LLM.int8()、FP8 量化
熟悉模型压缩技术:剪枝、知识蒸馏、动态稀疏、低秩分解(LoRA/QLoRA)
熟练使用 PyTorch,具备模型训练、微调、精度调试能力
具备良好的算法推导、实验设计、问题定位能力
工作职责
负责大模型、多模态模型、具身智能模型的低精度量化、模型压缩、蒸馏、剪枝、稀疏化算法研发与落地
研究并实现 INT4/NVFP4/INT8/FP8 等量化方案:GPTQ、AWQ、SmoothQuant、GPTQ-For-LLaMA、bitsandbytes 等
负责模型压缩算法在训练、推理、端边、云端不同场景的精度保持与性能收益
与推理引擎、算子团队协同,将量化 / 压缩算法对接 TensorRT-LLM、vLLM、ONNX Runtime、NPU/GPU等硬件与推理栈
构建自动化量化工具链、精度评估体系、压缩后模型稳定性验证流程
针对机器人端侧(Jetson/Thor/Orin/NPU)等资源受限场景,实现极小内存、极低功耗下的模型部署
输出算法方案、实验报告、性能 / 精度对比,支撑业务规模化降本增效
优先资格
了解 GPU/NPU 底层特性,熟悉量化算子、Kernel 对齐、推理引擎流程优先
有LLM/VLM/具身智能模型量化落地经验者优先
AI 洞察
优缺点分析
优点
- 行业前景好:具身智能和机器人是当前热门赛道,公司处于B轮,发展潜力大
- 技术含量高:涉及量化、压缩、推理优化等前沿技术,技能积累深厚,市场稀缺性强
- 平台优势:与推理引擎和硬件团队深度协作,能接触到端到端部署全流程
- 技术难度大:需要同时理解算法模型、推理引擎和硬件特性,知识面要求广
缺点 / 挑战
- 薪资竞争力强:上海地区算法工程师薪资较高,且该方向人才供不应求
- 落地压力大:需要将算法在资源受限的机器人端侧实际部署,需要解决实际工程问题
- 工作强度可能较高:B轮公司节奏快,可能需要应对多项目并行和紧急的版本迭代
- 适合对模型压缩和推理优化有强烈兴趣,喜欢挑战技术难题,并愿意在具身智能领域深耕的算法工程师
角色解读
- 可以深耕模型压缩与量化方向,成为算法专家,负责更复杂的模型优化策略
- 可向推理引擎、AI芯片方向拓展,成为软硬件协同优化专家,参与芯片和编译器设计
- 有望成长为技术团队负责人,带领算法团队推动具身智能模型的高效部署和应用落地
- 研发大模型、多模态模型和具身智能模型的量化与压缩算法,包括GPTQ、AWQ、SmoothQuant等方案
- 将模型压缩技术落地到不同推理场景,与推理引擎和算子团队协作,确保精度和性能收益
- 针对机器人端侧硬件(如Jetson、NPU)进行极致的内存和功耗优化,实现高效部署
- 构建自动化量化工具链和精度评估体系,输出实验报告和性能对比,支撑业务规模化应用
- 精通深度学习模型结构和主流量化算法,如PTQ、QAT、GPTQ、AWQ、SmoothQuant等
- 熟练使用PyTorch,具备模型训练、微调和精度调试能力,了解GPU/NPU底层特性
- 熟悉模型压缩技术,如剪枝、蒸馏、稀疏化和低秩分解(LoRA/QLoRA)
- 了解推理引擎(TensorRT-LLM、vLLM、ONNX Runtime)和算子内核对齐的流程
申请策略
- 在简历中清晰区分是必须技能还是加分技能,尽量展现对量化工具链的自主搭建经验
- 了解智元机器人的产品方向(如人形机器人),在面试中能结合其业务场景提出部署优化思路
- 突出量化/压缩相关的项目经验,如使用GPTQ、AWQ等算法实现模型加速和体积缩减的具体案例和数据
- 强调对大模型结构(Transformer等)和训练调优能力的掌握,可附上相关代码库或开源贡献
- 展示与推理引擎协作的经验,如TensorRT-LLM或vLLM的集成、算子对齐、性能调优等
- 如有端侧部署经验(如Jetson、NPU),务必重点突出,这是加分项
- 补充学习FP8、NVFP4等新型量化格式的原理和工具方法,关注业界最新进展
- 熟悉至少一种推理引擎的源码和优化技巧,如vLLM的PagedAttention或TensorRT-LLM的量化流程
面试指南
- 对于算法原理问题,先阐述核心思路,再结合自己的项目经验说明实际应用和效果,最后谈一下局限性和改进方向
- 对于工程落地问题,从整体流程出发:需求分析、方案选型、实现细节、性能评估、迭代优化,突出对性能与精度平衡的把握
- 对于开放性问题,可先分点列举挑战,再提出解决方案,并强调自己是主动思考、系统性解决问题的工程师
- 请详细讲讲你使用GPTQ或AWQ的量化流程,如校准数据集的选择、权重处理、精度损失如何恢复?
- 如何在大模型推理中平衡量化的精度和速度?请说明你的评估方法和优化策略
- 在端侧设备(如Jetson)部署模型时,你会如何选择量化方案和推理引擎?为什么?
- 解释一下SmoothQuant的原理,以及它在哪些场景下更有效?
- 对于机器人具身智能模型,你认为模型压缩的主要挑战是什么?
职位点评
71
综合评分
前沿具身智能AI算法岗,技术挑战大,薪资竞争力强,但工作生活平衡一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合对技术成长有强烈追求的求职者,渴望在模型压缩和量化领域深耕,并能接受较快的工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值75
薪资福利
65中等
职位未明确薪资福利,但上海地区、硕士学历、2年以上经验,且具身智能赛道人才稀缺,薪资预计有较强竞争力,但具体稳定性未体现。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
该岗位涉及前沿量化压缩技术和具身智能领域,技术挑战大,可深度积累模型部署与优化能力,成长空间广阔。
技术前沿前沿/新兴技术
技术栈GPTQ、AWQ、SmoothQuant、FP8、TensorRT-LLM、vLLM、ONNX Runtime、NPU、PyTorch
业务类型ambiguous
工作生活
50较低
仅现场办公,未提及弹性工时或远程工作,且B轮公司节奏可能较快,工作生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
具身智能机器人行业高速增长,工作具有较高的技术使命感和产业价值,但社会影响中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs