
智元机器人
算法优化工程师
算法优化工程师
发布于 大约 9 小时前普通员工/个人贡献者
上海市 / 北京市
高级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Cuda
Mnn
Tensorrt
Tflite
Vla
Vlm
剪枝
蒸馏
量化
AI 估算 · 25k–45k
一线城市高级算法岗,技术栈前沿,市场竞争力强,结合B轮中大型企业薪资水平。
职位详情
关于这个职位
该职位负责端侧推理引擎的研发与优化,重点针对NVIDIA平台进行算子适配和性能调优,包括内存优化、降低功耗和延迟
同时参与模型优化工具链的设计开发,与算法团队协作,确保模型在端侧的高效运行
适合对底层推理引擎和模型压缩技术有深入理解、精通C++/Python的算法工程师
最低要求
对主流推理引擎(如 TensorRT、TFLite、MNN等)有深入的理解,熟悉其底层加速原理与运行机制,能够灵活运用并进行二次开发
精通python/c++编程,熟练使用huggingface、torch等框架进行模型微调,并有过模型优化落地经验
熟悉模型优化常用技术如量化、剪枝、蒸馏的内部原理,并可以熟练使用优化框架如torchao,transformer engine,model optimizer等对模型进行压缩与交付
了解transformer结构,有过vlm,vla等端侧部署与优化经验
了解cuda算子开发,有过量化算子开发经验
工作职责
参与端侧引擎的研发工作,确保其能在各类设备上流畅运行
针对NV平台进行深入的算子适配与性能优化,内存占用优化,降低功耗,减少推理延迟,全方位提升端侧推理的性能表现
定位并解决现有NV生态体系中模型优化的问题,提出修改意见并落地到自研模型优化框架中,在算法精度损失可接受的情况下提升模型推理性能
深入调研多种模型优化框架与算法,设计开发模型优化工具链与评测工具,打造业界SOTA的模型优化工具链
与算法团队密切配合,深度参与模型到端侧引擎的转换与验证工作
从工程实现的角度,为算法优化提供专业建议,确保模型在端侧的高效运行与精度保障
AI 洞察
优缺点分析
优点
- 接触前沿的端侧AI推理技术,涉及量化、剪枝、CUDA等核心领域,技能积累价值高
- 公司处于B轮融资阶段,成长空间大,有机会参与从0到1的工具链建设
- 与算法团队紧密合作,能深入理解模型设计与工程实现的结合点,综合能力提升快
- 对底层性能优化要求高,需要扎实的C++/CUDA功底,调试难度大
- 需同时应对多种推理引擎和硬件平台,技术栈复杂度高,学习曲线陡峭
- 端侧资源受限,需要在精度和速度之间反复权衡,工作容错空间小
- 适合对底层系统性能有极致追求、享受从算子级别优化到模型部署全流程的资深算法工程师,尤其是具备CUDA和模型压缩经验的人
缺点 / 挑战
暂无明显挑战项
角色解读
- 深入端侧AI优化领域,成为模型压缩与推理加速专家
- 可向算法架构师或技术Leader发展,主导优化工具链设计
- 横向扩展至其他硬件平台(如ARM、NPU)或参与AI芯片设计合作
- 针对NVIDIA平台进行端侧推理引擎的算子适配与性能优化,降低内存占用和功耗,减少推理延迟
- 解决模型优化问题,设计并落地自研优化框架,在精度损失可控前提下提升推理速度
- 开发模型优化工具链与评测工具,保持业界领先水平
- 与算法团队协作,完成模型到端侧引擎的转换验证,从工程角度提供优化建议
- 深入理解主流推理引擎(TensorRT、TFLite、MNN等)的底层原理和二次开发能力
- 精通C++/Python,熟悉huggingface、PyTorch等框架,有模型微调与优化落地经验
- 掌握量化、剪枝、蒸馏等模型压缩技术,能使用torchao、transformer engine等工具
- 了解Transformer结构,有VLM/VLA等端侧部署经验,以及CUDA算子开发经验
申请策略
- 在面试中准备一个完整的端侧优化案例,从模型分析到引擎适配再到性能调优的完整故事
- 关注智元机器人产品方向,了解其机器人端侧AI的应用场景,展现对该领域的热情
- 突出在TensorRT、MNN等引擎上的二次开发或性能优化具体案例,附上量化指标(如延迟降低百分比、显存节省量)
- 展示模型压缩(量化、剪枝、蒸馏)的落地项目,包括精度损失和提速对比
- 强调CUDA算子开发经历,特别是量化算子的实现细节
- 提及VLM/VLA等端侧部署经验,说明遇到的挑战和解决方案
- 若缺少CUDA算子开发经验,可系统学习CUDA编程并实践量化算子(如INT8、FP8)
- 熟悉torchao、transformer engine等工具链的用法,尝试复现模型优化流程
面试指南
- 对于技术原理类问题,采用“原理+案例+量化结果”的结构:先说概念,再结合项目经验,最后用数据证明效果
- 对于开放性问题,从问题定义、现有方案、改进思路、验证方法四步走,体现系统思维
- 对于优化类问题,先明确约束条件(硬件、延迟、精度),然后按“分析瓶颈-提出方案-对比实验-迭代”流程回答
- 请解释TensorRT的层融合策略和显存优化机制,并举例如何针对具体模型进行调优
- 描述一个你使用量化技术的项目,如何处理精度损失并最终提升推理速度?
- 如果要在端侧部署一个VLM模型,你会从哪些方面考虑并优化?
- 你在CUDA算子开发中遇到过哪些性能瓶颈,如何分析和解决的?
- 如何评估一种新的模型压缩技术是否适用于你的端侧引擎?
职位点评
68
综合评分
前沿技术栈、高成长性,但WLB一般,适合追求技术深度的算法工程师。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
特别适合重视技术成长和前沿挑战的求职者,但需要接受现场办公和一定的工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值60
薪资福利
70中等
薪资估算处于一线城市算法岗中上水平,B轮公司可能提供期权,但具体福利未在JD中提及,因此补偿性动机满足程度中等偏上。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
90较高
涉及推理引擎、CUDA、模型压缩等前沿技术,与算法团队合作机会多,可深度参与工具链设计,发展空间大。
技术前沿前沿/新兴技术
技术栈TensorRT、CUDA、量化、剪枝、蒸馏、VLM、VLA、端侧推理
业务类型ambiguous
工作生活
40较低
要求现场办公(上海或北京),未提及弹性工作或远程,且职位涉及高强度优化工作,WLB可能一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
机器人行业处于高速增长期,端侧AI优化有较强的技术意义,但JD未强调社会价值或使命感,意义感中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs