Lenovo logo
联想
模型调度与端侧推理集成工程师

模型调度与端侧推理集成工程师

发布于 大约 15 小时前

普通员工/个人贡献者

天津市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Llm
Mnn
Ncnn
Onnx Runtime
多模态
模型量化
端侧推理
Npu调度

AI 估算 · 15k–25k

端侧AI部署技术稀缺,大厂平台背书,但天津薪酬低于一线,综合月薪约2万。

职位详情

关于这个职位

作为联想端侧AI推理工程师,你将负责LLM、人脸识别等模型在终端设备上的部署与优化,设计统一模型调度框架,确保AI功能在NPU等受限资源下高效运行

该岗位技术栈深,需兼顾C++/Python和多种推理框架,适合有志于AI工程落地的求职者

最低要求

本科及以上学历

具备 2~3 年端侧 AI 模型部署经验,熟悉 NCNN、MNN、Tengine、QNN、ONNX Runtime 等至少一种推理框架
精通多模态主流评测指标及评测数据集,能够区分学术基准指标与真实端侧业务落地指标,并具备端侧部署性能评测经验
熟练使用评测工具,能够搭建自动化评测脚本
熟悉模型量化、KV Cache 优化及多进程、多模型资源调度方案
熟练掌握 C++、Python 开发,熟悉 Linux 服务开发及进程资源管控

工作职责

负责多模型(LLM、人脸识别、OCR、ASR、声纹)端侧部署、量化及推理性能调优

设计并开发统一模型调度框架,实现模型按需加载/热卸载、算力优先级调度,以及NPU和内存资源争抢隔离
封装统一推理 Runtime,对接各类模型,实现推理任务队列、限流及闲时任务调度
针对 Center / Mini 等不同配置硬件,制定模型分级和降级策略
负责数据挖掘离线管线开发,包括人脸聚类、媒体特征提取及模型推理任务执行
评测模型时延、内存占用及功耗表现,持续优化端侧推理效率

优先资格

熟悉 OpenAI Evals、LM Eval 或多模态评测开源框架者优先

具备 Whisper ASR、人脸CV模型或本地LLM部署实战经验者优先
具备算力受限嵌入式设备 AI 落地经验者优先

AI 洞察

优缺点分析

优点

  • 深入端侧AI前沿领域,积累模型部署与优化经验,市场需求旺盛
  • 联想大平台提供完整硬件生态,有机会接触多类终端设备(PC、手机、IoT)
  • 技术栈涵盖C++/Python/推理框架,技能含金量高,职业竞争力强
  • 参与多模态模型实际落地,工程能力与业务视野双提升
  • 端侧资源受限,性能优化难度大,需扎实的底层功底和耐心
  • 多模型调度逻辑复杂,需要应对设备碎片化与硬件差异
  • 适合对AI工程落地有热情、喜欢底层性能优化,且具备嵌入式或端侧开发经验的技术型求职者

缺点 / 挑战

  • 可能涉及重复性适配与调优工作,且天津AI岗位相比一线城市略少

角色解读

  • 向端侧AI架构师方向发展,负责整体推理平台设计与技术选型
  • 横向转岗至算法团队,深耕模型优化与压缩
  • 成长为技术专家,主导端侧AI基础设施建设,带领团队解决前沿难题
  • 负责将LLM、人脸识别、OCR等模型部署到端侧设备,进行量化与推理性能调优
  • 设计统一模型调度框架,实现模型按需加载、算力优先级调度及资源争抢隔离
  • 封装推理Runtime,管理任务队列、限流和闲时调度,确保多模型稳定运行
  • 开发离线数据管线,执行人脸聚类、媒体特征提取等数据挖掘任务
  • 掌握端侧推理框架(NCNN、MNN等)及模型量化技术,具备实际部署经验
  • 精通C++和Python,熟悉Linux服务开发与进程资源管控
  • 熟悉多模态模型评测指标与工具,能搭建自动化评测脚本
  • 理解多进程、多模型资源调度及NPU、内存管理方案

申请策略

  • 了解联想端侧AI产品应用场景,思考推理框架如何与业务结合
  • 准备一个完整的端侧部署案例,包含问题、方案、量化指标与教训
  • 突出端侧推理框架(NCNN/MNN等)的使用经验和量化项目成果
  • 强调C++/Python开发能力与性能调优实例(如时延降低xx%)
  • 展示多模型并发调度、内存优化的实践经验
  • 如有嵌入式设备或NPU部署经验,务必重点描述
  • 提前学习NCNN或MNN框架的内部实现及常用量化方案(如INT8、KV Cache优化)
  • 熟悉OpenAI Evals、LM Eval等模型评测工具,练习编写自动化脚本

面试指南

  • 用STAR法则回答项目经验,明确背景、任务、行动、结果,突出量化收益
  • 从资源调度、内存管理、并发控制角度分点阐述调度方案设计
  • 对比不同量化方案的精度与性能,结合硬件特性给出选择理由
  • 强调端侧约束(算力、内存)与业务指标的关联,体现落地思维
  • 请介绍你使用NCNN/MNN部署模型的经验,遇到哪些性能瓶颈并如何优化?
  • 如何对LLM进行量化?KV Cache优化的常用方法有哪些?
  • 设计一个多模型调度策略,如何避免NPU和内存资源争抢?
  • 如何评测端侧模型的时延、内存和功耗?指标选取有哪些考量?

职位点评

72
综合评分

大厂平台,前沿端侧AI技术,成长空间大,WLB不明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和成长空间、不介意固定办公地点的AI工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活60
使命价值70

薪资福利

70中等

联想作为上市巨头,平台稳定,福利制度完善,但薪资未明确披露,天津整体薪酬水平略低于一线城市,补偿性处于中等水平。

薪资信号未披露(AI估算:15K-25K/月)

成长发展

85较高

职位涉及LLM、多模态、端侧部署等前沿技术,技能积累价值高,成长路径清晰,但JD未明确晋升机制,发展主要靠技术深度。

技术前沿前沿/新兴技术
技术栈LLM、NCNN、MNN、ONNX Runtime、C++、Python、NPU、量化、KV Cache
业务类型ambiguous

工作生活

60中等

工作地点固定,未提及弹性工时或远程办公,但联想作为大厂通常有稳定双休,天津生活压力相对较小,WLB中规中矩。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

端侧AI技术能提升终端用户体验,行业高速增长,有一定社会价值,但JD未体现直接使命导向,意义感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs