Rockchips Electronics logo
瑞芯微
大模型推理部署工程师-福州

大模型推理部署工程师-福州

发布于 大约 13 小时前

普通员工/个人贡献者

福州市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Llm
Vlm
分布式系统
图优化
并行计算
异构计算
模型量化
多卡通信
运行时调度

AI 估算 · 25k–45k

大模型推理部署是前沿技术方向,瑞芯微上市平台,3年经验月薪35k左右。

职位详情

关于这个职位

这个职位负责大模型(LLM/VLM)推理工具链的优化与部署,解决动态Shape、多卡通信和内存瓶颈等关键技术挑战

你需要深入参与模型量化、图优化和运行时调度,构建高性能的异构多核推理方案
适合有扎实C/C++功底、对并行计算和AI部署全流程有深刻理解的工程师

最低要求

年以上机器学习算法或工程开发经验

深刻理解AI模型部署全流程(模型转换、量化、图优化、运行时执行),具备实际落地经验
具备扎实的C/C++编程能力,良好的数据结构与算法基础
对并行计算或分布式系统有系统认知,具备从全局视角进行软件架构设计的能力
具备优秀的复杂系统问题拆解能力、沟通协调能力和团队合作意识
对前沿大模型与系统架构保持高度技术热情

工作职责

负责LLM/VLM模型转换与推理工具链的多核计算图与执行链路优化

解决大模型落地过程中的关键技术挑战,包括动态Shape、多卡通信效率、内存瓶颈等问题
面向异构多核(CPU/NPU/GPU)架构,设计高性能、可扩展的推理部署方案
深度参与模型量化、图优化、运行时调度等全流程,构建端到端性能优势
与多团队协作,推动大模型在实际产品中的规模化部署与持续演进

优先资格

有LLM推理系统(Prefill/Decode/KV Cache)优化经验

熟悉多卡通信、异构计算或编译器后端
有端侧或高性能推理系统落地案例

AI 洞察

优缺点分析

优点

  • 大模型推理是AI基础设施的核心赛道,技术壁垒高,长期价值显著
  • 瑞芯微在端侧AI芯片有深厚积累,可接触真实产品落地场景
  • 岗位涉及模型量化、图优化和运行时,技术栈全面,成长空间大
  • 已上市公司,平台稳定,薪资和福利有竞争力
  • 技术难度高,需要同时掌握算法和系统工程能力,学习曲线陡峭
  • 大模型部署涉及多卡通信和异构架构,问题定位和调优复杂
  • 适合对AI系统底层优化有浓厚兴趣、具备扎实C/C++功底并追求技术深度的工程师

缺点 / 挑战

  • 芯片行业研发节奏快,可能面临一定的项目压力

角色解读

  • 从推理部署工程师向AI系统架构师发展,主导大模型端侧和边缘侧技术方案
  • 向技术专家或团队负责人方向成长,积累AI编译器和高性能计算经验
  • 随着端侧大模型普及,成为稀缺的系统性能优化人才,可拓展到更多AI芯片和应用场景
  • 负责LLM/VLM推理工具链的优化,包括计算图优化、执行链路改进和内存管理
  • 解决大模型部署中的动态Shape、多卡通信效率等关键性能瓶颈
  • 设计面向CPU/NPU/GPU异构架构的高性能推理部署方案
  • 参与模型量化、运行时调度和端到端性能优化,推动产品落地
  • 扎实的C/C++编程能力,深入理解数据结构和算法
  • 熟悉模型转换、量化、图优化和运行时执行等部署全流程
  • 对并行计算、分布式系统和异构计算有系统认知
  • 具备复杂系统问题拆解和跨团队协作能力

申请策略

  • 提前了解瑞芯微在AI芯片和NPU技术栈的布局,在面试中体现对端侧推理的兴趣
  • 准备一个完整的性能优化故事,从问题定位到方案落地,展现系统性思维
  • 突出端到端模型部署项目经验,包括量化和图优化具体成果
  • 强调C/C++性能调优案例,如延迟或吞吐量提升数据
  • 展示并行计算或分布式系统相关项目,如多卡训练/推理
  • 如果有端侧或推理系统落地案例,务必详细写明
  • 补充学习TensorRT、ONNX Runtime等推理引擎的架构和优化方法
  • 熟悉PyTorch模型导出、量化工具(如GPTQ、AWQ)的使用

面试指南

  • 采用STAR法则,先说明背景,再明确具体任务,突出你采取的技术手段和量化结果
  • 对于技术原理题,从底层机制出发,结合实践经验展开,不必局限于背答案
  • 请描述一次大模型推理性能优化的案例,如何定位瓶颈并解决?
  • 解释动态Shape对推理性能的影响及你如何应对?
  • 多卡通信在推理中如何优化?你了解哪些通信库(如NCCL)?
  • 为什么量化可以加速推理?你有使用过哪些量化方法?
  • 如何在内存受限的端侧设备上部署大型模型?
  • 复习模型部署全流程的关键环节,包括转换、量化、优化器等

职位点评

72
综合评分

前沿技术专家岗位,薪资中上,成长空间巨大,但需现场办公且WLB未明。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合以技术成长为核心动机,愿意在AI底层优化领域深耕,对工作地点和弹性要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活45
使命价值75

薪资福利

70中等

公司已上市,岗位技术含量高,薪资预计处于市场中上水平,但JD未明确福利和具体薪酬,整体补偿性中等偏上。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

92较高

岗位聚焦大模型推理前沿技术,涉及量化、图优化和异构计算,技术成长空间极大,能显著提升系统设计能力。

技术前沿前沿/新兴技术
技术栈LLM、VLM、模型量化、图优化、运行时、C++、并行计算、分布式系统、多卡通信、异构计算
业务类型profit_center

工作生活

45较低

职位要求现场办公,未提及弹性工时或加班情况,WLB信号不明,估计与芯片行业常规节奏一致。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

公司处于AI芯片高速发展赛道,大模型部署对推动端侧智能有积极意义,但JD未强调使命导向。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs