YMTC logo
长江存储
AI中间件开发专家工程师(Embedded方向)(J14612)

AI中间件开发专家工程师(Embedded方向)(J14612)

发布于 大约 8 小时前

普通员工/个人贡献者

上海市 / 武汉市
专家级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Dram
Gpu
Kv Cache
Llama.Cpp
Mnn
Nand
Npu
推理引擎

AI 估算 · 35k–60k

资深AI系统专家,C++高性能计算与推理优化稀缺,薪资竞争力强。

职位详情

关于这个职位

该职位聚焦边缘设备上AI模型推理中间件研发,通过DRAM与NAND融合及KV Cache分层存储,突破内存瓶颈,并适配GPU/NPU加速

你将使用C++进行底层系统开发,优化推理引擎性能,为端侧大模型部署提供基础设施支撑

最低要求

计算机、电子工程、通信工程相关专业,7年以上且以C++为主要工作语言的经验,其中需要包含1年以上的推理引擎工程化经验

熟练使用C++语言(必要条件),了解C++11以上特性,能够使用C++语言实现高性能计算
在边缘设备上适配llama.cpp\mnn\mllm等现有的开源推理框架(了解其一即可)
了解MOE模型训练与推理时token与专家分配关系
深入理解计算机体系结构,了解DRAM/Cache/Disk-IO co-work机制
可以熟练在Linux上进行开发,了解Linux上各项机制(内存申请、任务调度、资源管理)
熟悉手机平台NPU工作原理,和在不同推理框架下使用方式

工作职责

岗位定位:参与端侧模型推理中间件的研发,实现存储融合

实现端侧模型存储优化
岗位职责:1. 负责AI模型在边缘设备上的推理优化(DRAM&NAND内存融合),挖掘推理期间内存占用与性能数据,突破现有边缘设备的内存瓶颈
负责KV Cache分层存储模块的设计与开发,实现KV Cache在不同存储介质的动态流转
负责边缘设备上的加速外设(GPU/NPU)进行推理加速,分析解决适配过程中的功能、性能与精度问题

优先资格

能够熟练解析各模型权重信息,并了解这些权重在推理过程中的作用

大模型推理期间KV-Cache、动态批处理、encode-decode相关知识
输出推理引擎的架构文档、内存占用数据、性能分析报告等文档
高性能计算经验
有敏捷开发经验

AI 洞察

优缺点分析

优点

  • 技术前沿性强:边缘AI推理是当前热点,存储融合创新空间大
  • 涉及底层系统,能够积累深厚的内核、硬件协同经验
  • 长江存储作为半导体大厂,平台稳定,资源充足
  • 工作内容与AI芯片和存储深度结合,行业壁垒高
  • 对底层系统要求极高,需要同时掌握内存、存储、NPU等多领域知识
  • 跨硬件适配问题复杂,可能需要长时间调试,工作强度较大

缺点 / 挑战

  • 年以上经验门槛高,竞争压力大
  • 适合对底层系统有浓厚兴趣、具备资深C++功底且热爱挑战的技术人员

角色解读

  • 在AI基础设施领域深耕,成为端侧推理优化专家
  • 向AI系统架构师或技术专家方向发展,主导下一代存储融合方案
  • 可拓展至存储与AI交叉方向,成为行业稀缺人才
  • 负责边缘设备AI模型推理中间件研发,实现DRAM与NAND内存融合,优化存储访问以突破内存瓶颈
  • 设计并实现KV Cache分层存储模块,推动缓存数据在不同存储介质间动态流转
  • 与GPU/NPU加速硬件协同,适配并解决推理加速过程中的功能、性能与精度问题
  • 精通C++及高性能计算,深入理解计算机体系结构和Linux系统机制
  • 熟悉主流推理框架(如llama.cpp、MNN)的适配与优化
  • 了解MOE模型特性及NPU工作原理,具备底层调试分析能力

申请策略

  • 投递时附上技术博客或GitHub代码,展示底层系统能力
  • 了解长江存储的业务方向,在面试中体现对'存储融合'的理解
  • 突出C++高性能计算项目经验,尤其是推理引擎或内存优化相关案例
  • 展示对KV Cache、DRAM/NAND存储层次的理解与实际调优成果
  • 如有开源推理框架贡献或适配经历,务必强调
  • 量化性能优化成果(如内存占用降低百分比、推理速度提升倍数)
  • 提前熟悉llama.cpp或MNN的源码,理解其内存管理和算子实现
  • 学习NPU编程模型和异构计算,弥补硬件加速知识

面试指南

  • 采用'背景-方案-效果'结构,先描述问题场景,再说明设计思路与权衡,最后给出量化结果
  • 涉及系统设计时,考虑数据流和瓶颈分析,展示系统性思维
  • 对于技术深度问题,分层次阐述,从原理到工程实现
  • 如何优化KV Cache在DRAM和NAND之间的换入换出策略?
  • 在边缘设备上部署大模型时,内存瓶颈通常出现在哪里?如何定位?
  • 解释MOE模型中token与专家的分配关系,以及如何影响推理性能
  • 描述一次你使用C++进行高性能计算优化的经历,具体做了哪些改进?
  • 如何将llama.cpp适配到特定NPU平台?遇到精度问题怎么解决?

职位点评

68
综合评分

前沿AI中间件开发,技术含量高,薪资预估不错,但WLB未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度与职业成长、能适应较快节奏的底层系统开发者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展85
工作生活50
使命价值70

薪资福利

65中等

JD未披露薪资福利,但资深专家岗位通常薪酬具有竞争力,不过缺乏明确证据,综合判分中等偏上。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

85较高

岗位涉及前沿AI推理优化和存储融合技术,技术挑战大,成长空间广阔,能显著提升底层系统能力。

技术前沿前沿/新兴技术
技术栈C++、KV Cache、DRAM、NAND、GPU、NPU、推理引擎、llama.cpp、MNN
业务类型ambiguous

工作生活

50较低

JD未提及弹性工作或远程安排,默认现场办公,工作地点明确,生活方式满足度一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

边缘AI和存储融合是高速发展的领域,岗位对技术创新有积极意义,但社会直接影响力一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs