YMTC logo
长江存储
端侧AI Storage研究员/专家(J14572)

端侧AI Storage研究员/专家(J14572)

发布于 大约 1 小时前

普通员工/个人贡献者

上海市 / 武汉市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
F2Fs
Kv Cache
Llm
Mnn
Moe
Nvme
Ufs
Vllm
存储系统

AI 估算 · 30k–60k

端侧AI存储专家岗位紧缺,上海武汉AI研发薪资较高,硕士3年以上经验,综合市场行情估算。

职位详情

关于这个职位

该职位专注于端侧AI推理的存储系统优化,围绕LLM推理中的存储瓶颈,进行架构创新与软硬协同设计

你将主导KV Cache交换、MOE路由存储调度等核心技术研发,并深度适配MNN等端侧框架,提升模型推理效率与功耗表现
适合对LLM底层系统、存储架构有深入理解的技术专家

最低要求

学历背景:计算机、电子或相关专业硕士及以上,3年以上C/C++开发经验,深入理解Linux/Android内核及IO栈

核心技能:
o LLM推理精通:深刻理解Transformer及MOE架构,熟悉vLLM、llama.cpp、MNN等框架的底层内存管理机制(如PagedAttention原理)
o 存储系统专家:精通计算机体系结构中的存储层级(Cache/DRAM/Flash),熟悉F2FS/EXT4文件系统及UFS/NVMe协议
o 全栈优化能力:具备量化、算子融合、显存/内存优化实战经验,能独立完成从模型加载到推理生成的全链路存储优化
项目经验:有端侧大模型(手机/IoT/车机)落地经验,或主导过存储系统(文件系统/数据库/Flash控制器)研发项目

工作职责

LLM推理存储架构优化:主导端侧大模型的存储子系统研发,解决Flash/NVMe在推理过程中的带宽与延迟瓶颈,重点优化KV Cache的内存/磁盘分页交换(Offloading)机制

推理引擎深度适配:基于MNN等端侧框架,定制量化模型(INT4/INT8)的内存映射(mmap)与按需加载策略,实现“零拷贝”启动与低显存占用
新架构存储调度:针对MOE(混合专家)等稀疏架构,设计动态专家路由的存储调度算法,优化随机读写性能,降低首字延迟(TTFT)
软硬协同与功耗控制:构建端侧存储性能基准,通过预取、缓存替换算法及F2FS深度调优,最大化UFS/NVMe性能,同时降低推理功耗与Flash写入损耗

优先资格

有llama.cpp (GGUF/mmap)、vLLM源码贡献或MNN深度定制经验

熟悉CUDA编程、GPU架构,或了解CXL、存算一体(PIM)技术
在顶级会议发表过LLM系统优化相关论文,或拥有相关发明专利
具备英语前沿论文追踪能力,能快速复现最新存储优化算法

AI 洞察

优缺点分析

优点

  • 切入AI基础设施核心赛道,技术壁垒高,未来发展空间广阔
  • 长江存储是存储行业龙头,平台资源丰富,可深度接触硬件与底层系统
  • 对综合能力要求高,需同时精通AI推理框架和底层存储系统,学习曲线陡峭
  • 端侧AI场景功耗和性能限制严格,优化难度大,可能面临较长时间调试
  • 适合对系统性能极致追求、热爱底层优化、有AI和存储双重背景的技术极客

缺点 / 挑战

  • 工作内容涉及LLM推理与存储交叉领域,技术挑战性强,个人成长快
  • 需要跟踪前沿论文,快速复现最新算法,工作强度较高

角色解读

  • 从端侧AI存储专家晋升为系统架构师,主导多产品线存储方案设计
  • 横向扩展至云端推理或存算一体技术,成为跨领域系统优化专家
  • 带领团队探索前沿技术(如CXL、PIM),发表顶会论文或申请发明专利
  • 主导端侧大模型推理的存储子系统优化,重点解决Flash/NVMe带宽和延迟瓶颈
  • 基于MNN等框架定制量化模型的内存映射与加载策略,实现低显存、快速启动
  • 针对MOE等稀疏架构设计动态存储调度算法,降低首字延迟
  • 通过预取、缓存替换和F2FS调优,实现软硬协同的功耗控制与性能最大化
  • 精通C/C++和Linux/Android内核IO栈,具备3年以上开发经验
  • 深入理解Transformer和MOE架构,熟悉vLLM、llama.cpp等框架的内存管理机制
  • 掌握存储层级结构,熟悉F2FS/EXT4文件系统及UFS/NVMe协议
  • 具备量化、算子融合、显存/内存优化实战经验,能独立完成全链路存储优化

申请策略

  • 关注长江存储在AI存储方向的产品布局,面试中可提出针对性优化方案
  • 提前准备一个从模型加载到推理的完整存储优化案例,展示全栈能力
  • 突出LLM推理框架(vLLM/llama.cpp/MNN)的底层内存管理或存储优化经历
  • 强调文件系统(F2FS/EXT4)、NVMe/UFS协议方面的项目经验,最好有性能调优数据
  • 展示端侧AI落地案例(手机/IoT/车机),说明具体存储优化手段和效果
  • 如有相关论文、专利或开源贡献(如llama.cpp patch、MNN定制),重点标注
  • 补强PagedAttention、MOE路由等LLM推理机制,阅读主流框架源码
  • 深入F2FS与UFS协议,通过实际环境(如树莓派)做存储性能测试

面试指南

  • 面对系统优化问题,先分析瓶颈(带宽、延迟、功耗),再提出多级优化方案(缓存、预取、调度),最后给出实验对比数据
  • 涉及底层机制时,结合硬件特性(如Flash页大小、磨损均衡)说明软件设计,展示软硬协同思维
  • 请介绍PagedAttention的原理及其在KV Cache Offloading中的应用
  • 如何优化MOE架构在端侧推理的随机读写性能?给出具体调度策略
  • 描述一次你通过F2FS调优提升存储性能的经历,包括具体参数和效果
  • 在量化模型(INT4/INT8)的mmap加载中,如何避免缺页中断导致的延迟?
  • 如果给你一块UFS 3.1芯片,你如何设计一个预取算法来降低TTFT?
  • 复习计算机体系结构中存储层次和文件系统知识,尤其F2FS和UFS

职位点评

72
综合评分

前沿AI存储专家岗,技术成长极快,薪资中上,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和职业发展,对薪资和成长有高要求,能接受较高工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值70

薪资福利

75中等

该职位薪资水平在行业内属中上,长江存储为知名企业,福利待遇完善,但JD未明确具体薪资,且为社招岗位,稳定性较高。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

85较高

该职位涉及LLM和存储前沿技术,技术挑战大,成长空间广阔。JD虽未明确提及晋升通道,但专家岗通常有明确发展路径,且鼓励论文和专利。

技术前沿前沿/新兴技术
技术栈LLM、MNN、vLLM、F2FS、UFS、NVMe、KV Cache、MOE
业务类型profit_center

工作生活

50较低

工作地点在上海和武汉的办公现场,未提及弹性办公或远程,且AI优化岗位可能涉及高强度加班,WLB一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

端侧AI是高速增长赛道,推动AI落地有社会价值,但职位本身侧重技术实现,使命感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs