Xiaohongshu logo
小红书
【Dots】大模型算子优化工程师

【Dots】大模型算子优化工程师

发布于 大约 15 小时前

普通员工/个人贡献者

北京市 / 上海市
中级经验
全职员工
仅现场办公
学历未注明
软件工程
Attention
Cuda
Gpu
Moe
Nccl
Vllm
大模型
量化

AI 估算 · 30k–50k

该岗位技术门槛高,GPU算子优化属前沿领域,市场需求旺盛,薪酬竞争力强,参考一线大厂AI工程师薪资水平。

职位详情

关于这个职位

该职位专注于大模型训练/推理场景下的高性能GPU算子开发与优化,需要深入理解GPU体系结构并利用CUDA等工具逼近硬件极限

你将参与FlashAttention、MoE等前沿算子的定制化实现,并与算法团队协作解决性能瓶颈,是推动AI基础设施演进的关键角色

最低要求

基础要求

扎实的 CUDA 编程能力,深入理解 GPU 体系结构(SM、warp、shared memory、tensor core、访存层级)
熟悉性能分析工具(Nsight Compute/Systems、nvprof),能定位并解决计算/访存瓶颈
熟悉至少一种主流训练或推理框架(Megatron-LM、vLLM、SGLang、TensorRT-LLM、FlashInfer 等)
理解 Transformer 结构及其在训练/推理中的计算特征

工作职责

面向大模型训练/推理场景,开发和优化高性能 GPU 算子(Attention、GEMM、LayerNorm、MoE、Element-wise 等),逼近硬件理论峰值

针对新模型结构(长 context、MoE、线性 Attention 等)设计定制化 kernel,解决原生框架无法覆盖的性能瓶颈
深度优化访存效率、计算-访存重叠、算子融合(fusion),降低 kernel launch 开销与显存占用
参与推理引擎核心链路优化:KV Cache 管理、量化算子(INT8/FP8/INT4)、投机采样、continuous batching 等
与训练框架、模型算法团队紧密协作,将算法需求转化为高效的系统实现
探索新硬件(新一代 GPU / 国产算力)上的算子适配与性能调优

优先资格

加分项:

有 FlashAttention / Fle Attention 等前沿算子的复现或改进经验
熟悉 Triton、CUTLASS,能高效开发模板化 kernel
有 FP8 / 低比特量化算子落地经验
有 MoE、长序列、投机解码等新场景的算子优化实战
熟悉 NCCL / 通信算子优化,理解计算-通信 overlap
有开源贡献(vLLM / SGLang / Triton / PyTorch 等)或顶会论文(MLSys、OSDI、ASPLOS 等)

AI 洞察

优缺点分析

优点

  • 处于AI最前沿,技术含量高,能快速积累底层系统优化经验
  • 小红书平台大,团队技术氛围浓厚,开源贡献多,个人影响力凸显
  • 行业需求旺盛,薪资竞争力强,未来跳槽选择多
  • 技术难度大,需要深入理解硬件架构,学习曲线陡峭
  • 对系统性思维要求高,需同时理解算法、框架和硬件三层
  • 适合对性能优化有极致追求、喜欢攻克底层技术难题、享受GPU利用率接近100%成就感的工程师

缺点 / 挑战

  • 工作强度可能较高,面临大模型迭代速度快、性能要求严苛的压力

角色解读

  • 向AI系统架构师发展,负责整个训练/推理系统的设计与优化
  • 深入底层硬件方向,成为GPU/TPU等算力平台的性能专家
  • 成为AI基础设施团队的技术负责人,领导算子优化与框架开发
  • 开发和优化大模型训练/推理中的高性能GPU算子,使计算接近硬件极限
  • 针对新模型结构(如长context、MoE)设计定制化kernel,解决框架无法覆盖的性能瓶颈
  • 参与推理引擎核心链路优化,包括KV Cache管理、量化算子、投机采样等
  • 与算法团队协作,将算法需求转化为高效的底层系统实现
  • 扎实的CUDA编程能力,深入理解GPU体系结构(SM、warp、shared memory、tensor core、访存层级)
  • 熟练使用Nsight Compute/Systems等性能分析工具,能定位计算/访存瓶颈
  • 熟悉至少一种训练/推理框架(如Megatron-LM、vLLM、TensorRT-LLM)
  • 理解Transformer结构及其计算特征

申请策略

  • 提前了解小红书在大模型方向的业务和技术栈,在面试中展现系统思维
  • 准备一个端到端的性能优化案例,说明从分析到落地的完整过程
  • 突出CUDA编程项目,尤其是GPU算子优化或相关开源贡献
  • 展示性能分析案例:如何通过Nsight定位瓶颈并提升性能
  • 如果有FlashAttention、vLLM等框架的改进经验,重点描述
  • 学习Triton或CUTLASS,掌握模板化kernel开发方法
  • 深入GPU体系结构,如warp调度、shared memory bank冲突

面试指南

  • 从硬件特性出发:分析SM、warp、memory hierarchy,找出计算或访存瓶颈
  • 提出具体优化方案:如tiling、fusion、vectorized load、stream overlap
  • 用Nsight验证效果,迭代优化
  • 如何优化一个Attention kernel?请从硬件角度分析瓶颈
  • 解释CUDA中shared memory的使用场景和bank conflict问题
  • 如何在算子中实现计算和访存重叠?
  • 你如何理解FlashAttention的原理?它解决了什么问题?
  • 如何在vLLM中实现continuous batching的算子优化?

职位点评

71
综合评分

前沿AI系统研发岗,技术驱动薪资优,现场办公WLB一般。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术成长和前沿挑战、对薪资有较高预期、能够接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展85
工作生活50
使命价值80

薪资福利

65中等

薪资未明确但岗位价值高,行业薪酬水准偏高,但缺乏具体福利信息,存在一定不确定性。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

85较高

技术前沿,涉及大模型算子优化、新硬件适配,成长空间巨大,但未明确晋升路径。

技术前沿前沿/新兴技术
技术栈CUDA、GPU、Transformer、MoE、量化、vLLM
业务类型ambiguous

工作生活

50较低

需在北京/上海/杭州现场办公,通勤压力大,未提及弹性工作或WLB,互联网大厂加班文化可能性较高。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

80较高

AI大模型属高速增长赛道,技术驱动创新,社会影响力中性,但个人对前沿技术的贡献感强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs