
小红书
【Dots】大模型算子优化工程师
【Dots】大模型算子优化工程师
发布于 大约 15 小时前普通员工/个人贡献者
北京市 / 上海市
中级经验
全职员工
仅现场办公
学历未注明
软件工程
Attention
Cuda
Gpu
Moe
Nccl
Vllm
大模型
量化
AI 估算 · 30k–50k
该岗位技术门槛高,GPU算子优化属前沿领域,市场需求旺盛,薪酬竞争力强,参考一线大厂AI工程师薪资水平。
职位详情
关于这个职位
该职位专注于大模型训练/推理场景下的高性能GPU算子开发与优化,需要深入理解GPU体系结构并利用CUDA等工具逼近硬件极限
你将参与FlashAttention、MoE等前沿算子的定制化实现,并与算法团队协作解决性能瓶颈,是推动AI基础设施演进的关键角色
最低要求
基础要求
扎实的 CUDA 编程能力,深入理解 GPU 体系结构(SM、warp、shared memory、tensor core、访存层级)
熟悉性能分析工具(Nsight Compute/Systems、nvprof),能定位并解决计算/访存瓶颈
熟悉至少一种主流训练或推理框架(Megatron-LM、vLLM、SGLang、TensorRT-LLM、FlashInfer 等)
理解 Transformer 结构及其在训练/推理中的计算特征
工作职责
面向大模型训练/推理场景,开发和优化高性能 GPU 算子(Attention、GEMM、LayerNorm、MoE、Element-wise 等),逼近硬件理论峰值
针对新模型结构(长 context、MoE、线性 Attention 等)设计定制化 kernel,解决原生框架无法覆盖的性能瓶颈
深度优化访存效率、计算-访存重叠、算子融合(fusion),降低 kernel launch 开销与显存占用
参与推理引擎核心链路优化:KV Cache 管理、量化算子(INT8/FP8/INT4)、投机采样、continuous batching 等
与训练框架、模型算法团队紧密协作,将算法需求转化为高效的系统实现
探索新硬件(新一代 GPU / 国产算力)上的算子适配与性能调优
优先资格
加分项:
有 FlashAttention / Fle Attention 等前沿算子的复现或改进经验
熟悉 Triton、CUTLASS,能高效开发模板化 kernel
有 FP8 / 低比特量化算子落地经验
有 MoE、长序列、投机解码等新场景的算子优化实战
熟悉 NCCL / 通信算子优化,理解计算-通信 overlap
有开源贡献(vLLM / SGLang / Triton / PyTorch 等)或顶会论文(MLSys、OSDI、ASPLOS 等)
AI 洞察
优缺点分析
优点
- 处于AI最前沿,技术含量高,能快速积累底层系统优化经验
- 小红书平台大,团队技术氛围浓厚,开源贡献多,个人影响力凸显
- 行业需求旺盛,薪资竞争力强,未来跳槽选择多
- 技术难度大,需要深入理解硬件架构,学习曲线陡峭
- 对系统性思维要求高,需同时理解算法、框架和硬件三层
- 适合对性能优化有极致追求、喜欢攻克底层技术难题、享受GPU利用率接近100%成就感的工程师
缺点 / 挑战
- 工作强度可能较高,面临大模型迭代速度快、性能要求严苛的压力
角色解读
- 向AI系统架构师发展,负责整个训练/推理系统的设计与优化
- 深入底层硬件方向,成为GPU/TPU等算力平台的性能专家
- 成为AI基础设施团队的技术负责人,领导算子优化与框架开发
- 开发和优化大模型训练/推理中的高性能GPU算子,使计算接近硬件极限
- 针对新模型结构(如长context、MoE)设计定制化kernel,解决框架无法覆盖的性能瓶颈
- 参与推理引擎核心链路优化,包括KV Cache管理、量化算子、投机采样等
- 与算法团队协作,将算法需求转化为高效的底层系统实现
- 扎实的CUDA编程能力,深入理解GPU体系结构(SM、warp、shared memory、tensor core、访存层级)
- 熟练使用Nsight Compute/Systems等性能分析工具,能定位计算/访存瓶颈
- 熟悉至少一种训练/推理框架(如Megatron-LM、vLLM、TensorRT-LLM)
- 理解Transformer结构及其计算特征
申请策略
- 提前了解小红书在大模型方向的业务和技术栈,在面试中展现系统思维
- 准备一个端到端的性能优化案例,说明从分析到落地的完整过程
- 突出CUDA编程项目,尤其是GPU算子优化或相关开源贡献
- 展示性能分析案例:如何通过Nsight定位瓶颈并提升性能
- 如果有FlashAttention、vLLM等框架的改进经验,重点描述
- 学习Triton或CUTLASS,掌握模板化kernel开发方法
- 深入GPU体系结构,如warp调度、shared memory bank冲突
面试指南
- 从硬件特性出发:分析SM、warp、memory hierarchy,找出计算或访存瓶颈
- 提出具体优化方案:如tiling、fusion、vectorized load、stream overlap
- 用Nsight验证效果,迭代优化
- 如何优化一个Attention kernel?请从硬件角度分析瓶颈
- 解释CUDA中shared memory的使用场景和bank conflict问题
- 如何在算子中实现计算和访存重叠?
- 你如何理解FlashAttention的原理?它解决了什么问题?
- 如何在vLLM中实现continuous batching的算子优化?
职位点评
71
综合评分
前沿AI系统研发岗,技术驱动薪资优,现场办公WLB一般。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求技术成长和前沿挑战、对薪资有较高预期、能够接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展85
工作生活50
使命价值80
薪资福利
65中等
薪资未明确但岗位价值高,行业薪酬水准偏高,但缺乏具体福利信息,存在一定不确定性。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
85较高
技术前沿,涉及大模型算子优化、新硬件适配,成长空间巨大,但未明确晋升路径。
技术前沿前沿/新兴技术
技术栈CUDA、GPU、Transformer、MoE、量化、vLLM
业务类型ambiguous
工作生活
50较低
需在北京/上海/杭州现场办公,通勤压力大,未提及弹性工作或WLB,互联网大厂加班文化可能性较高。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
80较高
AI大模型属高速增长赛道,技术驱动创新,社会影响力中性,但个人对前沿技术的贡献感强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小红书 的其他在招职位
相似职位推荐
Watch Jobs