
声网
深度学习系统工程师(GPU训练/推理)
深度学习系统工程师(GPU训练/推理)
发布于 大约 14 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Gpu
Pytorch
Tensorrt
Vllm
分布式训练
大语言模型
性能优化
深度学习
AI 估算 · 30k–60k
深度学习系统工程师技能稀缺,上海薪资水平高,结合上市公司平台,薪资竞争力强。
职位详情
关于这个职位
该职位专注于深度学习模型在NVIDIA GPU上的训练与推理加速,涉及LLM性能优化、混合精度、分布式训练等前沿技术
你将与算法、平台团队协作,推动模型全链路性能提升,适合对AI基础设施和性能优化有热情的工程师
最低要求
年以上深度学习系统、GPU 性能优化、训练加速或推理加速相关工作经验,有实际项目落地经验
熟练掌握 Python 和 / 或 C++,具备扎实的工程实现能力
熟悉 PyTorch 等主流深度学习框架,理解模型训练与推理的基本流程
对 NVIDIA GPU、CUDA、显存管理、并行计算有较好的理解,具备基本的性能分析和优化能力
能使用常见调试和性能分析工具,如
nsys、ncu、gdb 等,进行问题定位和性能瓶颈分析了解 Transformer、LLM 等常见模型的基本原理,有训练优化或推理优化相关经验者优先
具备较强的问题分析和 Debug 能力,良好的沟通协作能力和工程落地意识
工作职责
负责深度学习模型,尤其是大语言模型在 NVIDIA GPU 环境下的训练加速和推理加速工作,持续优化训练效率、推理时延、吞吐和显存占用
基于 PyTorch 等深度学习框架,参与模型训练链路和推理链路的性能分析、问题定位与优化落地
结合业务场景,参与训练和推理过程中的常见优化工作,包括混合精度、显存优化、批处理优化、并行策略优化等
与算法、平台、工程团队协作,推动模型从训练到部署全链路的性能提升和稳定运行
参与性能评测、Benchmark、Profiling 工具链和优化方法的建设,持续提升系统效率
优先资格
有 vLLM、SGLang、TensorRT-LLM、TensorRT 等推理引擎相关使用或优化经验
有混合精度训练、分布式训练、通信优化、模型并行等训练加速经验
有低比特量化、稀疏化、计算图优化、显存优化等实践经验
熟悉 cuDNN、CUTLASS、cuBLASLt 等 NVIDIA GPU 相关高性能库
了解推理优化技术,如 Continuous Batching、Paged Attention、Speculative Decoding 等
AI 洞察
优缺点分析
优点
- 技术前沿,与大模型性能优化直接相关,技能稀缺性强
- 上市公司平台,有真实大规模业务场景,能积累实战经验
- 涵盖训练和推理全链路,技术深度和广度兼备
- 性能优化问题复杂,需要深入底层,调试难度大,可能加班
- 技术迭代快,需要持续学习新工具和框架
- 跨团队协作要求高,需较强的沟通能力
缺点 / 挑战
- 适合对AI基础设施、GPU高性能计算有浓厚兴趣,喜欢钻研底层性能瓶颈的工程师
角色解读
- 成为GPU性能优化专家,深入底层硬件与算法协同设计
- 向AI基础设施架构师方向发展,负责大规模训练/推理集群的设计与优化
- 有机会参与前沿LLM推理引擎(如vLLM、TensorRT-LLM)的研发,紧追技术前沿
- 负责大语言模型在NVIDIA GPU上的训练和推理加速,优化训练效率、时延、吞吐和显存占用
- 使用PyTorch等框架进行性能分析、定位瓶颈并实施优化,如混合精度、显存优化、并行策略
- 与算法、平台、工程团队协作,保障模型训练到部署全链路的性能稳定
- 建设性能评测、Benchmark和Profiling工具链
- 扎实的Python/C++编程能力,能进行底层性能优化
- 熟悉PyTorch和深度学习训练/推理流程
- 理解NVIDIA GPU架构、CUDA编程、显存管理和并行计算
- 会使用nsys、ncu、gdb等性能分析工具定位瓶颈
申请策略
- 面试中主动展示对性能瓶颈的分析思路和优化方法论
- 了解声网在AI音频/视频领域的业务场景,尝试结合其业务思考优化方向
- 突出GPU性能优化项目经验,具体量化提升效果(如训练提速X%)
- 展示PyTorch/CUDA相关的工程实践,如自定义算子、混合精度训练
- 强调使用nsys/ncu等工具定位问题的案例,体现Debug能力
- 熟悉常用推理引擎如vLLM/TensorRT-LLM,了解其实现原理
- 学习CUTLASS、cuBLASLt等高性能库,掌握更底层优化技巧
- 补充分布式训练知识和通信优化经验
面试指南
- 回答技术问题采用STAR法则(情境-任务-行动-结果),突出量化结果
- 对于优化方法类问题,先拆解问题,提出假设,再用工具验证,逐步定位
- 对于方案设计类问题,从需求、约束、权衡、可行性等方面展开
- 请描述一次你优化PyTorch模型训练性能的经历,具体做了哪些工作?
- 如何分析CUDA kernel的性能瓶颈?你通常使用哪些工具?
- 解释混合精度训练的原理,以及在NVIDIA GPU上如何实现?
- 对于LLM推理,你了解哪些优化技术?如Continuous Batching、Paged Attention
- 如何设计一个性能评测方案来验证优化效果?
职位点评
70
综合评分
前沿GPU优化技术、发展空间大,但薪资未明示且工作强度不确定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术成长、热爱GPU底层优化、能接受一定工作压力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值70
薪资福利
70中等
薪资未明确披露,但岗位稀缺,上海大厂,预计薪资较高;JD未提及福利,但上市公司通常有完善福利。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
85较高
涉及前沿的大模型加速技术,技能成长空间大,但JD未明确晋升路径,主要靠技术积累和项目历练。
技术前沿前沿/新兴技术
技术栈PyTorch、CUDA、GPU、LLM、vLLM、TensorRT、混合精度、分布式训练
业务类型ambiguous
工作生活
50较低
JD未提及远程或弹性工作,默认现场办公;性能优化工作可能压力较大,工作强度不确定。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI行业高速发展,技术影响力大,但职位偏技术实现,社会价值中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
声网 的其他在招职位
相似职位推荐
Watch Jobs