
百度
百度公有云模型训推加速工程师(J95356)
百度公有云模型训推加速工程师(J95356)
发布于 大约 16 小时前普通员工/个人贡献者
北京市 / 上海市
中级经验
全职员工
仅现场办公
本科
软件工程
Cuda
Deepspeed
Gpu优化
Megatron-Lm
Pytorch
Vllm
分布式训练
大模型训练
推理加速
AI 估算 · 25k–45k
百度大厂核心AI岗位,大模型方向技术壁垒高,薪资竞争力强,月薪预计25k-45k。
职位详情
关于这个职位
该职位主要负责百度公有云大模型训练与推理阶段的性能优化,包括分布式训练策略设计、推理加速技术落地以及GPU算子优化
你将深入使用CUDA、PyTorch等工具,在保证模型精度的前提下提升计算效率,并将优化方案应用到实际生产环境中
适合对高性能计算和大模型技术有浓厚兴趣的工程师
最低要求
计算机科学、电子信息或相关专业本科及以上学历
熟悉 PyTorch 框架及底层机制,了解 autograd、dispatcher、CUDA graph 等原理
熟悉大模型分布式训练方案,理解 NCCL 通信原语、混合精度训练(BF16/FP8)原理
熟悉主流推理加速框架(vLLM / TensorRT-LLM / TGI / SGLang 等),有实际部署优化经验
具备性能调优实战经验,能熟练使用 Nsight Systems / Compute、PyTorch Profiler 等工具
良好的工程能力与团队协作意识,能推动优化方案从原型到生产落地
工作职责
负责大模型训练阶段(SFT&RL)的性能优化,包括数据并行、张量并行、流水线并行等分布式训练策略的设计与实现
负责大模型推理阶段的加速优化,涵盖模型量化(INT8/INT4/FP8)、算子融合、KV Cache 优化、投机解码等技术落地
掌握cuda/cutlass dsl等编程,发掘GPU硬件特性,完成常见算子flashattention/gemm等优化工作
熟练使用Nsight Systems/Compute对算法的运行效率如速度、显存占用等进行优化,保证模型精度下提升模型的计算效率
跟踪业界前主流框架(如 DeepSpeed、Megatron-LM、vLLM、SGLang 等),评估并引入最佳实践
AI 洞察
优缺点分析
优点
- 大模型行业处于高速增长期,技术积累价值高,未来跳槽空间大
- 百度作为AI头部公司,技术资源丰富,能接触到前沿框架和硬件
- 工作内容深度结合理论与工程,个人技术成长速度快
- 技术难度大,需要同时掌握分布式系统、GPU编程和模型算法,学习曲线陡峭
- 需持续跟进快速迭代的开源社区和硬件平台,保持技术敏锐度
缺点 / 挑战
- 训推优化工作对结果要求高,可能面临较大交付压力
- 适合对高性能计算和AI底层技术有强烈兴趣,喜欢挑战高难度优化问题的工程师
角色解读
- 技术专家路线:在AI基础设施方向持续深耕,成为训推加速领域权威
- 架构师路线:从单点优化扩展至系统级设计,主导大型集群性能优化
- 团队管理路线:积累经验后带团队,负责AI平台整体性能与稳定性
- 设计和实现大模型分布式训练策略(数据并行、张量并行等),优化训练效率
- 负责推理加速优化,包括模型量化、算子融合、KV Cache等,降低推理延迟
- 使用CUDA和Nsight工具对GPU算子进行性能调优,提升显存和计算利用率
- 跟踪并引入业界最新框架(如vLLM、SGLang),推动优化方案量产落地
- 精通CUDA编程和GPU架构,能编写高效算子
- 深入理解PyTorch框架底层机制(autograd、CUDA graph等)
- 熟悉分布式训练框架(DeepSpeed、Megatron-LM)和推理加速框架
- 具备系统性性能分析能力,熟练使用Nsight系列工具
申请策略
- 面试准备时,准备一个你解决过的性能瓶颈案例,从问题定义到方案到效果完整讲述
- 了解百度的AI基础设施布局(如百度飞桨、昆仑芯),体现对方向的理解
- 突出GPU编程项目经验(如CUDA算子优化、使用Nsight调优)
- 重点描述参与过的大模型分布式训练或推理加速落地案例
- 展示对PyTorch、DeepSpeed、vLLM等框架的源码理解或贡献
- 若缺乏CUDA经验,建议先学习CUDA编程模型和常见算子优化模式
- 阅读DeepSpeed或vLLM核心代码,理解分布式策略和推理调度
- 动手在GPU上做一次完整的训练+推理性能分析练习
面试指南
- 先明确问题背景(如训练/推理、模型规模、硬件条件),再拆解瓶颈点,然后给出针对性优化方案,最后对比收益
- 结构化回答:原理说明->策略实现->性能评估->后续改进
- 请解释张量并行和流水线并行的区别及适用场景
- 如何优化一个Transformer层的推理速度?请给出具体思路
- 描述一次你使用Nsight系列工具定位并解决GPU性能瓶颈的经历
- 混合精度训练中BF16和FP8各有什么优缺点?如何避免精度损失?
- vLLM的KV Cache优化是如何实现的?与传统方法相比优势在哪里?
- 深入理解分布式训练常用策略及其通信开销模型
职位点评
74
综合评分
百度核心AI基础设施岗,技术前沿性极强、薪资竞争力好,但现场办公且WLB未明确,适合追求技术成就的工程师。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合以技术成长为首要目标的求职者,愿意在高强度、高回报的环境中快速积累前沿技能。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活40
使命价值80
薪资福利
75中等
百度作为上市巨头,薪资待遇在行业内具有竞争力,但该岗位未在JD中明确提及福利,薪资信号为未披露,因此补偿性动机满足程度中等偏上。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
95较高
该岗位涉及前沿大模型训推技术(FlashAttention、vLLM等),技术前沿性极强,成长信号明确,但未提及晋升通道,整体发展性动机满足程度很高。
技术前沿前沿/新兴技术
技术栈CUDA、PyTorch、DeepSpeed、Megatron-LM、vLLM、FlashAttention、NCCL、混合精度训练、量化、KV Cache
业务类型profit_center
工作生活
40较低
JD要求仅现场办公,未提及弹性工作或WLB信号,北京/上海一线城市通勤压力大,且大模型优化工作强度可能较高,生活化动机满足程度较低。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
80较高
大模型训推加速是AI基础设施的核心,对技术发展和产业应用有重要推动作用,行业处于高速增长期,创新性强,意义感动机满足程度较高。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
百度 的其他在招职位
相似职位推荐
Watch Jobs