Baidu logo
百度
百度公有云模型训推加速工程师(J95356)

百度公有云模型训推加速工程师(J95356)

发布于 大约 16 小时前

普通员工/个人贡献者

北京市 / 上海市
中级经验
全职员工
仅现场办公
本科
软件工程
Cuda
Deepspeed
Gpu优化
Megatron-Lm
Pytorch
Vllm
分布式训练
大模型训练
推理加速

AI 估算 · 25k–45k

百度大厂核心AI岗位,大模型方向技术壁垒高,薪资竞争力强,月薪预计25k-45k。

职位详情

关于这个职位

该职位主要负责百度公有云大模型训练与推理阶段的性能优化,包括分布式训练策略设计、推理加速技术落地以及GPU算子优化

你将深入使用CUDA、PyTorch等工具,在保证模型精度的前提下提升计算效率,并将优化方案应用到实际生产环境中
适合对高性能计算和大模型技术有浓厚兴趣的工程师

最低要求

计算机科学、电子信息或相关专业本科及以上学历

熟悉 PyTorch 框架及底层机制,了解 autograd、dispatcher、CUDA graph 等原理
熟悉大模型分布式训练方案,理解 NCCL 通信原语、混合精度训练(BF16/FP8)原理
熟悉主流推理加速框架(vLLM / TensorRT-LLM / TGI / SGLang 等),有实际部署优化经验
具备性能调优实战经验,能熟练使用 Nsight Systems / Compute、PyTorch Profiler 等工具
良好的工程能力与团队协作意识,能推动优化方案从原型到生产落地

工作职责

负责大模型训练阶段(SFT&RL)的性能优化,包括数据并行、张量并行、流水线并行等分布式训练策略的设计与实现

负责大模型推理阶段的加速优化,涵盖模型量化(INT8/INT4/FP8)、算子融合、KV Cache 优化、投机解码等技术落地
掌握cuda/cutlass dsl等编程,发掘GPU硬件特性,完成常见算子flashattention/gemm等优化工作
熟练使用Nsight Systems/Compute对算法的运行效率如速度、显存占用等进行优化,保证模型精度下提升模型的计算效率
跟踪业界前主流框架(如 DeepSpeed、Megatron-LM、vLLM、SGLang 等),评估并引入最佳实践

AI 洞察

优缺点分析

优点

  • 大模型行业处于高速增长期,技术积累价值高,未来跳槽空间大
  • 百度作为AI头部公司,技术资源丰富,能接触到前沿框架和硬件
  • 工作内容深度结合理论与工程,个人技术成长速度快
  • 技术难度大,需要同时掌握分布式系统、GPU编程和模型算法,学习曲线陡峭
  • 需持续跟进快速迭代的开源社区和硬件平台,保持技术敏锐度

缺点 / 挑战

  • 训推优化工作对结果要求高,可能面临较大交付压力
  • 适合对高性能计算和AI底层技术有强烈兴趣,喜欢挑战高难度优化问题的工程师

角色解读

  • 技术专家路线:在AI基础设施方向持续深耕,成为训推加速领域权威
  • 架构师路线:从单点优化扩展至系统级设计,主导大型集群性能优化
  • 团队管理路线:积累经验后带团队,负责AI平台整体性能与稳定性
  • 设计和实现大模型分布式训练策略(数据并行、张量并行等),优化训练效率
  • 负责推理加速优化,包括模型量化、算子融合、KV Cache等,降低推理延迟
  • 使用CUDA和Nsight工具对GPU算子进行性能调优,提升显存和计算利用率
  • 跟踪并引入业界最新框架(如vLLM、SGLang),推动优化方案量产落地
  • 精通CUDA编程和GPU架构,能编写高效算子
  • 深入理解PyTorch框架底层机制(autograd、CUDA graph等)
  • 熟悉分布式训练框架(DeepSpeed、Megatron-LM)和推理加速框架
  • 具备系统性性能分析能力,熟练使用Nsight系列工具

申请策略

  • 面试准备时,准备一个你解决过的性能瓶颈案例,从问题定义到方案到效果完整讲述
  • 了解百度的AI基础设施布局(如百度飞桨、昆仑芯),体现对方向的理解
  • 突出GPU编程项目经验(如CUDA算子优化、使用Nsight调优)
  • 重点描述参与过的大模型分布式训练或推理加速落地案例
  • 展示对PyTorch、DeepSpeed、vLLM等框架的源码理解或贡献
  • 若缺乏CUDA经验,建议先学习CUDA编程模型和常见算子优化模式
  • 阅读DeepSpeed或vLLM核心代码,理解分布式策略和推理调度
  • 动手在GPU上做一次完整的训练+推理性能分析练习

面试指南

  • 先明确问题背景(如训练/推理、模型规模、硬件条件),再拆解瓶颈点,然后给出针对性优化方案,最后对比收益
  • 结构化回答:原理说明->策略实现->性能评估->后续改进
  • 请解释张量并行和流水线并行的区别及适用场景
  • 如何优化一个Transformer层的推理速度?请给出具体思路
  • 描述一次你使用Nsight系列工具定位并解决GPU性能瓶颈的经历
  • 混合精度训练中BF16和FP8各有什么优缺点?如何避免精度损失?
  • vLLM的KV Cache优化是如何实现的?与传统方法相比优势在哪里?
  • 深入理解分布式训练常用策略及其通信开销模型

职位点评

74
综合评分

百度核心AI基础设施岗,技术前沿性极强、薪资竞争力好,但现场办公且WLB未明确,适合追求技术成就的工程师。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合以技术成长为首要目标的求职者,愿意在高强度、高回报的环境中快速积累前沿技能。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活40
使命价值80

薪资福利

75中等

百度作为上市巨头,薪资待遇在行业内具有竞争力,但该岗位未在JD中明确提及福利,薪资信号为未披露,因此补偿性动机满足程度中等偏上。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

95较高

该岗位涉及前沿大模型训推技术(FlashAttention、vLLM等),技术前沿性极强,成长信号明确,但未提及晋升通道,整体发展性动机满足程度很高。

技术前沿前沿/新兴技术
技术栈CUDA、PyTorch、DeepSpeed、Megatron-LM、vLLM、FlashAttention、NCCL、混合精度训练、量化、KV Cache
业务类型profit_center

工作生活

40较低

JD要求仅现场办公,未提及弹性工作或WLB信号,北京/上海一线城市通勤压力大,且大模型优化工作强度可能较高,生活化动机满足程度较低。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

80较高

大模型训推加速是AI基础设施的核心,对技术发展和产业应用有重要推动作用,行业处于高速增长期,创新性强,意义感动机满足程度较高。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs