Baidu logo
百度
大模型训练框架研发工程师 (训练效率优化方向)(J103616)

大模型训练框架研发工程师 (训练效率优化方向)(J103616)

发布于 大约 15 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Cuda
Deepspeed
Fsdp
Megatron-Lm
Moe
Nccl
Pytorch
分布式训练
混合精度训练

AI 估算 · 30k–60k

百度大模型核心岗位,技术要求高,市场稀缺,薪资处于行业高位。

职位详情

关于这个职位

这是一个深度技术岗,专注于百度大模型的训练效率优化

你将负责构建和优化百亿/千亿级参数模型的分布式训练框架,解决显存、通信和稳定性瓶颈,使用CUDA/Triton等工具开发高性能算子
适合对AI基础设施有热情、追求极致性能的资深工程师

最低要求

精通C/C++/Python中至少一种语言,具备扎实的编程功底,有丰富的大规模分布式系统开发与调试经验

深入理解大模型基本原理和Transformer架构,熟悉PyTorch底层机制(如Autograd, Dispatcher, CUDA Stream/Event)
精通Megatron-LM、DeepSpeed、FSDP等至少一种主流分布式训练框架,并具备实际训练调优经验
具备GPU性能分析与调优能力,熟悉 GPU 体系结构与 CUDA 编程模型,了解SM、Warp、Memory Hierarchy、Tensor Core 等基本原理
具备 CUDA/CUTLASS/Triton等 GPU Kernel 开发与优化经验,能够针对训练热点算子进行性能分析、实现与优化
深入理解分布式训练中的通信与计算协同,熟悉NCCL通信原语,能分析和优化通信瓶颈,具备百卡/千卡级训练通信调优或稳定性治理经验
具备优秀的问题定位和工程闭环能力,能够快速定位并攻克训练效率、稳定性等方面的技术难题
具备强烈的自驱力和持续学习精神,热爱挑战,对前沿AI技术始终保持热情

工作职责

负责公司基础大模型与专精大模型的训练效率优化,面向预训练、SFT、RL、DPO、知识蒸馏等训练场景,专注于提升百亿/千亿/万亿参数规模模型的训练吞吐、资源利用率与稳定性,支撑模型能力高效迭代与落地

负责构建并持续优化高效的分布式训练框架,探索和优化多维并行策略,包括DP/TP/PP/CP/EP等
紧密跟踪Megatron-LM、DeepSpeed、FSDP等业界主流框架进展,解决大规模训练尤其是长上下文中的显存瓶颈、通信开销和负载均衡问题
主导高性能训练算子的设计、实现与优化,基于CUDA/CUTLASS/Triton/TileLang等工具,针对MoE、Attention、ViT等特定模型结构进行定制化算子开发
通过算子融合、显存复用、混合精度训练(BF16/FP84)、低比特量化与量化感知训练等手段提升训练吞吐
构建并维护训练全链路性能分析与稳定性保障体系,熟练使用Nsight Systems/Compute、PyTorch Profiler等工具进行端到端性能瓶颈分析
负责解决大规模训练中的NCCL超时、显存溢出(OOM)、训练波动等稳定性问题,确保训练任务的高效、稳定运行
探索并引入业界前沿的训练加速技术,例如DualPipe、异步/重叠通信、通信压缩等,持续迭代内部训练平台能力,为算法团队提供更强大的实验支撑

优先资格

有从零到一搭建或主导优化大规模分布式训练系统的经验

在顶级会议(如MLSys, NeurIPS, OSDI等)发表过相关论文,或有知名开源项目(如Megatron-LM, DeepSpeed)贡献经验
了解推理引擎(如sglang, vLLM)的基本原理,能在训练阶段前瞻性地考虑部署优化

AI 洞察

优缺点分析

优点

  • 百度提供丰富GPU资源和真实业务场景,成果可直接落地并产生巨大影响力
  • 团队技术氛围浓厚,有机会与业界顶级专家合作,快速提升技术深度
  • 工作强度较大,需要跟上大模型快速迭代节奏,可能涉及紧急问题排查
  • 技术门槛高,需要对分布式系统、GPU编程和深度学习均有深入理解,学习曲线陡峭
  • 竞争激烈,需要持续跟进多篇顶级会议论文和开源项目动态
  • 适合对AI基础设施有极致追求、享受攻克技术难题、有较强自驱力的资深工程师

缺点 / 挑战

  • 参与国内最前沿的大模型训练优化,技术天花板高,能接触到万亿参数级别挑战

角色解读

  • 技术深耕:成为大模型训练基础设施领域的专家,主导下一代训练框架设计
  • 架构师路线:从单点优化到全局系统设计,负责大规模AI平台的架构演进
  • 跨界发展:向推理优化、AI平台、甚至AI芯片设计等方向拓展
  • 负责百度基础大模型与专精大模型的训练效率优化,提升预训练、SFT、RL等场景的吞吐与稳定性
  • 构建并优化分布式训练框架,探索DP/TP/PP等多维并行策略,解决显存、通信和负载均衡问题
  • 开发高性能训练算子,基于CUDA/Triton针对MoE、Attention等结构进行定制优化
  • 精通C/C++/Python,具备大规模分布式系统开发调试经验
  • 深入理解Transformer和PyTorch底层机制,精通Megatron-LM、DeepSpeed等框架
  • 具备GPU性能调优能力,熟悉CUDA编程和GPU体系结构,有Kernel开发经验
  • 熟悉NCCL通信原语,有百卡/千卡级通信优化经验

申请策略

  • 面试前准备好一个你主导的分布式训练优化项目的完整技术细节,包括挑战、方案、结果
  • 了解百度飞桨平台(PaddlePaddle)可能更佳,但非必需
  • 突出大规模分布式训练项目经验,包括框架选型、并行策略、性能指标等
  • 展示GPU Kernel开发案例,如算子融合、显存优化、性能提升数据
  • 强调对开源贡献(如Megatron-LM、DeepSpeed)或相关论文发表经历
  • 体现解决稳定性问题的实例,如NCCL超时、OOM等定位与修复
  • 深入学习CUDA编程和GPU体系结构,可以阅读《CUDA编程指南》或参加NVIDIA认证
  • 动手复现Megatron-LM或DeepSpeed的核心并行策略,理解代码实现

面试指南

  • 先明确问题背景和约束(模型规模、硬件环境),然后分步骤提出优化策略(数据并行、模型并行、算子融合等),最后量化预期收益
  • 对于排查类问题,按照现象→日志→工具分析→定位根因→解决方案的流程回答,展示系统性思维
  • 请描述你如何优化一个大规模Transformer模型的训练吞吐?
  • 在分布式训练中,遇到NCCL超时如何排查?
  • 请解释ZeRO-1/2/3的原理和适用场景
  • 如何实现一个高效的FlashAttention算子?
  • 谈谈你对MoE模型训练中负载均衡问题的理解
  • 复习分布式训练经典论文(如Megatron-LM、DeepSpeed ZeRO、FlashAttention)

职位点评

72
综合评分

百度大模型核心研发岗,前沿技术栈,高成长但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合高度自驱、追求技术成长、能适应高强度工作的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活40
使命价值75

薪资福利

70中等

百度大厂薪资福利有竞争力,但具体薪资未披露,且工作强度可能较高,补偿性动机满足中等。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

95较高

该岗位处于AI技术最前沿,使用最新训练框架和技术,成长机会极大,论文和开源贡献受鼓励。

技术前沿前沿/新兴技术
技术栈CUDA、Megatron-LM、DeepSpeed、Triton、MoE、DualPipe
成长机会持续学习精神、前沿AI技术、顶级会议
业务类型profit_center

工作生活

40较低

仅现场办公,未提及弹性工作或WLB,大模型训练岗位通常需要响应紧急问题,生活化动机满足较低。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

推动大模型技术发展,属于高速增长赛道,社会影响力较大,但偏商业化,使命感一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
Watch Jobs