Bilibili logo
哔哩哔哩
bilibili-多模态训练优化工程师

bilibili-多模态训练优化工程师

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Deepspeed
Gpu集群
Megatron
Nccl
Pytorch
分布式训练
多模态

AI 估算 · 35k–65k

算法基础设施岗位,技术门槛高,大厂薪资竞争力强,通常16薪。

职位详情

关于这个职位

该职位是bilibili的多模态训练优化工程师,负责大规模GPU集群的训练系统建设与性能优化,解决超大规模训练任务中的稳定性、通信瓶颈、断点恢复等问题,并通过算子调优和自动化运维工具提升GPU利用率

适合精通C++/Python、熟悉Megatron/DeepSpeed等训练框架底层原理,并对分布式训练有深入理解的工程师

最低要求

精通C++、Rust、Python等任意一门语言,C++更佳,具备良好的系统设计与工程实现能力

熟悉Megatron、DeepSpeed、PyTorch、FSDP等一种或者多种训练框架的底层原理
有真实GPU训练任务调优经验,解决过训练中出现过的慢节点、机器故障、网络拥塞等问题
在大规模训练任务中,有过算子调优、精度验证、CUDA优化、训练策略优化(ZeRO/TP/PP/DP/EP)等经验
有RDMA网络、高性能存储、NCCL通讯等方面的经验,熟悉Linux系统编程

工作职责

负责大规模GPU集群的管理与训练系统建设,包括任务调度、资源管理、训练框架适配与性能优化

解决超大规模训练任务中出现的稳定性、网络通讯、NCCL通讯、断点恢复等问题,构建训练全链路可观测体系
针对不同GPU型号,进行算子适配和算子调优,实现慢节点自动检测与故障自愈
针对不同训练场景、集群环境,设计自动化运维工具,持续优化训练方案与GPU有效利用率
与算法、数据、平台紧密配合,打造一套高效的训练生态,推动训练成本优化

优先资格

社区开源训推框架贡献者,包括但不限于Megatron、DeepSpeed、SGLang、vLLM等

有大规模音视频生成与理解模型的训练/推理优化经验,如视频生成、多模态理解等方向
有大规模MoE(Mixture of Experts)与Diffusion Transformer(DiT)模型的训练性能优化、显存优化、通信优化等实战经验
有千卡/万卡GPU任务训推经验, 有H卡、B卡针对性调优经验

AI 洞察

优缺点分析

优点

  • 身处AI基础设施核心岗位,技术深度和广度兼备,能接触到大规模GPU集群和前沿训练框架
  • 公司为大型上市互联网平台,业务稳定,技术投入大,有成熟的训练平台建设环境
  • 多模态、大模型方向是行业热点,职业发展前景广阔,薪酬竞争力强
  • 与算法、平台团队密切协作,能快速积累跨领域经验
  • 训练优化涉及硬件、网络、系统、算法等多领域知识,学习曲线陡峭
  • 可能面临高强度的开发任务,生产环境稳定性要求高
  • 适合对大规模分布式训练、底层系统优化有浓厚兴趣,具备扎实编程功底和较强问题排查能力的工程师

缺点 / 挑战

  • 需要处理超大规模训练中的各种疑难杂症,压力大,问题定位复杂

角色解读

  • 从训练优化工程师向分布式系统专家或AI基础设施架构师方向发展
  • 可深入多模态大模型训练优化,成为稀缺的AI Infra人才
  • 未来有机会领导训练平台团队,负责超大规模集群的架构设计
  • 负责大规模GPU集群的训练系统建设,包括任务调度、资源管理、训练框架适配与性能优化
  • 解决超大规模训练任务中的稳定性、网络通讯、NCCL通讯、断点恢复等问题,构建可观测体系
  • 针对不同GPU型号进行算子适配和调优,实现慢节点自动检测与故障自愈
  • 与算法、数据、平台团队协作,设计自动化运维工具,优化训练方案与GPU利用率
  • 精通C++、Rust、Python等至少一门语言,具备扎实的系统设计与工程实现能力
  • 熟悉Megatron、DeepSpeed、PyTorch、FSDP等训练框架的底层原理
  • 有真实GPU训练任务调优经验,熟悉慢节点、机器故障、网络拥塞等问题的处理
  • 了解RDMA网络、高性能存储、NCCL通讯等技术,熟悉Linux系统编程

申请策略

  • 了解bilibili的业务方向(如音视频、多模态内容),在自我介绍中体现与之相关的经验
  • 关注公司AI基础设施团队的招聘要求和项目动态,展示对训练成本优化的理解
  • 突出参与过的GPU训练集群建设或优化项目,具体描述规模、挑战和结果
  • 强调对PyTorch/Megatron/DeepSpeed等框架的源码级理解或贡献
  • 展示解决慢节点、通信瓶颈、断点恢复等实际运维问题的经验
  • 如有开源贡献、CUDA调优或MoE/DiT训练优化经历,务必重点提及
  • 熟悉NCCL通信原理和RDMA网络,动手配置和排查通信问题
  • 深入阅读Megatron或DeepSpeed的源码,理解ZeRO、TP/PP/DP/EP等并行策略

面试指南

  • 使用STAR法则:情境(Situation)、任务(Task)、行动(Action)、结果(Result),清晰展示项目经验和贡献
  • 回答技术问题时,先阐述原理,再结合实践案例,最后总结优化效果或经验教训
  • 对于系统设计题,可按照需求分析、架构设计、关键模块实现、风险与优化等步骤展开
  • 请介绍一下你参与过的最大规模训练任务,遇到了哪些问题,如何优化?
  • 谈谈你对Megatron和DeepSpeed中分布式并行策略的理解
  • 如何诊断和解决训练中的慢节点问题?
  • NCCL通信超时如何排查?具体有哪些步骤?
  • 如果让你设计一个千卡GPU集群的训练任务调度系统,你会考虑哪些关键点?

职位点评

70
综合评分

AI Infra高端岗位,技术前沿,发展空间大,但工作地点固定,WLB不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和发展空间的求职者,对薪资和福利有一定要求,但能接受现场办公和可能的快节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值70

薪资福利

65中等

JD未提及具体薪资和福利,但根据公司上市地位和岗位稀缺性,预计薪资较高。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

90较高

岗位涉及大规模GPU集群、前沿训练框架和优化技术,能深度提升分布式系统和AI Infra能力。

技术前沿前沿/新兴技术
技术栈Megatron、DeepSpeed、PyTorch、FSDP、NCCL、CUDA、RDMA、MoE、DiT、GPU集群
业务类型cost_center

工作生活

50较低

工作地在上海,需要现场办公,JD未提及弹性工作或加班情况,工作强度可能较高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI训练优化属于高速发展赛道,对推动大模型技术落地有贡献,但bilibili的社会使命属性一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs