Bilibili logo
哔哩哔哩
大模型训推平台技术专家

大模型训推平台技术专家

发布于 大约 16 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
CI/CD
Go
Gpu集群调度
Nccl
Rdma
Volcano
分布式训练
可观测性
故障检测

AI 估算 · 35k–65k

上海大模型平台核心技术岗,技能稀缺度高,薪资竞争力强,参考市场高位。

职位详情

关于这个职位

该职位负责哔哩哔哩自研大模型训推一体化平台的架构设计与落地,包括万卡级GPU集群调度、自动故障检测与恢复、以及模型训推DevOps流水线

你将与顶尖工程师协作,解决大规模分布式训练中的资源调度、网络通信和稳定性难题,是AI基础设施的核心技术岗位

最低要求

本科及以上,5年以上Infra/平台工程经验,能独立负责一个技术方向的架构与落地

精通Go或Python,深入理解K8s生态与Operator模式
理解分布式训练(DDP/Pipeline/MoE)或大模型推理Serving架构
GPU集群调度、训练框架、推理引擎至少其一有深度实战经验
熟悉NCCL/IB/RDMA等高性能网络

工作职责

大规模预训练资源调度:设计GPU万卡级集群调度系统,支持拓扑感知、跨机房调度与多租户配额

基于K8s/Volcano等构建调度内核,训练任务排队、抢占、弹性调度,持续提升集群GPU利用率
拓扑感知放置(NVLink/IB)与跨机房/跨可用区调度,最小化跨交换机通信开销
通信与存储IO路径优化,配合训练框架提升端到端通信效率
自动故障检测与恢复:构建训练全链路健康监测与自愈闭环,最小化故障对训练进度的影响
训练全链路健康监测:NCCL hang、GPU Xid、网络抖动、存储异常的自动检测
Checkpoint自动管理+断点续训,故障迁移后快速恢复
故障自愈闭环:检测→诊断→迁移→恢复,沉淀故障知识库与回溯能力
模型训推DevOps:打通"代码→镜像→训练→产物→上线"全流程,构建训推一体化交付闭环
镜像与产物治理:训练/推理基础镜像标准化,模型权重与Checkpoint版本化registry,统一artifacts生命周期管理
CI/CD与发布:训练代码与推理服务持续集成(镜像构建/单测/自动评测),推理灰度发布、回滚、A-B流量切换
可观测与稳定性:训练任务与推理服务的指标/日志/链路监控,SLI/SLO与告警闭环,故障注入与应急演练

优先资格

万卡级预训练平台或大规模推理平台0→1建设经验

拓扑感知调度、训练故障自愈、推理分离架构其一有落地经验
开源社区贡献(Megatron/Volcano/Ray/vLLM/SGLang等)

AI 洞察

优缺点分析

优点

  • 大模型赛道是当前技术热点,积累的核心技能(如万卡调度、故障自愈)市场认可度极高
  • 公司已上市,稳定性较好,且技术团队氛围浓厚
  • 技术栈更新快,需要持续学习NCCL、K8s等社区最新进展
  • 对综合能力要求高,需同时掌握调度、网络、DevOps等多个领域
  • 适合有深厚基础设施背景、热爱解决分布式系统难题、对AI基础设施有强烈兴趣的工程师

缺点 / 挑战

  • B站作为大型互联网平台,技术挑战大,能接触前沿的AI基础设施实践
  • 工作强度可能较高,需应对大规模集群的复杂问题和紧急故障

角色解读

  • 可成长为AI基础设施架构专家,主导更大规模训练平台的设计
  • 有机会转向技术管理岗位,带领团队攻克前沿难题
  • 跨领域发展至模型优化、推理部署等方向,拓宽技术边界
  • 设计并优化万卡级GPU集群调度系统,确保资源高效利用和训练任务稳定运行
  • 构建全链路故障检测与自愈机制,自动处理NCCL hang、GPU故障等异常,减少训练中断
  • 打造训推一体化DevOps流水线,实现从代码到上线的自动化交付和灰度发布
  • 负责高性能网络(NCCL/IB/RDMA)的通信优化和拓扑感知调度,提升分布式训练效率
  • 精通Go或Python,深入理解K8s生态与Operator模式
  • 掌握分布式训练(DDP/Pipeline/MoE)或大模型推理Serving架构
  • 具有GPU集群调度、训练框架或推理引擎的深度实战经验
  • 熟悉NCCL、InfiniBand、RDMA等高性能网络技术

申请策略

  • 在简历中强调独立架构设计的能力,并准备一两个复杂问题的解决案例
  • 关注B站技术博客或开源项目,了解团队技术栈,面试中展示对业务的理解
  • 突出GPU集群调度、故障自愈或训推平台的落地项目经验,用数据说明效果(如利用率提升、故障恢复时间)
  • 展示K8s相关贡献(如Operator开发、Volcano使用),以及Go/Python的工程能力
  • 如果有开源贡献,详细描述在Megatron/Volcano/Ray等项目中的具体工作
  • 补充对NCCL、IB/RDMA底层原理的理解,可以通过阅读NVIDIA官方文档或实验
  • 熟悉Volcano、Kubeflow等K8s AI调度项目,实践部署与调优
  • 了解主流大模型训练框架(Megatron-LM、DeepSpeed)的架构和通信模式

面试指南

  • 明确问题边界,先定义关键约束(如集群规模、网络拓扑)
  • 给出技术选型依据(如选择Volcano的理由),并对比备选方案
  • 结合实战经验,描述遇到的具体挑战和解决思路,突出量化成果
  • 请描述大规模GPU集群调度的设计,如何实现拓扑感知和避免通信瓶颈?
  • 遇到NCCL hang或GPU Xid错误时,你的排查和自动恢复方案是什么?
  • 如何设计一个支持断点续训的Checkpoint管理系统?
  • 谈谈你对K8s Operator模式的理解,如何自定义一个训练任务调度器?
  • 在训推一体化DevOps中,如何保证模型版本和镜像的一致性?

职位点评

66
综合评分

大厂核心技术岗,前沿大模型平台,高发展性,但工作强度和WLB需自行评估。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿、渴望成长和挑战的工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活40
使命价值60

薪资福利

65中等

薪资未明确,但通常大厂核心技术岗位薪资竞争力强,但未提及福利。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

90较高

岗位涉及大模型训练前沿技术,技能挑战大,成长空间广阔,但未明确提及培训晋升。

技术前沿前沿/新兴技术
技术栈K8s、Volcano、NCCL、RDMA、分布式训练、大模型
业务类型ambiguous

工作生活

40较低

未提及远程或弹性办公,工作地点为上海,通勤压力未知,且可能面对高强度工作。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

B站作为内容平台,AI基础设施支撑业务发展,有一定的技术影响力,但社会价值中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs