
哔哩哔哩
大模型Infra工程师【2027届】
大模型Infra工程师【2027届】
发布于 大约 14 小时前普通员工/个人贡献者
上海市
无经验要求
全职员工
仅现场办公
本科
平台工程
Ai基础设施
Deepspeed
Gpu调度
Nccl
Tensorrt-Llm
Vllm
分布式训练
AI 估算 · 25k–40k
大模型基础设施岗位技术要求高,上海互联网大厂校招薪资竞争力强,应届生薪资区间合理。
职位详情
关于这个职位
B站大模型Infra工程师将负责建设支撑视频大模型的数据、训练、推理、评测与实验平台,包括GPU作业调度、分布式训练、模型serving等核心模块
你需独立负责一个平台模块,目标是让研究和数据团队迭代更快、成本更低、系统更稳定
该岗位技术挑战大,适合对AI基础设施和分布式系统充满热情的应届生
最低要求
届本科及以上学历
熟悉Python/Go/C++,理解Linux、Docker、Kubernetes、Ray、Slurm、Spark、Kafka、对象存储、PFS、Prometheus、Grafana等系统
理解GPU、显存、通信、NCCL、训练吞吐、推理延迟、数据IO和系统瓶颈
能主动用coding agents提升开发效率
工作职责
建设支撑视频大模型的数据、训练、推理、评测和实验平台,包括 GPU 作业调度、分布式训练、模型 serving、多模态数据管线、实验管理、可观测性、成本分析、自动报告和 agent-native research tooling
你的目标是让研究和数据团队迭代更快、成本更低、系统更稳定
独立负责一个平台模块,如数据加载、任务调度、实验系统、推理服务
优先资格
熟练使用AI agent能力者优先
熟悉CUDA/Triton、vLLM、TensorRT-LLM、DeepSpeed、FSDP、Megatron、RDMA、GPUDirect、异构GPU资源管理者优先
AI 洞察
优缺点分析
优点
- 大模型Infra是当前技术浪潮中的核心方向,技术含金量高,个人成长快
- B站拥有真实业务场景和大量视频数据,可接触大规模GPU集群
- 培养平台建设和系统设计能力,就业市场价值极高
- 技术栈跨度大,涉及底层性能调优,学习曲线陡峭
- 适合对分布式系统、GPU高性能计算和AI基础设施充满热情,喜欢解决复杂系统问题且抗压能力强的应届生
缺点 / 挑战
- 平台建设需要长期投入,可能面临重复运维和业务压力
- 大模型迭代迅速,需持续跟进新技术,工作强度可能较高
角色解读
- 从平台模块负责人成长为资深大模型基础设施工程师,深入GPU优化和分布式系统
- 可向AI基础设施架构师或技术专家方向发展,主导大规模平台设计
- 有机会转向大模型训练/推理性能优化等前沿领域,成为稀缺的复合型技术人才
- 建设支撑视频大模型的数据、训练、推理、评测和实验平台,包括GPU作业调度、分布式训练、模型serving等核心模块
- 独立负责一个平台模块,如数据加载、任务调度、实验系统、推理服务,保障系统稳定和性能
- 持续优化系统性能,降低训练和推理成本,提升研究和数据团队的迭代效率
- 扎实的编程能力,熟悉Python/Go/C++,掌握Linux、Docker、Kubernetes等基础设施知识
- 理解GPU架构、显存管理、NCCL通信、分布式训练和推理的底层链路
- 了解DeepSpeed、vLLM、TensorRT-LLM等主流框架,以及Ray、Slurm等调度系统
申请策略
- 在简历中明确标注2027届应届生身份,并突出自己熟练使用AI agent工具
- 了解B站视频业务,思考Infra如何支撑大模型在内容生成和理解上的应用
- 突出与GPU、分布式训练相关的项目或论文,尤其是使用过DeepSpeed、vLLM等框架
- 强调对Kubernetes、Ray等平台工具的实际使用经验,体现动手能力
- 展示编程实现和系统调优案例,有开源贡献更佳
- 学习CUDA编程和NCCL通信原理,动手实践小规模GPU集群
- 部署Kubernetes和Ray集群,熟悉调度和资源管理机制
- 阅读vLLM或DeepSpeed核心源码,理解推理加速和训练优化思路
面试指南
- 先讲原理再讲实践,结合具体项目说明你做了什么、解决了什么问题
- 从问题定义、方案设计、落地效果三个层面结构化回答
- 突出反思与优化过程,体现系统性思维和工程能力
- 介绍一个你使用过的分布式训练框架,并说明其核心架构和工作原理
- 如何设计一个GPU任务调度器?需要考虑哪些关键因素?
- 解释NCCL中的Ring AllReduce算法及其在分布式训练中的作用
- 如何排查分布式训练中GPU利用率低的问题?你会怎么定位和优化?
- 谈谈你对vLLM的理解,它如何提升推理吞吐和降低延迟?
职位点评
72
综合评分
B站大模型Infra校招岗,技术前沿成长快,薪资未明,现场办公WLB不明。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求前沿技术、渴望在大模型基础设施领域快速成长的应届生,对WLB要求高者需慎重。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活45
使命价值60
薪资福利
75中等
虽然JD未明确薪资福利,但大厂校招具备较强竞争力,结合岗位稀缺性,补偿性较好。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
90较高
技术栈前沿,覆盖大模型训练推理全栈,成长空间极大,能够深度参与AI基础设施核心建设。
技术前沿前沿/新兴技术
技术栈CUDA、Triton、vLLM、TensorRT-LLM、DeepSpeed、FSDP、Megatron、Kubernetes、Ray、NCCL
业务类型cost_center
工作生活
45较低
JD未说明工作制度,互联网大厂可能面临一定强度,现场办公为主,生活平衡保障不确定。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
大模型基础设施属前沿赛道,但日常以支撑内部团队为主,社会直接价值中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
蚂蚁集团-研发效能 Agent Infra-杭州
蚂蚁集团 · 杭州市AI 估算 · 35k-55kAnt International-Senior System Assurance Expert-Sovereign Cloud & Infrastructure SG/HK
蚂蚁集团 · 香港特别行政区AI 估算 · 70k-120kAgent Infra高级研发工程师
腾讯 · 深圳市AI 估算 · 35k-55kConsultant Specialist
汇丰 · 西安市AI 估算 · 15k-25kSenior Consultant Specialist
汇丰 · 广州市AI 估算 · 22k-38k
Watch Jobs