
哔哩哔哩
【B-UP】强化学习训练框架工程师(实习)
【B-UP】强化学习训练框架工程师(实习)
发布于 大约 14 小时前实习/见习
上海市
无经验要求
实习生
仅现场办公
本科
机器学习工程
Cv
Dapo
Dit
Grpo
Moe
Nlp
Verl
Vlm
多模态
AI 估算 · 4k–6k
B站大厂实习,强化学习热门方向,薪资位于市场实习中等水平。
职位详情
关于这个职位
这是一个哔哩哔哩的强化学习训练框架实习岗位,你将参与大规模模型训练框架的研发与优化,深入性能调优和前沿技术探索
适合对强化学习、多模态模型感兴趣的同学,能获得一线大厂实战经验
最低要求
本科及以上学历,计算机相关专业
熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础
深入理解自然语言处理、计算机视觉或多模态算法,熟悉主流的 DiT 与 VLM 模型架构
熟悉常见强化学习训练算法(如 GRPO、DAPO 等)及训练框架(如 verl),熟悉异步强化学习范式
工作职责
参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率
深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性
持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)
优先资格
有相关领域开源项目贡献经验者优先
具备大规模训练实操经验者优先
AI 洞察
优缺点分析
优点
- 哔哩哔哩大厂平台,实习经历含金量高
- 接触前沿强化学习训练技术,技术成长快
- 团队氛围好,有机会参与开源项目
- 需要同时掌握算法和系统优化技能,知识跨度大
- 适合对强化学习和系统优化有浓厚兴趣,愿意深入底层技术,且具备较强自驱力的同学
缺点 / 挑战
- 实习岗位,可能面临较大学习压力和技术深度要求
角色解读
- 从实习转正为正式员工,深入参与核心框架开发
- 向 AI 系统专家方向成长,成为大模型训练优化领域的资深工程师
- 可横向迁移至算法或工程团队,拓展技术广度
- 参与强化学习训练框架的研发,优化大规模模型训练效率
- 分析训练系统中的性能瓶颈,进行针对性优化
- 跟踪并集成前沿训练优化技术,如 MoE、异步RL 等
- 扎实的编程基础,熟悉 Python 或 C++
- 深入理解 NLP、CV 或多模态算法及主流模型架构
- 熟悉强化学习训练算法和框架,如 GRPO、verl 等
申请策略
- 在简历中展示对 AI 工程化的热情,比如个人博客或 GitHub 项目
- 了解哔哩哔哩的业务场景,思考强化学习如何应用于视频推荐或内容生成
- 突出强化学习或相关领域的项目经验,尤其是训练框架使用或优化经历
- 强调编程能力,特别是 Python/C++ 的性能优化经验
- 如有开源贡献或大规模训练经验,务必重点提及
- 提前熟悉 verl 等主流强化学习训练框架
- 复习深度学习模型架构(如 DiT、VLM)和常见训练算法
面试指南
- 采用“背景-方法-结果”结构,先说明问题场景,再讲具体解决方案,最后量化效果
- 对于算法问题,先阐述原理,再对比不同方法的优劣,展示理解深度
- 请介绍一下你使用过的强化学习训练框架及其优缺点
- 如何诊断和优化大规模训练中的通信瓶颈?
- 解释 GRPO 算法与 PPO 的区别
- 描述一个你之前做过的性能优化案例
- 你对 MoE 在多模态模型中的应用有什么理解?
- 复习强化学习经典算法和最新前沿论文,特别是 GRPO、DAPO 等
职位点评
71
综合评分
B站实习、前沿RL技术栈、学习成长极佳、薪资一般、需现场办公。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合追求技术成长、不介意现场办公、对AI前沿有强烈兴趣的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值70
薪资福利
60中等
实习岗位薪资处于市场中等水平,但B站品牌附加值较高,整体补偿性动机满足一般。
薪资信号未披露(AI估算:4K-6K/月)
成长发展
90较高
实习岗位专注于前沿强化学习训练技术,技术成长空间极大,发展性动机满足程度高。
技术前沿前沿/新兴技术
技术栈强化学习、PPO、GRPO、DAPO、verl、MoE、异步RL
业务类型ambiguous
工作生活
50较低
要求现场办公,未提及弹性工作或远程,生活化动机满足有限。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
强化学习训练属于AI核心方向,行业前景好,但实习岗位对社会直接影响不明显,意义感中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs