
哔哩哔哩
【B-UP】强化学习训练框架工程师(校招)
【B-UP】强化学习训练框架工程师(校招)
发布于 大约 14 小时前普通员工/个人贡献者
上海市 / 北京市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Dapo
Dit
Grpo
Moe
Vlm
强化学习
性能优化
训练框架
AI 估算 · 20k–35k
强化学习训练框架方向稀缺,技术要求高,公司平台大,薪酬竞争力强。
职位详情
关于这个职位
加入哔哩哔哩,参与强化学习训练框架的研发与性能优化,专注于提升大规模模型(如DiT、VLM)的训练效率和稳定性
你将深入分析计算、通信、存储等性能瓶颈,实施针对性优化,并持续跟踪MoE、异步RL等前沿技术,助力业务创新
最低要求
本科及以上学历,计算机相关专业
熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础
深入理解自然语言处理、计算机视觉或多模态算法,熟悉主流的 DiT 与 VLM 模型架构
熟悉常见强化学习训练算法(如 GRPO、DAPO 等)及训练框架(如 verl),熟悉异步强化学习范式
工作职责
参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率
深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性
持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)
优先资格
有相关领域开源项目贡献经验者优先
具备大规模训练实操经验者优先
AI 洞察
优缺点分析
优点
- 接触业界前沿的强化学习训练技术和大规模模型优化,技术成长快
- 哔哩哔哩平台提供丰富的业务场景和海量数据,实战机会多
- 团队技术氛围浓厚,有开源贡献机会,提升个人影响力
- 工作强度较大,可能需要应对复杂系统调优和紧急需求
- 技术要求全面且深入,需要持续学习前沿论文和框架
- 校招对基础要求高,需快速上手并独立解决难题
- 适合对强化学习和大模型训练充满热情、具备扎实系统能力、渴望在实践中快速成长的应届生
缺点 / 挑战
暂无明显挑战项
角色解读
- 可向资深强化学习训练专家发展,成为框架核心开发者或技术负责人
- 横向拓展至大模型全栈训练、推理优化或AI系统架构方向
- 未来可转型为AI基础设施团队负责人或技术管理岗位
- 负责强化学习训练框架的研发与性能优化,根据业务需求演进训练策略,提升大规模模型训练效率
- 深入分析训练系统的性能瓶颈(计算、通信、存储等),实施针对性优化,提高训练吞吐和稳定性
- 持续跟踪并集成业界前沿训练优化技术,如MoE、异步RL、LoRA RL等,保持技术领先
- 精通Python或C++,具备扎实的工程基础和系统优化能力
- 深入理解NLP、CV或多模态算法,熟悉DiT、VLM等主流模型架构
- 熟悉强化学习训练算法(如GRPO、DAPO)和训练框架(如verl),了解异步强化学习范式
申请策略
- 了解哔哩哔哩在AI领域的业务(推荐、内容理解等),思考如何用强化学习优化
- 面试前准备一个完整的强化学习训练项目,从算法到性能调优的阐述
- 突出强化学习相关项目经验,包括算法实现和框架使用(如verl、RLlib)
- 强调系统优化能力,如性能调优、分布式训练、通信优化等
- 展示开源贡献或GitHub项目,体现技术深度和社区参与
- 补强C++编程和系统性能分析工具(如profiling、CUDA)的使用
- 深入学习异步强化学习、MoE等前沿训练技术,阅读相关论文并动手复现
面试指南
- 对于算法对比问题:先阐明原理,再对比差异(如收敛性、稳定性、计算效率),最后结合业务场景说明选择依据
- 对于性能优化问题:遵循“识别瓶颈-分析根因-实施优化-验证效果”的套路,辅以具体工具和指标
- 对于设计类问题:先给出总体架构,再分模块说明(如策略、采样、训练、通信),强调可扩展性和容错
- 请解释GRPO与DAPO的区别,以及各自适用场景
- 如何诊断训练中的计算瓶颈?请结合实际案例说明
- 描述一次你优化训练框架性能的经历,具体步骤和效果
- 你对MoE和异步RL在强化学习训练中的应用有何理解?
- 如何设计一个支持大规模分布式强化学习训练的系统架构?
职位点评
74
综合评分
前沿技术栈、高成长性、校招优选项,但WLB一般。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求技术深度与快速成长、能接受较强工作节奏的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值65
薪资福利
75中等
校招薪资有竞争力,上市公司福利完善,但具体薪酬未明确,属于市场水准偏上。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
90较高
职位涉及前沿强化学习训练技术,导师制和开源文化有利于成长,晋升路径清晰。
技术前沿前沿/新兴技术
技术栈GRPO、DAPO、MoE、异步RL、LoRA RL、Agentic RL、DiT、VLM
业务类型profit_center
工作生活
50较低
仅现场办公,未提及弹性工作或WLB,互联网公司工作强度较大。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
强化学习训练对AI行业有重要推动作用,但职位聚焦技术实现,社会影响偏中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs