Bilibili logo
哔哩哔哩
【B-UP】强化学习训练算法工程师(校招)

【B-UP】强化学习训练算法工程师(校招)

发布于 大约 3 小时前

普通员工/个人贡献者

北京市 / 上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Agentic Rl
Diffusion Model
Dpo
Ppo
Pytorch
Rlhf
Vlm
多模态
强化学习

AI 估算 · 20k–35k

校招AI算法岗一线城市,前沿技术方向,薪资有竞争力,通常15薪左右。

职位详情

关于这个职位

该职位是哔哩哔哩的校招算法岗,专注于强化学习(RL)在扩散模型和多模态生成中的应用

你将参与核心算法设计与训练框架搭建,探索PPO、DPO、GRPO等前沿方法,并跟踪国际顶会动态
适合对RL和生成式AI有浓厚兴趣、具备扎实编程能力的应届毕业生

最低要求

本科及以上学历,计算机、人工智能、数学、自动化等相关专业

了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构
熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架
熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力

工作职责

参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容

参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路
参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号
跟踪 ICML/NeurIPS/ICLR/CVPR 等顶会中 RL+生成模型的前沿动态,将论文成果快速转化为内部技术原型并验证

优先资格

硕士/博士学历优先

有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先
在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先

AI 洞察

优缺点分析

优点

  • 接触前沿技术如RL+扩散模型,技术成长速度极快
  • 大公司平台,算力资源和研究资源丰富,支持创新实验
  • 跟踪顶会并有机会将研究成果转化为实际产品,成就感强
  • 校招岗位,培养体系完善,有资深导师指导
  • 技术要求高,需同时掌握RL、生成模型和框架开发,学习曲线陡峭
  • 工作可能面临高强度实验迭代,需要较强的抗压能力和时间管理
  • 适合对强化学习和生成式AI有强烈兴趣,具备扎实工程能力和学术追求的应届毕业生

缺点 / 挑战

  • 竞争激烈,对学术背景(如论文)有较高期望

角色解读

  • 从算法工程师成长为高级算法专家,深入强化学习与生成模型交叉领域
  • 有机会在顶级会议发表论文,提升学术影响力
  • 可向技术管理或架构师方向发展,领导大型训练框架的建设和优化
  • 设计并优化强化学习算法(如PPO、DPO),探索其在扩散模型去噪和多模态生成中的应用
  • 搭建并持续优化强化学习训练框架,构建Agentic RL链路,提升训练效率和效果
  • 参与奖励模型和偏好数据集的构建与迭代,设计针对生成质量的细粒度评价信号
  • 跟踪ICML/NeurIPS/ICLR/CVPR等顶会前沿动态,将论文成果快速转化为内部技术原型
  • 扎实的深度学习和强化学习基础,熟悉PPO、DPO、GRPO等主流算法原理
  • 熟练掌握PyTorch,具备从零复现顶会RL论文代码的能力
  • 了解Diffusion Transformer(DiT)和VLM模型架构,有多模态经验更佳
  • 具备自然语言处理或计算机视觉背景,对生成模型有深入理解

申请策略

  • 了解B站业务(如视频内容生成、AI特效),思考RL如何落地场景
  • 展示对学术前沿的敏锐度,准备讨论顶会论文的创新点与局限性
  • 突出强化学习项目经验,尤其是PPO、DPO等算法的实现与调优
  • 强调扩散模型或LLM/VLM后训练(SFT/RLHF/DPO)的实践经历
  • 展示PyTorch熟练度和复现顶会论文的能力,可附代码链接
  • 如有顶会论文或投稿经历,务必在显眼位置标注
  • 熟悉主流强化学习训练框架(如Ray RLlib、Stable-Baselines3),或自建简单的训练链路
  • 深入学习DiT和VLM架构(如Stable Diffusion、LLaVA),并动手实现Demo

面试指南

  • 从算法推导到工程实现,层层递进,展示深度理解
  • 结合项目实例,说明面对挑战的解决方案和思考过程
  • 体现对前沿技术的比较(如GRPO vs PPO),并给出自己的见解
  • 请详细讲解PPO算法的原理和实现细节
  • 你如何理解RLHF?在扩散模型中应用RL有什么挑战?
  • 如何设计奖励模型来评价图像/视频质量?
  • 你如何在大规模数据上训练强化学习模型?
  • 谈谈你复现过的顶会论文,遇到过哪些问题?

职位点评

75
综合评分

大厂校招算法岗,深入强化学习与生成模型前沿,技术成长快,但工作强度不明确。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术前沿和学术成长的求职者,对薪资和WLB要求相对灵活。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活60
使命价值70

薪资福利

70中等

作为上市大公司,校招算法岗位薪资和福利通常有竞争力,但具体数字未在JD中披露,稳定性高。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

90较高

职位深度涉及强化学习、扩散模型等前沿技术,鼓励创新和学术产出,成长空间巨大。

技术前沿前沿/新兴技术
技术栈PPO、DPO、GRPO、Diffusion Model、DiT、VLM、PyTorch、Agentic RL、RLHF、SFT
业务类型ambiguous

工作生活

60中等

工作地点在北京/上海,但未提及弹性或远程,工作强度不明确,可能有较大压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI技术高速发展,工作内容有创新性和影响力,但JD未强调社会价值,意义感主要来自技术前沿。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs