
哔哩哔哩
【B-UP】强化学习训练算法工程师(校招)
【B-UP】强化学习训练算法工程师(校招)
发布于 大约 3 小时前普通员工/个人贡献者
北京市 / 上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Agentic Rl
Diffusion Model
Dpo
Ppo
Pytorch
Rlhf
Vlm
多模态
强化学习
AI 估算 · 20k–35k
校招AI算法岗一线城市,前沿技术方向,薪资有竞争力,通常15薪左右。
职位详情
关于这个职位
该职位是哔哩哔哩的校招算法岗,专注于强化学习(RL)在扩散模型和多模态生成中的应用
你将参与核心算法设计与训练框架搭建,探索PPO、DPO、GRPO等前沿方法,并跟踪国际顶会动态
适合对RL和生成式AI有浓厚兴趣、具备扎实编程能力的应届毕业生
最低要求
本科及以上学历,计算机、人工智能、数学、自动化等相关专业
了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构
熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架
熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力
工作职责
参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容
参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路
参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号
跟踪 ICML/NeurIPS/ICLR/CVPR 等顶会中 RL+生成模型的前沿动态,将论文成果快速转化为内部技术原型并验证
优先资格
硕士/博士学历优先
有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先
在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先
AI 洞察
优缺点分析
优点
- 接触前沿技术如RL+扩散模型,技术成长速度极快
- 大公司平台,算力资源和研究资源丰富,支持创新实验
- 跟踪顶会并有机会将研究成果转化为实际产品,成就感强
- 校招岗位,培养体系完善,有资深导师指导
- 技术要求高,需同时掌握RL、生成模型和框架开发,学习曲线陡峭
- 工作可能面临高强度实验迭代,需要较强的抗压能力和时间管理
- 适合对强化学习和生成式AI有强烈兴趣,具备扎实工程能力和学术追求的应届毕业生
缺点 / 挑战
- 竞争激烈,对学术背景(如论文)有较高期望
角色解读
- 从算法工程师成长为高级算法专家,深入强化学习与生成模型交叉领域
- 有机会在顶级会议发表论文,提升学术影响力
- 可向技术管理或架构师方向发展,领导大型训练框架的建设和优化
- 设计并优化强化学习算法(如PPO、DPO),探索其在扩散模型去噪和多模态生成中的应用
- 搭建并持续优化强化学习训练框架,构建Agentic RL链路,提升训练效率和效果
- 参与奖励模型和偏好数据集的构建与迭代,设计针对生成质量的细粒度评价信号
- 跟踪ICML/NeurIPS/ICLR/CVPR等顶会前沿动态,将论文成果快速转化为内部技术原型
- 扎实的深度学习和强化学习基础,熟悉PPO、DPO、GRPO等主流算法原理
- 熟练掌握PyTorch,具备从零复现顶会RL论文代码的能力
- 了解Diffusion Transformer(DiT)和VLM模型架构,有多模态经验更佳
- 具备自然语言处理或计算机视觉背景,对生成模型有深入理解
申请策略
- 了解B站业务(如视频内容生成、AI特效),思考RL如何落地场景
- 展示对学术前沿的敏锐度,准备讨论顶会论文的创新点与局限性
- 突出强化学习项目经验,尤其是PPO、DPO等算法的实现与调优
- 强调扩散模型或LLM/VLM后训练(SFT/RLHF/DPO)的实践经历
- 展示PyTorch熟练度和复现顶会论文的能力,可附代码链接
- 如有顶会论文或投稿经历,务必在显眼位置标注
- 熟悉主流强化学习训练框架(如Ray RLlib、Stable-Baselines3),或自建简单的训练链路
- 深入学习DiT和VLM架构(如Stable Diffusion、LLaVA),并动手实现Demo
面试指南
- 从算法推导到工程实现,层层递进,展示深度理解
- 结合项目实例,说明面对挑战的解决方案和思考过程
- 体现对前沿技术的比较(如GRPO vs PPO),并给出自己的见解
- 请详细讲解PPO算法的原理和实现细节
- 你如何理解RLHF?在扩散模型中应用RL有什么挑战?
- 如何设计奖励模型来评价图像/视频质量?
- 你如何在大规模数据上训练强化学习模型?
- 谈谈你复现过的顶会论文,遇到过哪些问题?
职位点评
75
综合评分
大厂校招算法岗,深入强化学习与生成模型前沿,技术成长快,但工作强度不明确。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求技术前沿和学术成长的求职者,对薪资和WLB要求相对灵活。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活60
使命价值70
薪资福利
70中等
作为上市大公司,校招算法岗位薪资和福利通常有竞争力,但具体数字未在JD中披露,稳定性高。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
90较高
职位深度涉及强化学习、扩散模型等前沿技术,鼓励创新和学术产出,成长空间巨大。
技术前沿前沿/新兴技术
技术栈PPO、DPO、GRPO、Diffusion Model、DiT、VLM、PyTorch、Agentic RL、RLHF、SFT
业务类型ambiguous
工作生活
60中等
工作地点在北京/上海,但未提及弹性或远程,工作强度不明确,可能有较大压力。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI技术高速发展,工作内容有创新性和影响力,但JD未强调社会价值,意义感主要来自技术前沿。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs