
哔哩哔哩
【B-UP】强化学习训练算法工程师(实习)
【B-UP】强化学习训练算法工程师(实习)
发布于 大约 14 小时前实习/见习
上海市
无经验要求
实习生
仅现场办公
本科
机器学习工程
Diffusion Model
Dit
Dpo
Ppo
Pytorch
Rlhf
Vlm
多模态生成
强化学习
AI 估算 · 4k–10k
B站上市公司实习岗,强化学习方向技术含量高,参考上海AI实习薪资中等偏上水平。
职位详情
关于这个职位
该实习岗位参与强化学习在扩散模型去噪过程中的应用研究,包括PPO、DPO等算法优化,以及训练框架建设和奖励模型构建
适合对多模态生成和RLHF感兴趣的同学,能深入接触前沿技术并积累论文级项目经验
最低要求
本科及以上学历,计算机、人工智能、数学、自动化等相关专业(硕士/博士优先)
了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构
熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架
熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力
工作职责
参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容
参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路
参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号
优先资格
有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先
在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先
AI 洞察
优缺点分析
优点
- 参与前沿RL+扩散模型研究,技术含金量高,对论文发表有帮助
- B站平台提供海量多模态数据,适合积累实际项目经验
- 团队氛围好(B站文化),导师制有助于快速成长
- 要求高:需同时掌握RL、扩散模型和PyTorch,面试门槛不低
- 实习期可能需要高强度投入,以跟上研究节奏
- 研究型岗位,不确定性较大,需要较强的自驱力
- 适合对强化学习和生成式AI有浓厚兴趣,具备较强代码能力和研究潜力的在校硕士/博士生
缺点 / 挑战
暂无明显挑战项
角色解读
- 实习后可转正为正式强化学习算法工程师,深入参与核心算法研发
- 积累RLHF和多模态生成经验,未来可向AI研究员或算法专家发展
- 接触B站实际业务场景(如视频生成、交互式AI),提升工程落地能力
- 设计并实现强化学习算法,重点探索PPO、DPO等在扩散模型去噪中的应用
- 搭建和优化强化学习训练框架,特别是Agentic RL的训练链路
- 构建奖励模型和偏好数据集,为多模态生成质量提供细粒度评价信号
- 扎实的强化学习理论基础,熟悉至少2种主流RL算法(如PPO、DPO)
- 熟练使用PyTorch,具备从零复现顶会RL论文代码的能力
- 了解Diffusion Transformer、VLM等多模态模型架构
申请策略
- 提前阅读B站近期发表的强化学习相关论文,了解团队研究方向
- 面试时准备一个你做得最好的RL项目,阐述算法设计思路和实验结论
- 突出强化学习项目经验,特别是PPO、DPO等算法的实现细节
- 展示扩散模型或VLM相关研究经历,如复现论文或参与开源项目
- 强调代码能力,附上GitHub链接或论文复现成果
- 系统学习PPO、DPO、GRPO等算法原理,并尝试用PyTorch从零实现
- 了解DiT、VLM等模型架构,可阅读Stable Diffusion 3等开源代码
- 补充RLHF训练流程知识,如奖励模型训练和数据构建
面试指南
- 先阐述算法原理,再结合具体应用场景说明改进点,最后用实验结果佐证
- 遇到开放性问题时,采用“问题分析-方案设计-预期效果”三步答
- 请详细解释PPO算法的流程和优势,以及它如何应用于扩散模型
- 你如何设计一个奖励模型来评估图像生成的美学一致性?
- 描述你从零复现顶会RL论文的经验,遇到的最大挑战是什么?
- 谈谈对Diffusion Transformer和VLM的理解,以及它们在强化学习中的潜在应用
- 如果训练过程中奖励信号不稳定,你会如何调试和优化?
- 复习强化学习核心算法(PPO、DPO、SAC等)的数学推导和代码实现
职位点评
70
综合评分
前沿RL+扩散模型研究实习,发展性强,薪资和WLB一般。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
该职位最适合看重技能成长和科研突破的求职者,而非追求短期薪资或WLB。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利45
成长发展95
工作生活50
使命价值70
薪资福利
45较低
实习岗位薪资中等,福利较少(未提及),补偿性满足一般。
薪资信号未披露(AI估算:4K-10K/月)
成长发展
95较高
前沿技术栈(RL+扩散模型+多模态),有论文发表机会,发展性极强。
技术前沿前沿/新兴技术
技术栈强化学习、PPO、DPO、Diffusion Model、VLM、RLHF
业务类型profit_center
工作生活
50较低
仅现场办公,实习期WLB未知,生活化满足一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
AI生成内容赛道高速增长,B站平台有一定社会影响力,意义感中等偏上。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs