Bilibili logo
哔哩哔哩
bilibili-音视频理解算法工程师

bilibili-音视频理解算法工程师

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Pytorch
Reward Model
多模态
强化学习
深度学习
视频理解
视频生成
Omni Vlm

AI 估算 · 40k–70k

上海大厂AI算法岗,基础模型方向稀缺,薪资竞争力强,年终较丰厚。

职位详情

关于这个职位

该职位负责哔哩哔哩音视频理解相关算法研发,核心是Omni VLM多模态基础模型的预训练与后训练,并构建视频生成所需的Caption、Prompt Enhance和Reward Model等能力

你将参与从模型架构、数据构建到训练优化的全链路工作,并探索视频创作Agent
适合对多模态模型和视频生成有深入研究热情的算法工程师

最低要求

计算机、人工智能、自动化、数学或相关专业硕士及以上学历

具备扎实的机器学习、深度学习和 Transformer 基础,熟练使用 PyTorch 等主流框架
熟悉多模态基础模型,对视觉编码、跨模态对齐、时序建模和语言建模有深入理解
具有以下至少一个方向的研发经验:
Omni Model、VLM 或多模态理解基础模型
VLM / LLM 预训练或后训练
视频理解、视频 Caption 或视频推理
Reward Model、偏好对齐或强化学习
视频生成或图像生成基础模型
多模态 Agent、工具调用或任务规划
熟悉基础模型的数据构建、分布式训练、推理优化和模型评估流程
具备良好的工程能力、自驱力和协作能力,能够独立推进算法研发与实验迭代

工作职责

工作职责:

Omni VLM 基础模型研发
负责面向视频理解的 Omni VLM / 多模态理解基础模型研发
参与模型架构、数据体系、训练方法和评测体系建设
开展大规模图像、视频、音频和文本数据上的 VLM 预训练
开展多模态 SFT、偏好对齐、强化学习、复杂推理等后训练工作
提升模型在长视频理解、时序推理、细粒度感知和多模态交互等方面的能力
Captioner
建设高质量视频 Caption 和结构化语义理解能力
提升模型对人物、场景、动作、事件、镜头、风格、音频和叙事等信息的理解
为视频生成基模提供高质量训练数据和语义条件
Prompt Enhance(PE)
研发面向视频生成的 Prompt Enhance 模型与策略
将用户简短或模糊的意图转化为准确、丰富且适合视频生成的提示词
提升生成结果的语义一致性、视觉表现和可控性
Reward Model 与评估
建设面向视频生成的 Reward Model 和自动化评测体系
评估文本—视频对齐、画面质量、运动质量、时序一致性、物理合理性和审美表现
为视频生成基模的训练、偏好对齐和效果优化提供反馈信号
Agent 创作链路
研发基于 Omni VLM 的视频创作 Agent
建设意图理解、任务规划、Prompt Enhance、素材理解、工具调用和结果评估等能力
探索视频的多轮生成、局部修改和自动迭代优化

优先资格

加分项

参与过大规模 VLM / LLM 的预训练或后训练
具有多模态 SFT、RLHF、DPO、GRPO、RLAIF 或 Reward Model 经验
具有视频生成、Diffusion 或 Flow Matching 相关经验
具有长视频理解、音视频联合建模或多模态推理经验
具有视频创作 Agent、多轮生成或工具调用系统经验
在相关顶级会议或期刊发表过论文,或有高质量开源项目

AI 洞察

优缺点分析

优点

  • 参与前沿Omni VLM和视频生成基础模型研发,技术含量高,行业领先
  • 哔哩哔哩拥有海量视频数据和丰富业务场景,研究落地机会多
  • 团队涉及从模型训练到Agent的全链路,成长空间大
  • 多模态和视频生成领域迭代快,需要持续学习和跟进最新研究
  • 该岗位对综合能力要求高,需同时具备研究、工程和系统设计能力
  • 适合对多模态理解和视频生成有浓厚兴趣、具备扎实算法功底和自驱力的工程师

缺点 / 挑战

  • 基础模型研发需要大量实验计算资源,工作强度和竞争压力较大

角色解读

  • 在AI基础模型领域深化,成为多模态/视频生成方向的专家
  • 可向技术专家或技术管理方向发展,主导核心算法项目
  • 依托B站视频生态,有丰富的应用场景和前沿研究机会
  • 研发面向视频理解的Omni VLM多模态基础模型,包括模型架构设计、预训练和后训练
  • 构建高质量视频Caption和结构化语义理解能力,为视频生成提供训练数据
  • 开发Prompt Enhance模型,将用户意图转化为高质量视频生成提示词
  • 建设Reward Model和评估体系,并研发视频创作Agent
  • 扎实的机器学习和深度学习基础,精通Transformer架构和PyTorch
  • 熟悉多模态基础模型,理解视觉编码、跨模态对齐和时序建模
  • 具备至少一个方向(VLM、视频理解、生成模型、RLHF等)的研发经验
  • 良好的工程能力,熟悉分布式训练和模型评估流程

申请策略

  • 准备一个完整的项目案例,清晰讲述从问题定义到模型落地的过程
  • 关注B站视频内容特点,思考算法如何优化视频理解体验
  • 突出VLM/LLM预训练或后训练的项目经验,尤其是大规模训练经验
  • 展示在视频理解、生成或强化学习方向的具体成果(如论文、开源项目)
  • 强调PyTorch和分布式训练等工程能力,并附上相关代码或实验记录
  • 提前熟悉当前主流的Omni模型(如GPT-4o、Gemini)和视频生成模型(如Sora)的原理
  • 练习实现或复现RLHF/DPO等对齐算法,掌握Reward Model的训练方法
  • 学习Agent工具调用和任务规划技术,了解多轮生成系统

面试指南

  • 用STAR法则回答项目经验问题:情境-任务-行动-结果,突出个人贡献和量化指标
  • 对于技术原理问题,先解释核心概念,再展开细节,结合自己的实践或思考
  • 对开放设计题,先明确目标和约束,再给出分步方案,体现系统思维
  • 请介绍一下你参与过的VLM或多模态模型的训练过程,遇到的最大挑战是什么?
  • 如何设计一个高质量的视频Caption数据构建流程?
  • 解释RLHF与DPO的区别及在多模态模型中的应用
  • 如何评估视频生成模型的时序一致性和物理合理性?
  • 如果让你做一个视频创作Agent,你会如何设计意图理解和任务规划模块?

职位点评

75
综合评分

前沿多模态算法岗,薪资优厚,技术成长快,但WLB不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
追求技术深度和前沿研究的算法工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值70

薪资福利

80较高

上海上市互联网大厂,算法薪资竞争力强,但福利细节未披露,整体补偿性好。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

岗位涉及Omni VLM和视频生成等前沿方向,技术成长空间极大,行业稀缺度高。

技术前沿前沿/新兴技术
技术栈Omni VLM、PyTorch、Transformer、视频理解、强化学习
业务类型ambiguous

工作生活

50较低

未透露工作模式和加班情况,但算法研发岗通常强度较高,生活平衡一般。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI视频生成是高速增长赛道,技术影响力大,但直接社会价值不显著。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs