Bilibili logo
哔哩哔哩
bilibili-音视频生成算法工程师

bilibili-音视频生成算法工程师

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Deepspeed
Diffusion Model
Moe
Pytorch
Rlhf
Sft
Vae
分布式训练
多模态生成

AI 估算 · 35k–70k

音视频生成是前沿方向,人才稀缺,B站大厂平台,资深岗位薪资高,15薪。

职位详情

关于这个职位

该岗位负责哔哩哔哩下一代音视频生成大模型的核心算法研发,包括文生音视频、图生音视频、长视频生成等技术方向

作为核心算法工程师,你将独立牵头算法方向,设计模型架构并推动算法在业务中落地
适合具备扎实深度学习功底、有音视频生成经验的资深算法人才

最低要求

本科及以上学历,计算机、人工智能、深度学习、多媒体技术等相关专业,具备扎实的深度学习、多模态生成技术功底

熟练掌握PyTorch框架及分布式训练技术,具备Diffusion model、MOE、VAE、SFT、RLHF、模型蒸馏中至少两项核心技术的落地实践经验
具备音视频生成相关算法经验,精通多条件参考生成、图像/视频/音频生成与编辑、视频超分、插帧补帧、人物形象一致性、多镜头融合、音画同步等核心技术模块
具备扎实的算法研究与迭代能力,擅长拆解多模态生成核心算法难题,可独立设计实验方案、分析算法case、提炼优化思路,持续完成模型算法效果迭代升级
可独立全权负责核心算法方向,覆盖算法问题定义、模型架构与算法方案设计、数据算法闭环、评测算法指标体系搭建、模型训练调优、算法效果验证与迭代全流程

工作职责

负责下一代音视频生成MOE多模态大模型核心算法研发与迭代,聚焦文生音视频、图生音视频、多参考条件生成、视频续画、长视频连贯生成等多模态统一生成算法体系的优化与创新,攻克多任务融合生成的算法难点

独立牵头核心算法方向全流程研发,自主完成算法问题定义、生成模型架构设计、核心算法方案迭代、训练数据算法闭环构建、量化评测算法体系搭建,针对性优化模型生成效果与算法性能
联动数据、评测、内容等团队,基于算法实验结果与量化指标,制定模型优化迭代方案,聚焦多模态生成算法能力升级,推动音视频生成算法效果落地与规模化最优迭代
自主设计系统性算法对照实验,深度复盘实验失败案例、定位算法缺陷与瓶颈,针对性优化模型生成精度、画面连贯性、音画一致性等核心指标,持续迭代升级生成算法能力

优先资格

具备大规模多模态生成模型完整训练、迭代及工业落地经验

熟悉CUDA/Triton、DeepSpeed、FSDP、Megatron、Ray、Slurm等高性能训练、推理及集群调度工具
拥有高质量AI开源项目、顶会论文、音视频生成优质Demo成果
具备长视频生成、多模态统一大模型、MOE稀疏模型落地实战经验者优先

AI 洞察

优缺点分析

优点

  • 大厂平台,资源丰富,有完整的算力和数据支持
  • 团队协作,参与核心项目,有较大影响力
  • 需要独立推动项目,对综合能力要求高
  • 快速迭代,可能需要高强度工作
  • 适合具备扎实算法功底、对多模态生成有热情、能独立负责复杂技术方向的经验型工程师

缺点 / 挑战

  • 技术前沿,挑战性高,能快速积累生成式AI的顶尖经验
  • 算法难题多,研究压力大,需要持续创新

角色解读

  • 从算法工程师成长为技术专家或技术负责人
  • 深耕多模态生成领域,成为AI内容生成方向的领军人才
  • 有机会参与顶会论文发表和开源项目,提升行业影响力
  • 负责音视频生成大模型的核心算法研发,包括文生音视频、图生音视频等生成任务
  • 设计并优化模型架构,解决多条件生成、长视频连贯性、音画同步等算法难题
  • 与数据、测试、内容团队协作,推动算法在业务场景中落地
  • 扎实的深度学习基础,熟悉PyTorch和分布式训练
  • 掌握Diffusion Model、MOE、VAE等生成模型技术
  • 具备音视频生成、编辑或相关计算机视觉经验

申请策略

  • 展示对B站内容生态的理解,说明算法如何改善用户体验
  • 体现独立解决问题的能力和算法迭代思维
  • 突出音视频生成或相关生成模型的项目经历,尤其是完整落地案例
  • 强调熟悉多种生成技术(Diffusion, VAE, MOE)及分布式训练
  • 如果有顶会论文或高质量开源项目,重点展示
  • 复习并深入理解Diffusion模型、MOE等最新论文
  • 熟悉DeepSpeed、Megatron等分布式训练工具
  • 准备音视频生成demo,展示个人能力

面试指南

  • 用STAR法则回答项目经历,突出个人贡献和结果
  • 从算法原理、数据、训练、评估四个维度展开技术问题的回答
  • 体现实验对比和迭代优化的思路
  • 请介绍你参与过的音视频生成项目,难点和解决方案是什么?
  • 如何设计一个视频续画模型?你如何保证连贯性?
  • 在分布式训练中,如何优化通信效率?
  • 你对MOE稀疏模型在大模型中的作用有什么理解?
  • 如何评估生成视频的质量?你设计过哪些评测指标?

职位点评

75
综合评分

高速增长赛道的核心技术岗,前沿生成算法,薪资潜力高,但WLB不明朗。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长和前沿创新的求职者,他们对生活工作平衡要求适中。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展95
工作生活55
使命价值72

薪资福利

72中等

职位薪资未披露,但作为大厂资深算法岗,通常薪酬待遇优厚,但存在不确定性。

薪资信号未披露(AI估算:35K-70K/月)

成长发展

95较高

该职位处于音视频生成前沿领域,技术迭代快,成长空间大,且有完整算法闭环实践机会。

技术前沿前沿/新兴技术
技术栈PyTorch、Diffusion Model、MOE、VAE、SFT、RLHF、分布式训练、音视频生成
业务类型profit_center

工作生活

55较低

工作地点上海,但未提及弹性工作或远程,算法岗通常工作强度较高,WLB一般。

工作模式未明确
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

72中等

音视频生成是高速增长赛道,但岗位更偏技术实现,社会价值间接体现。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs