Bilibili logo
哔哩哔哩
多模态生成算法工程师【2027届】

多模态生成算法工程师【2027届】

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
初级经验
全职员工
仅现场办公
本科
机器学习工程
Diffusion Model
Moe
Pytorch
Rlhf
Sft
Vae
分布式训练
多模态
音视频生成

AI 估算 · 30k–50k

B站作为上市大厂,算法岗薪资竞争力强,涉及前沿多模态生成,技术门槛高,预估月薪3-5万,15薪。

职位详情

关于这个职位

这是哔哩哔哩面向2027届毕业生开放的算法工程师岗位,核心参与下一代音视频生成MOE大模型的研发,覆盖文本/图像生成音视频、多参考生成、视频到视频、长视频生成等方向

你将与数据、评测、平台、内容团队紧密协作,聚焦模型全面能力提升,适合有志于多模态生成技术前沿的同学

最低要求

届本科及以上学历,熟悉 PyTorch以及分布式训练框架,理解并有实际经验Diffusion model、MOE、VAE、SFT、RLHF、Distillation 中至少两部分

有多条件参考/图像/视频/音频生成、编辑、超分、插帧、人物一致性、多镜头、音画同步等相关经验
能主动设计实验、分析失败案例,并优化实验结果
能独立负责一个子方向,如数据配比、训练 recipe、编辑能力、多模态控制、训练和推理优化

工作职责

参与下一代音视频生成MOE大模型的研发,包括 text-to-audio+video、image-to-audio+video、multi-reference generation、video-to-video、long video generation等多模态多任务的统一生成模型研发

你会和数据、评测、平台、内容团队一起,以模型全面能力提升为核心目标

优先资格

规模生成模型训练经验

熟悉 CUDA/Triton、DeepSpeed、FSDP、Megatron、Ray、Slurm
有高质量开源项目、论文、demo 或工业落地经验

AI 洞察

优缺点分析

优点

  • 前沿技术方向:多模态生成是当前AI最热门领域之一,技术积累含金量高
  • 平台资源丰富:B站拥有大量音视频内容生态,数据和应用场景独特
  • 明确培养体系:面向2027届,有完整的培养周期和导师指导,成长路径清晰
  • 技术难度大:涉及MOE大模型训练、多模态对齐等复杂问题,对数学和工程能力要求高
  • 竞争激烈:大模型算法岗位人才济济,需要持续学习和产出高质量成果

缺点 / 挑战

  • 工作强度可能较高:研究型岗位往往需要跟紧节奏,实验周期长,压力不小
  • 适合对生成式AI有强烈兴趣、乐于挑战技术难题、具备扎实工程能力和自驱力的2027届硕士/博士毕业生

角色解读

  • 在多模态生成领域深耕,从算法工程师成长为技术专家或团队负责人
  • 随着生成式AI在视频内容创作中的应用普及,技能可迁移至工业界多种场景,发展空间大
  • 有机会参与顶级开源项目和高水平论文,提升行业影响力
  • 负责音视频生成大模型(MOE架构)的研发,包括文本/图像到音视频、多参考生成、长视频生成等任务
  • 与数据、评测、平台团队协作,设计实验并分析失败案例,持续优化模型生成效果
  • 独立负责数据配比、训练recipe、多模态控制等子方向,提升模型综合能力
  • 扎实的深度学习基础,熟悉PyTorch和分布式训练框架(如DeepSpeed、FSDP)
  • 理解Diffusion Model、MOE、VAE、SFT、RLHF等核心模型与训练方法
  • 具备图像/视频/音频生成或编辑的实践经验,有独立设计实验和调优的能力

申请策略

  • 关注B站音视频内容生态,思考多模态生成如何与社区场景结合,准备有创意的想法
  • 在简历中量化项目成果(如指标提升、训练效率提升),让面试官快速看到你的贡献
  • 突出所参与过的生成模型相关项目,尤其是Diffusion、VAE、MOE等具体应用
  • 强调分布式训练经验,如使用DeepSpeed、FSDP等框架的实际调优经历
  • 如有开源项目、论文、竞赛或demo,重点展示技术深度和影响力
  • 补充强化学习(RLHF)和蒸馏(Distillation)的实践,特别是多模态场景下的应用
  • 熟悉常见分布式训练框架和推理优化工具(如CUDA/Triton、vLLM等)
  • 多动手复现经典论文,积累端到端的大模型训练和评估经验

面试指南

  • 项目经历类问题:按照背景-方案-量化结果-个人思考的STAR结构回答,突出技术深度和问题解决能力
  • 技术原理类问题:先阐述核心概念,再结合个人项目或论文例子,最后对比不同方案的优劣,体现工程视角
  • 开放性设计题:先明确目标,再给出分阶段方案,说明数据、模型、评估的考虑,展现系统思维
  • 请详细介绍你参与过的一个生成模型项目,包括技术选型、训练过程中的难点和解决办法
  • Diffusion Model 的训练和采样过程中,有哪些关键技巧?如何加速采样?
  • 如何设计实验来评估一个多模态生成模型的能力?
  • MOE 架构在大模型训练中的优势和挑战是什么?你了解哪些实现?
  • 如果让你从零开始训练一个音视频生成大模型,你会如何规划数据和资源?

职位点评

80
综合评分

B站大厂平台,多模态生成前沿技术,薪资高,成长空间大,但工作强度可能较高,WLB不确定性大。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术前沿和快速成长的求职者,愿意投入精力攻坚难题,对薪酬和稳定性也有较好预期。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活50
使命价值85

薪资福利

80较高

作为上市大厂核心算法岗,薪资福利有竞争力,稳定性较好,属于行业偏高水准。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

95较高

多模态生成是前沿技术方向,岗位提供大模型研发实战机会,技术成长空间极大。

技术前沿前沿/新兴技术
技术栈PyTorch、Diffusion Model、MOE、VAE、SFT、RLHF、Distillation、DeepSpeed、FSDP、CUDA、Triton
业务类型profit_center

工作生活

50较低

工作地点在上海市区,但研发强度可能较大,未明确WLB相关信息,整体平衡性一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

85较高

音视频生成技术对内容创作和用户体验有显著赋能,行业处于高速增长期,社会价值较高。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs