
哔哩哔哩
多模态生成算法工程师【2027届】
多模态生成算法工程师【2027届】
发布于 大约 14 小时前普通员工/个人贡献者
上海市
初级经验
全职员工
仅现场办公
本科
机器学习工程
Diffusion Model
Moe
Pytorch
Rlhf
Sft
Vae
分布式训练
多模态
音视频生成
AI 估算 · 30k–50k
B站作为上市大厂,算法岗薪资竞争力强,涉及前沿多模态生成,技术门槛高,预估月薪3-5万,15薪。
职位详情
关于这个职位
这是哔哩哔哩面向2027届毕业生开放的算法工程师岗位,核心参与下一代音视频生成MOE大模型的研发,覆盖文本/图像生成音视频、多参考生成、视频到视频、长视频生成等方向
你将与数据、评测、平台、内容团队紧密协作,聚焦模型全面能力提升,适合有志于多模态生成技术前沿的同学
最低要求
届本科及以上学历,熟悉 PyTorch以及分布式训练框架,理解并有实际经验Diffusion model、MOE、VAE、SFT、RLHF、Distillation 中至少两部分
有多条件参考/图像/视频/音频生成、编辑、超分、插帧、人物一致性、多镜头、音画同步等相关经验
能主动设计实验、分析失败案例,并优化实验结果
能独立负责一个子方向,如数据配比、训练 recipe、编辑能力、多模态控制、训练和推理优化
工作职责
参与下一代音视频生成MOE大模型的研发,包括 text-to-audio+video、image-to-audio+video、multi-reference generation、video-to-video、long video generation等多模态多任务的统一生成模型研发
你会和数据、评测、平台、内容团队一起,以模型全面能力提升为核心目标
优先资格
规模生成模型训练经验
熟悉 CUDA/Triton、DeepSpeed、FSDP、Megatron、Ray、Slurm
有高质量开源项目、论文、demo 或工业落地经验
AI 洞察
优缺点分析
优点
- 前沿技术方向:多模态生成是当前AI最热门领域之一,技术积累含金量高
- 平台资源丰富:B站拥有大量音视频内容生态,数据和应用场景独特
- 明确培养体系:面向2027届,有完整的培养周期和导师指导,成长路径清晰
- 技术难度大:涉及MOE大模型训练、多模态对齐等复杂问题,对数学和工程能力要求高
- 竞争激烈:大模型算法岗位人才济济,需要持续学习和产出高质量成果
缺点 / 挑战
- 工作强度可能较高:研究型岗位往往需要跟紧节奏,实验周期长,压力不小
- 适合对生成式AI有强烈兴趣、乐于挑战技术难题、具备扎实工程能力和自驱力的2027届硕士/博士毕业生
角色解读
- 在多模态生成领域深耕,从算法工程师成长为技术专家或团队负责人
- 随着生成式AI在视频内容创作中的应用普及,技能可迁移至工业界多种场景,发展空间大
- 有机会参与顶级开源项目和高水平论文,提升行业影响力
- 负责音视频生成大模型(MOE架构)的研发,包括文本/图像到音视频、多参考生成、长视频生成等任务
- 与数据、评测、平台团队协作,设计实验并分析失败案例,持续优化模型生成效果
- 独立负责数据配比、训练recipe、多模态控制等子方向,提升模型综合能力
- 扎实的深度学习基础,熟悉PyTorch和分布式训练框架(如DeepSpeed、FSDP)
- 理解Diffusion Model、MOE、VAE、SFT、RLHF等核心模型与训练方法
- 具备图像/视频/音频生成或编辑的实践经验,有独立设计实验和调优的能力
申请策略
- 关注B站音视频内容生态,思考多模态生成如何与社区场景结合,准备有创意的想法
- 在简历中量化项目成果(如指标提升、训练效率提升),让面试官快速看到你的贡献
- 突出所参与过的生成模型相关项目,尤其是Diffusion、VAE、MOE等具体应用
- 强调分布式训练经验,如使用DeepSpeed、FSDP等框架的实际调优经历
- 如有开源项目、论文、竞赛或demo,重点展示技术深度和影响力
- 补充强化学习(RLHF)和蒸馏(Distillation)的实践,特别是多模态场景下的应用
- 熟悉常见分布式训练框架和推理优化工具(如CUDA/Triton、vLLM等)
- 多动手复现经典论文,积累端到端的大模型训练和评估经验
面试指南
- 项目经历类问题:按照背景-方案-量化结果-个人思考的STAR结构回答,突出技术深度和问题解决能力
- 技术原理类问题:先阐述核心概念,再结合个人项目或论文例子,最后对比不同方案的优劣,体现工程视角
- 开放性设计题:先明确目标,再给出分阶段方案,说明数据、模型、评估的考虑,展现系统思维
- 请详细介绍你参与过的一个生成模型项目,包括技术选型、训练过程中的难点和解决办法
- Diffusion Model 的训练和采样过程中,有哪些关键技巧?如何加速采样?
- 如何设计实验来评估一个多模态生成模型的能力?
- MOE 架构在大模型训练中的优势和挑战是什么?你了解哪些实现?
- 如果让你从零开始训练一个音视频生成大模型,你会如何规划数据和资源?
职位点评
80
综合评分
B站大厂平台,多模态生成前沿技术,薪资高,成长空间大,但工作强度可能较高,WLB不确定性大。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合追求技术前沿和快速成长的求职者,愿意投入精力攻坚难题,对薪酬和稳定性也有较好预期。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活50
使命价值85
薪资福利
80较高
作为上市大厂核心算法岗,薪资福利有竞争力,稳定性较好,属于行业偏高水准。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
95较高
多模态生成是前沿技术方向,岗位提供大模型研发实战机会,技术成长空间极大。
技术前沿前沿/新兴技术
技术栈PyTorch、Diffusion Model、MOE、VAE、SFT、RLHF、Distillation、DeepSpeed、FSDP、CUDA、Triton
业务类型profit_center
工作生活
50较低
工作地点在上海市区,但研发强度可能较大,未明确WLB相关信息,整体平衡性一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
85较高
音视频生成技术对内容创作和用户体验有显著赋能,行业处于高速增长期,社会价值较高。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs