Bilibili logo
哔哩哔哩
算法工程师(多模态理解方向)【2027届】

算法工程师(多模态理解方向)【2027届】

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Cvpr
Megatron-Lm
Video Llm
内容审核
分布式训练
多模态
时空序列建模
视频理解
Ms-Swift

AI 估算 · 25k–40k

多模态算法校招岗,B站平台大,技术前沿,薪资竞争力强,估算合理。

职位详情

关于这个职位

这是哔哩哔哩面向2027届应届生的多模态算法工程师岗位,核心负责Video LLM和视频理解技术的研发与落地

你将参与长视频细粒度理解、多模态语义对齐等前沿方向,并将技术应用于搜索推荐、内容审核等业务场景,同时有顶会论文发表机会
适合对多模态大模型有深入研究、追求技术挑战的应届生

最低要求

届应届毕业生,计算机科学、人工智能、计算机视觉等相关专业本科及以上学历,具备扎实的机器学习、深度学习理论基础

深入理解多模态与视觉大模型原理,熟悉大模型底层技术(如 Transformer、时空序列建模、并行自回归解码、多模态语义对齐等)
在视频理解或多模态领域有前沿技术研究及论文发表经验,敢于挑战技术边界
对主流多模态视频大模型架构有深入理解,熟悉长短视频理解评测体系(Benchmark),熟悉 Megatron-LM、ms-swift 等底层分布式大模型框架,具备大规模模型训练(含 SFT 与 RL 阶段调优)、多机多卡集群调度、推理加速优化及工程化部署的实战经验

工作职责

负责多模态视频大模型(Video LLM)及核心视频理解技术的研发与迭代,聚焦长视频、细粒度、音视频精细化理解方向,持续挑战多模态基础模型的技术边界

紧密跟踪视频理解与多模态大模型领域最新进展,推动研究成果向业务转化,并在计算机视觉/AI顶级会议(如 CVPR、ICCV、ECCV、NeurIPS 等)发表高水平论文
将视频理解技术工程化落地于 B站多模态视频数据引擎、智能搜索与推荐、二创高光素材提取及内容审核等核心场景,解决超长视频解析效率、多模态语义精准对齐、分布式大规模训练与推理性能等实际业务痛点,打造行业领先的视频解析大模型基建体系

优先资格

CVPR、ICCV、ECCV、NeurIPS、ICML、AAAI 等计算机视觉或 AI 顶会/顶刊发表过相关论文者优先

熟练使用AI agent能力者优先

AI 洞察

优缺点分析

优点

  • 前沿技术方向,Video LLM是当前AI热点,技能积累价值高
  • B站业务场景丰富,技术落地机会多,且鼓励发表顶会论文
  • 大厂平台,资源充足,有完善的应届生培养体系
  • 互联网节奏较快,可能面临较强的工作强度
  • 对论文和实战经验要求高,竞争激烈
  • 适合对多模态AI有强烈兴趣,具备扎实理论基础和工程实践能力,追求技术成长的应届生

缺点 / 挑战

  • 技术难度大,需要快速掌握大模型训练和分布式系统,学习压力大

角色解读

  • 从算法工程师逐步成长为技术专家,深入多模态大模型核心领域
  • 有机会参与顶会论文发表,提升学术影响力,向研究科学家方向发展
  • 在B站大平台积累业务落地经验,未来可转向高级算法工程师或技术管理岗
  • 研发和迭代多模态视频大模型,解决长视频理解、细粒度语义对齐等技术难题
  • 跟踪学术界最新研究,将前沿技术转化为业务能力,并发表顶会论文
  • 将算法落地到B站搜索推荐、内容审核等核心场景,优化工程部署和推理性能
  • 扎实的机器学习和深度学习理论基础,熟悉Transformer等大模型底层架构
  • 熟练掌握多模态模型训练和调优,具备分布式训练和推理优化经验
  • 熟悉Megatron-LM、ms-swift等分布式框架,以及多机多卡集群调度能力

申请策略

  • 关注B站技术博客和技术分享,了解其视频理解业务方向
  • 在简历中具体描述你如何解决过类似技术问题,展现动手能力
  • 突出多模态/视频理解相关的研究项目或论文,展示技术深度
  • 强调大规模模型训练、分布式部署等实战经验,体现工程能力
  • 如有顶会论文或竞赛获奖,务必放在显眼位置
  • 补充对Video LLM架构和主流开源框架(如Megatron-LM)的深入理解
  • 提前熟悉多模态评测benchmark,尝试复现相关论文
  • 学习AI agent工具的应用,满足优先条件

面试指南

  • 使用STAR法则(情境-任务-行动-结果)清晰描述项目经历,突出难点和解决方案
  • 回答技术设计题时,先分析问题关键,再给出分步方案,注意权衡性能和效果
  • 结合B站业务场景,思考技术落地中的挑战,展示业务理解能力
  • 请介绍一个你参与过的多模态或视频理解项目,并说明你的贡献
  • 如何设计一个高效的长视频理解模型?请谈谈技术思路
  • 在分布式训练中,你如何解决显存不足或通信瓶颈问题?
  • 谈谈你对Video LLM发展趋势的理解,以及落地场景有哪些
  • 系统复习Transformer、多模态对齐、分布式训练等核心知识点

职位点评

76
综合评分

B站多模态算法校招,前沿技术栈,发展空间大,但工作强度可能高。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求前沿技术成长、愿意投入高强度研究工作的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活55
使命价值70

薪资福利

70中等

薪资未披露但大厂校招通常待遇优厚,福利完善,稳定性好。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

95较高

多模态前沿技术方向,有顶会论文机会,技术成长空间巨大。

技术前沿前沿/新兴技术
技术栈Video LLM、Transformer、多模态、分布式训练、Megatron-LM、ms-swift
业务类型ambiguous

工作生活

55较低

工作地点上海,需现场办公,未提及弹性工时,互联网大厂可能加班。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

视频理解技术有实际应用价值,但主要技术驱动,社会意义一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs