Bilibili logo
哔哩哔哩
多模态数据算法工程师

多模态数据算法工程师

发布于 大约 15 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Caption
Cuda
Ffmpeg
Onnx
Opencv
Tensorrt
Vision Transformer
多模态模型
视频Pipeline

AI 估算 · 30k–60k

上海一线互联网大厂,多模态算法稀缺,经验要求高,薪资竞争力强,中位数约45k。

职位详情

关于这个职位

作为哔哩哔哩多模态数据算法工程师,你将负责构建高性能音视频理解Pipeline,涉及Caption、Tag、QA等核心能力的优化与部署

需要精通Transformer、TensorRT等推理加速技术,并具备千万级视频数据处理经验
该职位技术栈前沿,挑战大,适合有志于多模态和视频理解的算法专家

最低要求

熟悉 Transformer、Vision Transformer、多模态模型基础

熟悉 Qwen VL、Gemma、Gemini、SeedVL 等理解模型
熟悉 TensorRT、ONNX Runtime、CUDA Optimization
熟悉 FFmpeg、OpenCV、CUDA Video Codec
有千万级以上视频 Pipeline 经验

工作职责

构建高性能音视频理解 Pipeline,负责各类理解模型的推理、训练和持续优化

持续优化 Caption、Tag、PE、QA、Quality Assessment 等理解能力,提高数据生产质量
优化 CPU/GPU 推理效率,包括模型部署、Batching、Quantization、TensorRT、ONNX 等
持续优化各类专家模型,包括但不限于:Motion Detection, Shot/Scene Cut Detection, Artifact Detection, Audio-Visual Sync, OCR, ASR, Speaker Detection, Quality Assessment
与生成模型团队共同设计自动化数据生产 Pipeline,提升整体数据质量和处理效率

AI 洞察

优缺点分析

优点

  • 前沿技术栈,包括多模态、Transformer、推理优化,紧跟业界趋势
  • 团队氛围技术驱动,鼓励Owner意识和持续迭代
  • 对性能要求极高,需要不断优化模型效率和成本,工作强度可能较大
  • 技术栈涵盖面广(模型、工程、视频处理),学习曲线陡峭
  • 作为算法工程师,需要同时兼顾算法效果和工程落地

缺点 / 挑战

  • B站平台拥有海量真实视频数据,技术挑战大,成长空间广阔
  • 适合有3-5年计算机视觉或多模态经验,热爱技术挑战,追求工程与算法结合的算法工程师

角色解读

  • 技术方向:从多模态算法工程师发展为多模态算法专家
  • 管理方向:在团队中展现Owner意识,可晋升为技术Lead或架构师
  • 横向发展:深入视频理解或生成式AI领域,成为跨领域专家
  • 构建和维护高性能的音视频理解Pipeline,处理千万级视频数据
  • 优化Caption、Tag、QA等模型的推理效率,部署到生产环境
  • 使用TensorRT、ONNX等工具进行模型加速和量化
  • 与生成模型团队协作,自动化数据生产流程
  • 扎实的深度学习基础,熟悉Transformer、Vision Transformer和多模态模型
  • 精通推理优化技术如TensorRT、ONNX Runtime、CUDA优化
  • 熟练使用FFmpeg、OpenCV等视频处理工具
  • 具备大规模视频数据处理经验,能系统性分析误差并迭代

申请策略

  • 面试前多研究B站技术博客和开源项目,展示对业务的理解
  • 准备一个完整的从数据到部署的端到端案例
  • 突出大规模视频处理Pipeline的项目经验,包括数据量级和性能指标
  • 详细描述模型推理优化经历(如量化、TensorRT部署)
  • 展示对多模态模型(如Qwen VL、Gemma)的实际应用成果
  • 深入学习TensorRT和ONNX Runtime的进阶用法
  • 了解B站音视频业务场景,尝试复现相关多模态任务

面试指南

  • 对于优化问题,可以从模型剪枝、量化、Batching、算子融合等角度分步说明
  • 对于项目经验,采用STAR法则:背景、任务、行动、结果
  • 对于多模态问题,可讨论数据增强、对比学习、CLIP等技术
  • 如何优化一个视频理解模型的推理速度?请给出具体方案
  • 描述一个你处理过的千万级视频Pipeline,遇到了哪些挑战?
  • 多模态Caption模型如何保证生成的准确性和多样性?
  • TensorRT与ONNX Runtime在部署中的优缺点对比
  • 如何系统性分析视频理解模型的误差来源?

职位点评

80
综合评分

B站多模态算法岗,前沿技术栈,高薪资高成长,WLB不确定性较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术深度、渴望成长的求职者,他们愿意接受高强度挑战以换取快速能力提升。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活60
使命价值80

薪资福利

85较高

B站作为上市大厂,薪酬水平有竞争力,但JD未披露具体薪资与福利细节。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

90较高

多模态、推理优化均为前沿技术栈,工作内容极具挑战,成长空间巨大。

技术前沿前沿/新兴技术
技术栈Transformer、Vision Transformer、多模态模型、TensorRT、ONNX、CUDA、FFmpeg
业务类型ambiguous

工作生活

60中等

仅现场办公,上海,工作地点未明确,未提及WLB信号,推测工作强度可能较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

视频行业高速增长,多模态技术处于前沿,对社会影响中性,创新性强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs