Bilibili logo
哔哩哔哩
【B-UP】多模态数据平台研发工程师(校招)

【B-UP】多模态数据平台研发工程师(校招)

发布于 大约 1 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
本科
软件工程
Go
分布式系统
多模态
大模型
数据平台

AI 估算 · 18k–28k

校招岗位,B站上海,技术栈前沿,薪资竞争力强,参考大厂校招水平。

职位详情

关于这个职位

该职位面向校招,主要参与构建多模态数据平台,支撑文本、图像、视频等海量异构数据的高效管理和处理

你将深入AI数据流水线,参与平台架构演进,实现智能化数据基础设施
适合对分布式系统和大模型数据链路感兴趣的应届生

最低要求

计算机、软件工程、大数据、人工智能等相关专业,本科及以上学历

熟练掌握 Go / Python / Java至少一门后端开发语言,具备良好代码风格,了解基础数据结构、计算机网络、操作系统知识
了解分布式系统基础概念,熟悉数据库(MySQL)、缓存(Redis)等常用中间件基础原理与实践
了解大模型基础链路,对 AI 数据集、数据标注、模型评测、训练任务流程有基本认知优先
优秀的逻辑思维、沟通协作能力,具备较强自驱力与学习能力,乐于接受复杂业务场景挑战

工作职责

面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟

参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化
探索跨模态数据的对齐、融合与联合分析技术
参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式
关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性

优先资格

有大厂或 AI 公司内部数据平台、评估平台的建设经验

有数据平台(如数据开发平台、任务调度平台、标注平台)的设计或开发经验
参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretrain/SFT/RLHF
参与过训练数据与评测数据平台建设,具备文本、图像、视频、音频的可视化、检索、聚类、统计分析、筛选过滤、标注及人工评测等功能开发经验
具备评测结果管理(GSB 对比、绝对分打分)、质检评价、返工再标注等 workflow 设计经验
积极实践 AI 辅助编程(如 Harness Engineering 理念),擅长将 AI 能力融入平台开发流程中
有开源大数据/多模态数据处理项目贡献经验,或在相关领域顶会(OSDI/SOSP/NeurIPS/ICML/CVPR 等)发表过论文
理解以下至少一种技术体系,并具备线上平台化实践经验
计算引擎(Ray)及其平台化封装
数据湖/湖仓一体方案(Iceberg/Paimon/Lance)及元数据管理
分布式调度系统、资源管理(YARN/K8s)或工作流编排平台

AI 洞察

优缺点分析

优点

  • 参与前沿的多模态AI数据平台建设,技术栈面向未来
  • B站上市大厂,平台稳定,有完善的培训体系
  • 接触大规模分布式系统和AI基础设施,经验含金量高
  • 校招岗位成长快,有导师指导
  • 涉及多种技术和业务场景,学习曲线较陡
  • 数据平台对稳定性和性能要求高,需要解决复杂工程问题
  • 校招竞争激烈,需要扎实基础和相关项目经验
  • 适合对AI基础设施和分布式系统有浓厚兴趣,愿意深度钻研技术的应届生

缺点 / 挑战

暂无明显挑战项

角色解读

  • 深耕数据平台架构,成为分布式系统专家
  • 结合AI需求,转向更核心的AI基础设施或模型平台方向
  • 在B站内部可晋升为技术专家或团队负责人
  • 构建统一的多模态数据平台,管理PB级文本、图像、视频等异构数据
  • 开发数据清洗、标注、增强等处理管线,支持大模型训练数据流程
  • 探索平台智能化,引入Data Agent、智能调度等技术
  • 设计标准化的API/SDK和运维工具,提升平台易用性
  • 扎实的后端开发能力,熟悉Go/Python/Java至少一门语言
  • 理解分布式系统基础,掌握MySQL、Redis等中间件
  • 了解大模型训练流程,对AI数据集、标注、评测有认知
  • 学习能力强,善于沟通与协作

申请策略

  • 表达对多模态数据平台和B站AI方向的热情
  • 准备一个完整的数据处理或平台设计案例展示
  • 突出后端开发项目经验,特别是使用Go/Python/Java的实践
  • 展示对分布式系统或大数据组件的了解,如Redis、MySQL、K8s
  • 如果有AI数据处理或模型训练相关经历,重点强调
  • 强调开源贡献或顶会论文等加分项
  • 系统学习分布式系统原理,可阅读相关经典书籍
  • 动手实践TensorFlow/PyTorch数据流水线或类似工具

面试指南

  • 采用STAR法则描述项目:情境、任务、行动、结果
  • 对于系统设计问题,先明确需求,再拆分模块,最后考虑扩展性和容错
  • 结合具体技术细节,展示深度思考,比如权衡CAP
  • 请描述你参与过的一个后端项目,包括架构设计和遇到的挑战
  • 谈谈你对分布式系统一致性的理解,以及MySQL和Redis的适用场景
  • 如果让你设计一个数据清洗管道处理百万级图像,你会如何设计?
  • 你对大模型训练数据流程了解多少?请说明数据标注、评测的关键步骤
  • 如何衡量一个数据平台的效率?提出你觉得重要的指标

职位点评

71
综合评分

B站上海校招,多模态数据平台研发,技术栈前沿,成长空间大,但WLB一般。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合重视技术成长和前沿领域发展的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值70

薪资福利

70中等

B站作为上市大厂,薪资在行业中上水平,但校招薪资未明确,福利未提及,整体中等偏上。

薪资信号未披露(AI估算:18K-28K/月)

成长发展

90较高

岗位技术栈前沿,涉及AI和多模态数据平台,成长空间大,但JD未明确晋升通道。

技术前沿前沿/新兴技术
技术栈Go、Python、Java、Redis、MySQL、K8s、Ray、Iceberg、大模型、多模态
业务类型ambiguous

工作生活

40较低

仅现场办公,未提及WLB,上海工作,生活成本较高。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

AI行业高速增长,工作内容有技术使命感,但社会影响力一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs