Bilibili logo
哔哩哔哩
多模态数据平台研发工程师

多模态数据平台研发工程师

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Go
分布式系统
多模态
大模型
数据平台

AI 估算 · 25k–45k

高级研发岗,AI基础设施方向,技能稀缺,薪资有竞争力。

职位详情

关于这个职位

该职位负责构建面向多模态模型的统一数据平台,支持文本、图像、视频等海量异构数据的高效处理与分发,服务于大模型训练全生命周期

需要精通分布式系统与数据湖、计算引擎等技术,有平台化建设经验
适合对AI基础设施和前沿技术有兴趣的研发工程师

最低要求

精通 Python、Java、Go 等至少一种编程语言,具备扎实的分布式系统基础

深入理解以下至少一种技术体系,并具备线上平台化实践经验:
计算引擎(Ray)及其平台化封装
数据湖/湖仓一体方案(Iceberg/Paimon/Lance)及元数据管理
分布式调度系统、资源管理(YARN/K8s)或工作流编排平台
理解大模型训练与推理全链路中的数据流转机制,熟悉数据从采集、清洗、标注、增强到训练样本构造的全生命周期管理
对业务敏感,能快速理解业务背景,具备优秀的技术与业务结合能力、需求抽象能力和架构能力
学习能力强,能够快速学习新技术并应用于工程实践

工作职责

面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟

建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化
探索跨模态数据的对齐、融合与联合分析技术
主导平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从'工具化'向'智能化'演进,重新定义数据平台的交互与运维范式
关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性

优先资格

有大厂或 AI 公司内部数据平台、评估平台的建设经验

有数据平台(如数据开发平台、任务调度平台、标注平台)的完整设计或核心开发经验
参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretraining 或 SFT 阶段

AI 洞察

优缺点分析

优点

  • 深入接触多模态数据和分布式系统,提升稀缺能力
  • 有机会主导架构演进,推动平台智能化,有较强的技术影响力
  • 多模态数据处理复杂度高,需要同时掌握多种技术栈
  • 线上平台对高吞吐、低延迟要求严格,需要解决大规模分布式系统的稳定性问题
  • 技术迭代快,需要持续学习新技术并快速应用

缺点 / 挑战

  • B站平台,AI基础设施前沿方向,技术挑战大,技能积累丰富
  • 适合对AI基础设施有强烈兴趣,喜欢挑战复杂分布式系统问题,并乐于探索前沿技术的研发工程师

角色解读

  • 技术专家路线:深入多模态数据平台架构,成为分布式系统和AI基础设施专家
  • 架构师路线:主导平台智能化演进,扩展到AI-Native基础设施设计
  • 可转向AI研发方向,利用对数据全链路的理解参与模型优化
  • 构建多模态统一数据平台,支撑PB级数据的高效采集、存储、处理与分发
  • 建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强与特征提取
  • 主导平台架构演进,探索智能调度、自动修复等AI-Native能力
  • 设计标准化API/SDK和可观测性体系,提升平台易用性和运维效率
  • 精通Python/Java/Go等语言,扎实的分布式系统基础
  • 深入理解Ray、数据湖(Iceberg/Paimon/Lance)或分布式调度系统(YARN/K8s)
  • 熟悉大模型训练全链路数据流转机制,包括采集、清洗、标注到样本构造
  • 具备业务敏感度和架构能力,能快速学习新技术并落地实践

申请策略

  • 关注B站AI和数据平台的技术博客,了解其技术栈和发展方向
  • 在简历和面试中体现对数据平台智能化(AI-Native)的理解和热情
  • 突出分布式系统、数据湖或计算引擎(如Ray)的实战经验,尤其是线上平台化案例
  • 强调在多模态数据处理或大模型数据流水线方面的项目经历
  • 展示架构能力,如主导过平台设计或技术演进
  • 提及对业务理解和技术落地的结合经验
  • 深入学习Ray、数据湖开源项目(Iceberg/Paimon/Lance)
  • 了解大模型训练流程(Pre-training/SFT/RLHF)中的数据流转

面试指南

  • 系统设计题:采用分模块思路,从数据采集、存储、处理到分发,结合具体技术选型,突出高可用和伸缩性
  • 技术对比题:从特性、性能、生态等维度对比,结合场景说明选型理由
  • 项目经验题:用STAR法则,重点讲挑战、方案和成果
  • 请设计一个支持PB级多模态数据采集和存储的系统架构
  • 如何实现跨模态数据的对齐和融合?你用过哪些技术?
  • 介绍一下数据湖方案(Iceberg/Paimon)的核心特性及适用场景
  • 在分布式调度系统中,如何处理任务失败和资源竞争?
  • 你如何理解AI-Native数据平台?请举例说明智能化方向

职位点评

75
综合评分

AI前沿数据平台,技术驱动,成长空间大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合高度重视技术成长、愿意投入时间挑战前沿问题,对WLB要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活60
使命价值80

薪资福利

75中等

薪资未直接披露,但B站作为上市公司,研发岗位薪资具有市场竞争力,福利体系完善。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

职位涉及多模态AI基础设施前沿技术,技能成长空间大;有主导架构演进的机会,但未明确提及晋升通道。

技术前沿前沿/新兴技术
技术栈Ray、Iceberg、Paimon、Lance、K8s、多模态
业务类型ambiguous

工作生活

60中等

工作地点为上海,仅现场办公,未提及弹性工作或WLB措施,互联网公司通常有一定加班压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

AI行业处于高速增长赛道,多模态技术是前沿方向;虽然B站是娱乐平台,但AI基础设施对业务有核心价值。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs