
哔哩哔哩
多模态数据平台研发工程师
多模态数据平台研发工程师
发布于 大约 14 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Go
分布式系统
多模态
大模型
数据平台
AI 估算 · 25k–45k
高级研发岗,AI基础设施方向,技能稀缺,薪资有竞争力。
职位详情
关于这个职位
该职位负责构建面向多模态模型的统一数据平台,支持文本、图像、视频等海量异构数据的高效处理与分发,服务于大模型训练全生命周期
需要精通分布式系统与数据湖、计算引擎等技术,有平台化建设经验
适合对AI基础设施和前沿技术有兴趣的研发工程师
最低要求
精通 Python、Java、Go 等至少一种编程语言,具备扎实的分布式系统基础
深入理解以下至少一种技术体系,并具备线上平台化实践经验:
计算引擎(Ray)及其平台化封装
数据湖/湖仓一体方案(Iceberg/Paimon/Lance)及元数据管理
分布式调度系统、资源管理(YARN/K8s)或工作流编排平台
理解大模型训练与推理全链路中的数据流转机制,熟悉数据从采集、清洗、标注、增强到训练样本构造的全生命周期管理
对业务敏感,能快速理解业务背景,具备优秀的技术与业务结合能力、需求抽象能力和架构能力
学习能力强,能够快速学习新技术并应用于工程实践
工作职责
面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟
建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化
探索跨模态数据的对齐、融合与联合分析技术
主导平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从'工具化'向'智能化'演进,重新定义数据平台的交互与运维范式
关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性
优先资格
有大厂或 AI 公司内部数据平台、评估平台的建设经验
有数据平台(如数据开发平台、任务调度平台、标注平台)的完整设计或核心开发经验
参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretraining 或 SFT 阶段
AI 洞察
优缺点分析
优点
- 深入接触多模态数据和分布式系统,提升稀缺能力
- 有机会主导架构演进,推动平台智能化,有较强的技术影响力
- 多模态数据处理复杂度高,需要同时掌握多种技术栈
- 线上平台对高吞吐、低延迟要求严格,需要解决大规模分布式系统的稳定性问题
- 技术迭代快,需要持续学习新技术并快速应用
缺点 / 挑战
- B站平台,AI基础设施前沿方向,技术挑战大,技能积累丰富
- 适合对AI基础设施有强烈兴趣,喜欢挑战复杂分布式系统问题,并乐于探索前沿技术的研发工程师
角色解读
- 技术专家路线:深入多模态数据平台架构,成为分布式系统和AI基础设施专家
- 架构师路线:主导平台智能化演进,扩展到AI-Native基础设施设计
- 可转向AI研发方向,利用对数据全链路的理解参与模型优化
- 构建多模态统一数据平台,支撑PB级数据的高效采集、存储、处理与分发
- 建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强与特征提取
- 主导平台架构演进,探索智能调度、自动修复等AI-Native能力
- 设计标准化API/SDK和可观测性体系,提升平台易用性和运维效率
- 精通Python/Java/Go等语言,扎实的分布式系统基础
- 深入理解Ray、数据湖(Iceberg/Paimon/Lance)或分布式调度系统(YARN/K8s)
- 熟悉大模型训练全链路数据流转机制,包括采集、清洗、标注到样本构造
- 具备业务敏感度和架构能力,能快速学习新技术并落地实践
申请策略
- 关注B站AI和数据平台的技术博客,了解其技术栈和发展方向
- 在简历和面试中体现对数据平台智能化(AI-Native)的理解和热情
- 突出分布式系统、数据湖或计算引擎(如Ray)的实战经验,尤其是线上平台化案例
- 强调在多模态数据处理或大模型数据流水线方面的项目经历
- 展示架构能力,如主导过平台设计或技术演进
- 提及对业务理解和技术落地的结合经验
- 深入学习Ray、数据湖开源项目(Iceberg/Paimon/Lance)
- 了解大模型训练流程(Pre-training/SFT/RLHF)中的数据流转
面试指南
- 系统设计题:采用分模块思路,从数据采集、存储、处理到分发,结合具体技术选型,突出高可用和伸缩性
- 技术对比题:从特性、性能、生态等维度对比,结合场景说明选型理由
- 项目经验题:用STAR法则,重点讲挑战、方案和成果
- 请设计一个支持PB级多模态数据采集和存储的系统架构
- 如何实现跨模态数据的对齐和融合?你用过哪些技术?
- 介绍一下数据湖方案(Iceberg/Paimon)的核心特性及适用场景
- 在分布式调度系统中,如何处理任务失败和资源竞争?
- 你如何理解AI-Native数据平台?请举例说明智能化方向
职位点评
75
综合评分
AI前沿数据平台,技术驱动,成长空间大,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合高度重视技术成长、愿意投入时间挑战前沿问题,对WLB要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活60
使命价值80
薪资福利
75中等
薪资未直接披露,但B站作为上市公司,研发岗位薪资具有市场竞争力,福利体系完善。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
85较高
职位涉及多模态AI基础设施前沿技术,技能成长空间大;有主导架构演进的机会,但未明确提及晋升通道。
技术前沿前沿/新兴技术
技术栈Ray、Iceberg、Paimon、Lance、K8s、多模态
业务类型ambiguous
工作生活
60中等
工作地点为上海,仅现场办公,未提及弹性工作或WLB措施,互联网公司通常有一定加班压力。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AI行业处于高速增长赛道,多模态技术是前沿方向;虽然B站是娱乐平台,但AI基础设施对业务有核心价值。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs