
哔哩哔哩
【B-UP】多模态数据平台研发工程师(实习)
【B-UP】多模态数据平台研发工程师(实习)
发布于 大约 1 小时前实习/见习
上海市
无经验要求
实习生
仅现场办公
本科
软件工程
Go
Lance
Paimon
分布式系统
多模态
大模型
数据平台
AI 估算 · 4k–8k
上海大厂实习薪资通常200-400元/天,按月估算4000-8000元,考虑B站品牌和技术前沿性,薪资有竞争力。
职位详情
关于这个职位
这是一份面向多模态AI数据平台的实习岗位,你将参与构建支持PB级数据管理、跨模态数据处理的统一平台,接触LLM全生命周期(Pretrain/SFT/RLHF)的数据工程
适合对AI基础设施、分布式系统和大规模数据处理有热情的同学
最低要求
计算机、软件工程、大数据、人工智能等相关专业,本科及以上学历
熟练掌握 Go / Python / Java至少一门后端开发语言,具备良好代码风格,了解基础数据结构、计算机网络、操作系统知识
了解分布式系统基础概念,熟悉数据库(MySQL)、缓存(Redis)等常用中间件基础原理与实践
了解大模型基础链路,对 AI 数据集、数据标注、模型评测、训练任务流程有基本认知优先
优秀的逻辑思维、沟通协作能力,具备较强自驱力与学习能力,乐于接受复杂业务场景挑战
工作职责
面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟
参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化
探索跨模态数据的对齐、融合与联合分析技术
参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式
关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性
优先资格
有大厂或 AI 公司内部数据平台、评估平台的建设经验
有数据平台(如数据开发平台、任务调度平台、标注平台)的设计或开发经验
参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretrain/SFT/RLHF
参与过训练数据与评测数据平台建设,具备文本、图像、视频、音频的可视化、检索、聚类、统计分析、筛选过滤、标注及人工评测等功能开发经验
具备评测结果管理(GSB 对比、绝对分打分)、质检评价、返工再标注等 workflow 设计经验
积极实践 AI 辅助编程(如 Harness Engineering 理念),擅长将 AI 能力融入平台开发流程中
有开源大数据/多模态数据处理项目贡献经验,或在相关领域顶会(OSDI/SOSP/NeurIPS/ICML/CVPR 等)发表过论文
理解以下至少一种技术体系,并具备线上平台化实践经验
计算引擎(Ray)及其平台化封装
数据湖/湖仓一体方案(Iceberg/Paimon/Lance)及元数据管理
分布式调度系统、资源管理(YARN/K8s)或工作流编排平台
AI 洞察
优缺点分析
优点
- 接触前沿多模态AI技术栈,参与实际大模型数据平台建设,技术含金量高
- B站大平台,有完整实习培养体系,转正机会大
- 团队关注开发者体验和AI辅助编程,成长环境好
- 涉及多技术栈(分布式、大数据、AI),学习曲线较陡
- 适合对AI基础设施有强烈兴趣、具备一定全栈能力和自驱力的计算机专业同学
缺点 / 挑战
- 实习期间需快速上手,可能面临复杂业务场景的挑战
角色解读
- 实习结束可转正,成长为AI数据平台或大模型基础设施方向的核心工程师
- 深入多模态数据处理、分布式计算、AI平台化等领域,成为技术专家
- 构建统一多模态数据平台,处理PB级文本、图像、视频、音频数据,支撑大模型训练
- 参与多模态数据处理管线开发,实现数据清洗、标注、特征提取和可视化
- 探索AI-Native Data Agent基础设施,推动平台向智能化演进
- 熟练掌握至少一门后端开发语言(Go/Python/Java),具备扎实的数据结构和网络基础
- 了解分布式系统和常用中间件(MySQL、Redis),愿意学习大数据/AI基础设施
- 对大模型基础链路有基本认知,理解数据标注、训练流程
申请策略
- 在简历中体现对AI数据平台的理解,可提及对B站数据业务的兴趣
- 准备一个展示你技术深度和自驱力的小项目或分析
- 突出后端开发项目经验,尤其是Go/Python相关项目,展示代码质量
- 如有AI/大数据相关项目(数据处理、分布式任务)务必详述
- 若有开源贡献或顶会论文,放在显眼位置
- 提前学习Go语言和分布式基础(如Kafka、K8s概念)
- 了解大模型训练数据流程(Pretrain/SFT/RLHF),阅读相关技术博文
面试指南
- 使用STAR法则(情境-任务-行动-结果)描述项目,突出数据量和架构设计
- 技术问题先讲核心概念,再结合实际场景给出个人见解
- 请介绍你参与过的后端项目,如何处理大规模数据?
- 你对分布式系统的一致性、容错性有什么理解?
- 多模态数据处理中,如何实现文本和图像的对齐?
- 你了解哪些数据湖/湖仓一体方案?选型考虑是什么?
- 复习计算机网络、操作系统、数据库等基础知识
- 了解B站技术栈和AI业务方向(如多模态搜索、推荐)
职位点评
71
综合评分
B站多模态数据平台实习,前沿技术栈,学习成长极佳,薪资中等,现场办公。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
最适合同样追求技术成长、愿意投入学习的同学,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值70
薪资福利
60中等
实习薪资在上海大厂中属中等水平,但B站品牌和转正机会提供一定补偿。
薪资信号未披露(AI估算:4K-8K/月)
成长发展
90较高
该岗位技术前沿,涉及多模态、大模型、AI-Native等,学习成长机会极佳。
技术前沿前沿/新兴技术
技术栈多模态、大模型、Ray、Iceberg、Paimon、Lance、Kubernetes、数据湖、AI-Native
业务类型ambiguous
工作生活
50较低
现场办公,未提及弹性工作或远程,但实习作息相对规律。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
B站作为知名视频平台,多模态数据平台对用户体验有正面影响,但岗位偏基础设施,社会影响力一般。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs