
哔哩哔哩
bilibili-多模态数据算法工程师
bilibili-多模态数据算法工程师
发布于 大约 14 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Ffmpeg
Onnx
Opencv
Qwen Vl
Tensorrt
Vision Transformer
多模态学习
视频理解
AI 估算 · 40k–70k
上海大厂高级算法岗,多模态方向稀缺,薪资竞争力强,参考市场水平。
职位详情
关于这个职位
这是一个在哔哩哔哩负责多模态数据算法开发的岗位,核心是构建高性能音视频理解Pipeline,优化Caption、QA、OCR、ASR等模型效果,并提升CPU/GPU推理效率
你将与生成模型团队协作,设计自动化数据生产流程,适合对模型效果有Owner意识、热衷技术深挖的算法工程师
最低要求
任职要求:
熟悉 Transformer、Vision Transformer、多模态模型基础
熟悉 Qwen VL、Gemma、Gemini、SeedVL 等理解模型
熟悉 TensorRT、ONNX Runtime、CUDA Optimization
熟悉 FFmpeg、OpenCV、CUDA Video Codec
有千万级以上视频 Pipeline 经验
我们希望你:
不只是调用模型,而是持续优化模型效果、效率和成本
乐于做 Benchmark,能够系统分析误差来源并持续迭代
对模型效果有 Owner 意识,而不是模块 Owner
工作职责
工作职责:
构建高性能音视频理解 Pipeline,负责各类理解模型的推理、训练和持续优化
持续优化 Caption、Tag、PE、QA、Quality Assessment 等理解能力,提高数据生产质量
优化 CPU/GPU 推理效率,包括模型部署、Batching、Quantization、TensorRT、ONNX 等
持续优化各类专家模型,包括但不限于:Motion Detection、Shot/Scene Cut Detection、Artifact Detection、Audio-Visual Sync、OCR、ASR、Speaker Detection、Quality Assessment
与生成模型团队共同设计自动化数据生产 Pipeline,提升整体数据质量和处理效率
AI 洞察
优缺点分析
优点
- 技术栈前沿,深入多模态和推理优化,行业需求旺盛,个人技术能力提升快
- B站平台数据丰富,视频理解场景真实复杂,有大量千万级数据实战机会
- 公司上市,薪资福利有竞争力,且大厂履历有助于后续职业发展
- 与生成模型团队合作紧密,能接触AI生成与理解全链路,视野开阔
- 视频Pipeline工程量大,涉及多种模型和系统级优化,需要跨领域知识,学习曲线陡峭
- JD未明确薪资和晋升路径,需在面试中进一步确认团队氛围和发展空间
- 适合对多模态模型和推理优化有浓厚兴趣、技术自驱力强,并希望在AI领域深入钻研的工程师
缺点 / 挑战
- 算法工程师竞争激烈,工作强度普遍较高,需适应快速迭代和高压节奏
角色解读
- 技术深度方向:从模型推理优化走向端侧部署、模型压缩等更底层系统,成为AI基础设施专家
- 业务广度方向:深入内容理解与生成链路,逐步转向技术Leader,主导数据Pipeline架构设计
- 行业方向:多模态领域人才稀缺,可横向拓展到AIGC、自动驾驶、安防等看好CV/NLP融合的行业
- 负责音视频理解模型的训练与推理优化,构建自动化数据生产Pipeline,覆盖Caption生成、标签提取、质量评估等环节
- 针对CPU/GPU推理效率进行深度优化,包括模型部署、量化、TensorRT集成等,确保大规模视频处理的性能
- 持续迭代各类专家模型(如场景切割、OCR、ASR、说话人检测等),提升数据生产的准确性与效率
- 与生成模型团队协作,设计端到端的数据自动化处理方案,支撑内容理解与生成场景
- 扎实的深度学习基础,熟悉Transformer、Vision Transformer及多模态模型架构
- 熟练使用Qwen VL、Gemma等主流理解模型,了解其训练与推理特性
- 精通TensorRT、ONNX Runtime、CUDA优化,具备模型部署和推理加速经验
- 掌握FFmpeg、OpenCV及音视频处理技术,并有千万级视频Pipeline实践经验
申请策略
- 了解B站视频业务场景(如弹幕、内容审核、推荐),在面试中结合具体案例展示你的理解
- 可主动询问团队当前Pipeline的瓶颈和未来规划,展现你对数据生产链路整体思考的潜力
- 突出大规模视频处理项目经验,具体说明Pipeline架构、数据规模和处理效率提升指标
- 强调模型优化成果,如推理速度提升、显存占用降低、模型精度改善等量化数据
- 展示对TensorRT、ONNX、CUDA等部署优化工具的熟练度,附上技术博客或开源项目更佳
- 体现你对模型效果的Owner意识,例如主动发现并解决过线上模型问题的案例
- 提前熟悉Qwen VL、Gemma等模型的结构和微调方法,动手跑通一个多模态推理Demo
- 深入学习TensorRT的算子优化和模型量化技术,尝试用GPU Profiler分析性能瓶颈
面试指南
- 采用STAR法则:先说背景与目标,再讲你的具体做法和设计决策,最后用数据说明结果和反思
- 对于系统设计类问题,建议从需求分析、架构选型、模块拆解、性能评估和迭代计划几个维度展开
- 对于优化类问题,强调你如何定位瓶颈(如Profiling)、实验对比、量化/算子优化等具体手段,并说明效果和取舍
- 请谈谈你如何设计一个大规模视频理解Pipeline,关键模块和性能指标是什么?
- 你在TensorRT/ONNX部署时遇到过哪些问题?如何排查和解决?
- 如何评估一个Caption或QA模型的效果?你会如何迭代优化?
- 你对多模态模型(如Qwen VL)的原理了解多少?它的优劣势和应用场景?
- 你如何处理推理延迟和吞吐量之间的trade-off?
职位点评
72
综合评分
大厂多模态算法岗,前沿技术驱动,薪资优厚,但工作强度较大,WLB受限
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术突破、愿意投身AI前沿领域且能接受高强度工作的求职者
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展88
工作生活45
使命价值70
薪资福利
75中等
B站作为上市公司,薪酬体系完善,该岗位属于核心算法岗,薪资水平在上海具有竞争力,但JD未明确具体薪资和福利。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
88较高
多模态AI是前沿技术方向,岗位涉及模型训练、优化和部署全链路,技术成长空间大,且B站有丰富的真实业务场景。
技术前沿前沿/新兴技术
技术栈Transformer、Vision Transformer、Qwen VL、TensorRT、ONNX、CUDA、FFmpeg、OpenCV
业务类型ambiguous
工作生活
45较低
工作地点在上海,现场办公,JD未提及弹性工作或加班情况,互联网大厂算法岗通常强度较大,生活平衡可能受限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI多模态技术具有技术创新意义,可应用于内容理解与生成,对社会生产有广泛影响,但岗位本身社会价值标签不明显。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs