Bilibili logo
哔哩哔哩
大模型推理优化专家

大模型推理优化专家

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Diffusion模型
Gpu并行计算
Onnx Runtime
Tensorrt
Vllm
分布式推理
视频大模型

AI 估算 · 40k–70k

大模型推理优化领域稀缺度高,B站上市大厂,3年以上经验结合CUDA和框架优化能力,薪资处于行业高位。

职位详情

关于这个职位

该职位负责视频大模型的推理引擎架构自研与优化,包括算子开发、分布式推理搭建及工程化落地,是技术深度与工程实践并重的核心岗位

适合对GPU计算和模型推理有深厚兴趣的工程师

最低要求

本科及以上学历,计算机、人工智能等相关专业,3年以上大模型推理引擎架构自研、底层开发经验,有视频/多模态时空模型开发经验优先

精通C++/CUDA与GPU并行计算,具备独立开发自定义高性能算子、重构推理链路的实战能力
熟悉TensorRT、ONNX Runtime、vLLM等主流推理框架底层原理,具备框架二次开发与定制化改造能力
深入理解Transformer、Diffusion模型架构,熟悉视频大模型时序推理、帧迭代生成、时空注意力机制核心逻辑

工作职责

推理引擎架构自研:针对视频大模型时空迭代、长序列生成特性,设计端到端专属推理架构,完成链路拆解、模块标准化,搭建适配视频场景的训推一体推理底座

底层模块与算子开发:独立研发视频模型专属时序推理、扩散采样、帧间交互等核心模块,手写高性能CUDA自定义算子,补齐通用框架能力短板,保障推理链路稳定可扩展
推理工程化落地:负责模型权重适配、格式转换与推理链路闭环,实现视频生成、视频理解全场景推理标准化,支撑模型快速迭代与批量上线
分布式推理底座搭建:完成GPU全系列适配,设计实现单机高性能、多机分布式并行推理架构,支撑高清、长视频大规模推理部署场景
工具链与体系建设:搭建推理评测、调试、效果对齐工具链,制定研发与部署规范,构建完整的视频大模型推理工程体系,赋能团队高效迭代

优先资格

有视频生成/理解大模型推理引擎从零搭建、工业级落地经验

具备分布式推理、动态调度底座自研经验,可独立搭建端到端推理工程体系
熟悉训推协同优化,可联动训练团队解决训推不一致、模型适配等底层问题
有开源推理框架贡献、算子开源、技术专利等相关沉淀

AI 洞察

优缺点分析

优点

  • B站作为视频平台,业务场景丰富,推理优化直接落地产生实际影响
  • 有机会从零构建推理引擎,积累体系化的架构设计与工程化经验
  • 团队技术氛围浓厚,可参与开源贡献和技术专利沉淀
  • 需要同时掌握CUDA底层优化和框架二次开发,技术栈较深,学习曲线陡峭
  • 适合对GPU计算和大模型推理有强烈兴趣,喜欢底层优化和架构设计的资深工程师,尤其是有视频或多模态背景的候选人

缺点 / 挑战

  • 紧贴视频大模型前沿方向,技术挑战大,个人成长空间显著
  • 视频模型推理对延迟和吞吐要求高,可能需要应对高强度优化和迭代压力
  • 作为核心岗位,涉及多团队协作(训练、部署、业务),沟通成本较高

角色解读

  • 成为视频大模型推理领域的专家,主导端到端推理引擎的架构演进
  • 横向扩展到训推协同优化,与训练团队合作解决底层适配问题,提升整体效率
  • 向技术管理方向发展,带领团队构建推理工程体系,推动行业技术标准
  • 设计并自研视频大模型的专属推理架构,针对时空迭代和长序列生成进行优化
  • 开发高性能CUDA自定义算子,实现视频模型特有的时序推理和扩散采样等核心模块
  • 完成模型权重适配、格式转换及推理链路闭环,推动视频生成和理解场景的标准化部署
  • 搭建单机高性能与多机分布式推理底座,支持高清长视频的大规模推理
  • 精通C++和CUDA,具备独立开发高性能算子和优化GPU计算的能力
  • 深入理解TensorRT、ONNX Runtime、vLLM等推理框架底层原理,能进行二次开发
  • 熟悉Transformer和Diffusion模型架构,理解视频模型的时序推理与时空注意力机制
  • 具备分布式推理和工程化落地经验,能搭建完整的推理工具链和规范

申请策略

  • 深入了解B站视频业务的技术栈和产品方向,在面试中展示你对视频推理场景的理解
  • 准备一个你主导的推理优化案例,从问题分析到方案实施再到效果量化,体现系统性思维
  • 突出在推理引擎架构自研或算子开发方面的项目经验,特别是视频或大模型领域
  • 强调对CUDA和主流推理框架的深入理解,附上性能优化数据或开源贡献链接
  • 展示分布式推理或训推协同的落地案例,体现工程化能力
  • 提及任何与视频生成、理解模型相关的开发经验,即使是研究性质的
  • 系统学习TensorRT和vLLM的源码,尝试进行定制化修改和性能测试
  • 熟悉视频大模型(如Sora、Stable Video Diffusion)的推理流程,动手实验时序采样和帧交互

面试指南

  • 对于架构设计类问题,从需求分析、模块划分、关键权衡(如延迟vs吞吐)到工程落地展开,结合具体技术方案
  • 对于优化类问题,遵循“问题定位-瓶颈分析-优化手段-效果验证”的步骤,强调数据驱动和经验总结
  • 对于原理理解类问题,先概括核心机制,再对比不同框架的优缺点,最后结合实际应用场景给出选择理由
  • 请描述你如何设计一个针对视频大模型的推理引擎架构,考虑哪些关键设计点?
  • CUDA算子优化中,如何权衡寄存器使用和共享内存,举例说明
  • TensorRT和vLLM的底层原理有什么异同?如何对它们进行定制化改造?
  • 视频模型推理中,时序维度的并行化如何实现?遇到过什么挑战?
  • 如何处理训推不一致问题?请结合具体模型(如扩散模型)说明

职位点评

74
综合评分

前沿大模型推理岗,技术成长极高,但工作强度大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和职业成长、愿意接受高强度挑战的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值70

薪资福利

80较高

大厂上市,薪资水平较高,福利完善,但未明确提及具体薪资和福利细节。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

95较高

岗位聚焦前沿技术(大模型推理优化),技术挑战大,成长空间广阔,且有机会从零搭建体系。

技术前沿前沿/新兴技术
技术栈C++、CUDA、TensorRT、ONNX Runtime、vLLM、Transformer、Diffusion、视频大模型、分布式推理
业务类型ambiguous

工作生活

40较低

仅现场办公,未提及弹性工作或WLB,可能存在高强度优化压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

视频大模型是高速增长赛道,技术影响力大,但社会意义中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs