
哔哩哔哩
大模型推理优化专家
大模型推理优化专家
发布于 大约 14 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Diffusion模型
Gpu并行计算
Onnx Runtime
Tensorrt
Vllm
分布式推理
视频大模型
AI 估算 · 40k–70k
大模型推理优化领域稀缺度高,B站上市大厂,3年以上经验结合CUDA和框架优化能力,薪资处于行业高位。
职位详情
关于这个职位
该职位负责视频大模型的推理引擎架构自研与优化,包括算子开发、分布式推理搭建及工程化落地,是技术深度与工程实践并重的核心岗位
适合对GPU计算和模型推理有深厚兴趣的工程师
最低要求
本科及以上学历,计算机、人工智能等相关专业,3年以上大模型推理引擎架构自研、底层开发经验,有视频/多模态时空模型开发经验优先
精通C++/CUDA与GPU并行计算,具备独立开发自定义高性能算子、重构推理链路的实战能力
熟悉TensorRT、ONNX Runtime、vLLM等主流推理框架底层原理,具备框架二次开发与定制化改造能力
深入理解Transformer、Diffusion模型架构,熟悉视频大模型时序推理、帧迭代生成、时空注意力机制核心逻辑
工作职责
推理引擎架构自研:针对视频大模型时空迭代、长序列生成特性,设计端到端专属推理架构,完成链路拆解、模块标准化,搭建适配视频场景的训推一体推理底座
底层模块与算子开发:独立研发视频模型专属时序推理、扩散采样、帧间交互等核心模块,手写高性能CUDA自定义算子,补齐通用框架能力短板,保障推理链路稳定可扩展
推理工程化落地:负责模型权重适配、格式转换与推理链路闭环,实现视频生成、视频理解全场景推理标准化,支撑模型快速迭代与批量上线
分布式推理底座搭建:完成GPU全系列适配,设计实现单机高性能、多机分布式并行推理架构,支撑高清、长视频大规模推理部署场景
工具链与体系建设:搭建推理评测、调试、效果对齐工具链,制定研发与部署规范,构建完整的视频大模型推理工程体系,赋能团队高效迭代
优先资格
有视频生成/理解大模型推理引擎从零搭建、工业级落地经验
具备分布式推理、动态调度底座自研经验,可独立搭建端到端推理工程体系
熟悉训推协同优化,可联动训练团队解决训推不一致、模型适配等底层问题
有开源推理框架贡献、算子开源、技术专利等相关沉淀
AI 洞察
优缺点分析
优点
- B站作为视频平台,业务场景丰富,推理优化直接落地产生实际影响
- 有机会从零构建推理引擎,积累体系化的架构设计与工程化经验
- 团队技术氛围浓厚,可参与开源贡献和技术专利沉淀
- 需要同时掌握CUDA底层优化和框架二次开发,技术栈较深,学习曲线陡峭
- 适合对GPU计算和大模型推理有强烈兴趣,喜欢底层优化和架构设计的资深工程师,尤其是有视频或多模态背景的候选人
缺点 / 挑战
- 紧贴视频大模型前沿方向,技术挑战大,个人成长空间显著
- 视频模型推理对延迟和吞吐要求高,可能需要应对高强度优化和迭代压力
- 作为核心岗位,涉及多团队协作(训练、部署、业务),沟通成本较高
角色解读
- 成为视频大模型推理领域的专家,主导端到端推理引擎的架构演进
- 横向扩展到训推协同优化,与训练团队合作解决底层适配问题,提升整体效率
- 向技术管理方向发展,带领团队构建推理工程体系,推动行业技术标准
- 设计并自研视频大模型的专属推理架构,针对时空迭代和长序列生成进行优化
- 开发高性能CUDA自定义算子,实现视频模型特有的时序推理和扩散采样等核心模块
- 完成模型权重适配、格式转换及推理链路闭环,推动视频生成和理解场景的标准化部署
- 搭建单机高性能与多机分布式推理底座,支持高清长视频的大规模推理
- 精通C++和CUDA,具备独立开发高性能算子和优化GPU计算的能力
- 深入理解TensorRT、ONNX Runtime、vLLM等推理框架底层原理,能进行二次开发
- 熟悉Transformer和Diffusion模型架构,理解视频模型的时序推理与时空注意力机制
- 具备分布式推理和工程化落地经验,能搭建完整的推理工具链和规范
申请策略
- 深入了解B站视频业务的技术栈和产品方向,在面试中展示你对视频推理场景的理解
- 准备一个你主导的推理优化案例,从问题分析到方案实施再到效果量化,体现系统性思维
- 突出在推理引擎架构自研或算子开发方面的项目经验,特别是视频或大模型领域
- 强调对CUDA和主流推理框架的深入理解,附上性能优化数据或开源贡献链接
- 展示分布式推理或训推协同的落地案例,体现工程化能力
- 提及任何与视频生成、理解模型相关的开发经验,即使是研究性质的
- 系统学习TensorRT和vLLM的源码,尝试进行定制化修改和性能测试
- 熟悉视频大模型(如Sora、Stable Video Diffusion)的推理流程,动手实验时序采样和帧交互
面试指南
- 对于架构设计类问题,从需求分析、模块划分、关键权衡(如延迟vs吞吐)到工程落地展开,结合具体技术方案
- 对于优化类问题,遵循“问题定位-瓶颈分析-优化手段-效果验证”的步骤,强调数据驱动和经验总结
- 对于原理理解类问题,先概括核心机制,再对比不同框架的优缺点,最后结合实际应用场景给出选择理由
- 请描述你如何设计一个针对视频大模型的推理引擎架构,考虑哪些关键设计点?
- CUDA算子优化中,如何权衡寄存器使用和共享内存,举例说明
- TensorRT和vLLM的底层原理有什么异同?如何对它们进行定制化改造?
- 视频模型推理中,时序维度的并行化如何实现?遇到过什么挑战?
- 如何处理训推不一致问题?请结合具体模型(如扩散模型)说明
职位点评
74
综合评分
前沿大模型推理岗,技术成长极高,但工作强度大,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和职业成长、愿意接受高强度挑战的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值70
薪资福利
80较高
大厂上市,薪资水平较高,福利完善,但未明确提及具体薪资和福利细节。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
岗位聚焦前沿技术(大模型推理优化),技术挑战大,成长空间广阔,且有机会从零搭建体系。
技术前沿前沿/新兴技术
技术栈C++、CUDA、TensorRT、ONNX Runtime、vLLM、Transformer、Diffusion、视频大模型、分布式推理
业务类型ambiguous
工作生活
40较低
仅现场办公,未提及弹性工作或WLB,可能存在高强度优化压力。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
视频大模型是高速增长赛道,技术影响力大,但社会意义中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs