
字节跳动
AI异构硬件推理优化专家-Seed
AI异构硬件推理优化专家-Seed
发布于 大约 3 小时前普通员工/个人贡献者
上海市
其它
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Kv Cache
Llm推理
Vllm
分布式推理
量化
高性能计算
AI 估算 · 40k–70k
AI推理优化专家,字节核心团队,上海高薪,技术门槛高,市场稀缺。
职位详情
关于这个职位
该职位负责字节跳动Seed团队自研LLM模型在超大规模AI加速卡集群上的推理部署与性能优化,涵盖分布式推理框架、高性能算子开发与在线稳定性建设
你将深入优化调度、Batching、KV Cache、量化等核心链路,支撑豆包和火山引擎的大规模业务流量,适合热爱系统优化与AI技术的资深工程师
最低要求
计算机、软件工程、人工智能、电子信息、微电子等相关专业优先
熟悉Linux环境下的C/C++或Python,具备扎实的编程能力和工程习惯
熟悉计算机体系结构、芯片微架构、高性能计算、分布式系统、并行计算中的至少一个方向
了解大模型推理基本流程,对Serving、调度、并发、显存管理、KV Cache或分布式推理有兴趣
关注延迟、吞吐、带宽、算力利用率、显存占用、网络通信和在线稳定性等性能问题
工作职责
该岗位面向超大规模AI加速卡集群,负责豆包Seed自研LLM模型的推理业务落地,深度参与分布式推理框架优化、高性能算子开发与在线稳定性建设,支撑豆包和火山引擎的大规模在线业务流量
业务Serving上线:参与豆包Seed自研LLM模型在超大规模AI加速卡集群上的部署、适配、性能调优和稳定性建设
推理框架优化:优化调度、Batching、KV Cache、显存管理、分布式并行、负载均衡、投机推理、稀疏计算和量化等核心链路
高性能算子与通信优化:面向不同异构硬件ISA开发和优化Attention、GEMM、量化、通算融合等关键LLM算子
优先资格
加分项:
有AI芯片性能优化经验,热衷于探索不同芯片或集群的性能边界
熟悉常见的推理Serving技术栈,包括vLLM、SGLang、PagedAttention、投机推理等
有CUDA、AscendC、TileLang、Triton、CUTLASS、TVM、MLIR、TorchInductor等相关经验
具备以下经验:高性能算子开发、网络通信优化、推理引擎优化、在线服务性能优化或硬件适配
有OI/ACM、HPC竞赛、系统竞赛、科研项目或开源项目经历
AI 洞察
优缺点分析
优点
- 字节跳动平台优势,资源丰富,能接触到超大规模GPU集群和真实业务场景
- 团队是Seed核心团队,在业界影响力大,有较多技术分享和学术交流机会
- 薪资待遇优厚,股权激励等
- 技术栈复杂,涉及底层硬件和分布式系统,学习曲线陡峭
- 需要不断跟进最新技术,保持持续学习状态
缺点 / 挑战
- 处于AI大模型最前沿领域,技术挑战大,个人成长迅速,简历含金量高
- 工作强度较大,可能需要应对高并发业务压力和紧急问题
- 适合对AI基础设施充满热情、有扎实系统编程功底、喜欢挑战高性能优化难题的资深工程师
角色解读
- 在AI系统优化方向深耕,成为大模型推理引擎的专家,参与前沿技术研究
- 可向技术架构师方向成长,负责整套推理系统的设计
- 随着团队拓展,有向技术管理方向发展的机会,带领小团队
- 负责豆包Seed自研LLM模型在超大规模AI加速卡集群上的部署、适配与性能调优,确保大规模在线服务稳定运行
- 深入优化分布式推理框架,包括调度、Batching、KV Cache、显存管理、分布式并行、负载均衡等核心链路
- 面向不同异构硬件(如GPU、AI芯片)开发高性能算子,优化Attention、GEMM、量化等关键LLM算子
- 参与在线稳定性建设,关注延迟、吞吐、算力利用率等性能指标,保障大规模业务流量
- 扎实的C/C++或Python编程能力,具备优秀的工程习惯和调试能力
- 熟悉计算机体系结构、芯片微架构、高性能计算或分布式系统,能理解硬件特性并针对性优化
- 了解大模型推理流程,熟悉Serving、调度、并发、显存管理、KV Cache等概念
- 具备性能分析能力,能针对延迟、吞吐、带宽等指标进行系统级调优
申请策略
- 申请时附上个人技术博客或GitHub链接,展示持续学习能力
- 了解字节跳动Seed团队的最新研究方向,在面试中体现对业务的认知
- 突出高性能计算或分布式系统相关的项目经验,特别是与GPU优化、推理引擎相关的工作
- 展示C/C++编程能力,比如开源项目、竞赛奖项
- 如果有使用vLLM、SGLang等推理框架的经验,或CUDA/Triton等算子开发经验要重点描述
- 强调对性能优化的热情,用具体数据说明优化效果(如延迟降低、吞吐提升)
- 了解主流推理框架的源码,如vLLM的调度和PagedAttention机制
- 学习CUDA编程和GPU体系结构,尝试编写简单的算子
面试指南
- 从问题定义入手,分析影响因素,然后提出方案,最后用实验数据验证
- 结合具体场景,先讲通用原理,再讲针对性的优化策略
- 强调系统性思维,从应用层到硬件层逐层分析
- 如何优化大模型推理中的KV Cache显存占用?
- 解释你对vLLM中PagedAttention的理解,如何实现连续batching?
- 针对特定GPU,如何优化一个GEMM算子?
- 在分布式推理中,如何减少通信开销?
- 如何定位线上推理服务的性能瓶颈(如GPU利用率低)?
职位点评
76
综合评分
前沿AI大模型推理优化专家,技术成长快,薪资优厚,但工作强度高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术挑战与职业发展、能适应高强度工作节奏的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利82
成长发展90
工作生活45
使命价值78
薪资福利
82较高
字节跳动提供行业内领先的薪酬福利,但JD未透露具体薪资信息。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
岗位涉及最前沿的AI系统优化技术,技术栈新颖,成长空间大。
技术前沿前沿/新兴技术
技术栈LLM、GPU、KV Cache、vLLM、CUDA、Triton、分布式推理
业务类型ambiguous
工作生活
45较低
工作地点上海,办公方式为现场,JD未提及弹性工时或远程,字节工作节奏较快。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
78中等
Seed团队有明确的使命愿景,推动AI前沿发展,社会影响力大。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号为科技和社会发展作出贡献
创新程度积极采用新技术
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs