ByteDance logo
字节跳动
训练高性能计算工程师-Seed

训练高性能计算工程师-Seed

发布于 大约 3 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Nccl
Nvlink
Pytorch
Tvm
大模型训练
高性能计算

AI 估算 · 40k–70k

大模型训练优化为稀缺技能,字节平台薪资竞争力强,北京高级工程师月薪中位数约5.5万。

职位详情

关于这个职位

该职位负责大规模AI训练系统中的高性能算子设计与优化,针对不同AI加速器硬件进行极致性能调优,涉及计算与通信的联合优化

需要扎实的C/C++/Python和CUDA功底,熟悉主流大模型架构
适合对底层系统和高性能计算有浓厚兴趣的资深工程师

最低要求

掌握C/C++,精通Python,熟练掌握PyTorch

熟悉CUDA编程,熟悉NVIDIA或其他加速器硬件架构细节和优化点
熟悉Triton/TVM/Torch.Compile等编译工具
熟悉Nccl或Nvshmem通信算子的底层实现,熟悉主流的RDMA/NVLINK的通信拓扑
熟悉主流文本大模型/多模态大模型/Diffusion类模型架构以及训练方式

工作职责

负责大规模训练系统中的关键高性能算子的设计与实现

针对不同AI加速器的硬件架构,对训练算子性能做极致的性能优化
针对大模型训练系统中不同分布式并行的特点,实现针对计算和通信的极致优化
算法和工程的联合设计,追求系统性能和算法效果的最优平衡点

优先资格

加分项:

精通CUTLASS/Cute dsl开发
对Flash Attention的实现有深入的理解和开发调优经验
有Triton/Tilelang等编译框架底层优化经验
有通信/计算Overlap算子的开发经验

AI 洞察

优缺点分析

优点

  • 字节跳动平台大,Seed团队资源充足,有实际落地场景
  • 有机会接触超大规模训练系统,提升分布式计算和系统优化能力
  • 团队研究方向多样,可拓展技术视野
  • 技术要求极高,需要同时掌握硬件架构、编译、并行计算等多领域知识
  • AI硬件更新快,需要持续学习,保持技术领先

缺点 / 挑战

  • 处于AI大模型最前沿的领域,技术挑战大,积累的技能极具市场价值
  • 性能优化工作往往需要深度调试和反复实验,工作强度和压力较大
  • 适合对底层系统有强烈兴趣、喜欢攻克性能瓶颈、能适应高强度技术挑战的资深工程师

角色解读

  • 从高性能算子开发向AI基础设施架构师方向发展,负责更大规模的训练系统设计
  • 向大模型训练框架核心开发者演进,影响力覆盖公司级AI平台
  • 在Seed团队深耕AI前沿,有机会参与多模态、AI for Science等创新方向
  • 设计和实现大模型训练系统中的高性能算子,提升训练效率
  • 针对GPU等AI加速器硬件架构进行深度性能优化,包括算子级和通信级优化
  • 参与算法与工程联合设计,在系统性能和算法效果之间寻找最佳平衡
  • 与团队协作,支撑豆包等大规模应用的大模型训练
  • 精通C/C++和Python,熟练使用PyTorch进行模型开发
  • 深入理解CUDA编程模型及GPU硬件架构,能针对瓶颈进行优化
  • 熟悉Triton/TVM等编译工具,掌握算子自动生成与调优方法
  • 熟悉NCCL/RDMA等通信技术,理解分布式并行训练原理

申请策略

  • 准备能够体现性能优化思路的项目案例,量化成果
  • 关注Seed团队的学术产出和技术博客,了解团队技术方向
  • 突出C++/Python和PyTorch项目经验,展示大规模模型训练场景
  • 强调CUDA优化实例,如算子加速的具体收益(如延迟、吞吐提升)
  • 如有开源贡献或编译器/通信优化经验,重点描述
  • 展示对Flash Attention等前沿技术的理解和实践经验
  • 深入研究CUDA编程模型,练习编写高性能kernel
  • 学习Triton或TVM,掌握一种编译框架的优化技巧

面试指南

  • 对于案例类问题,采用STAR法则:背景-任务-行动-结果,用数据说明优化效果
  • 对于原理类问题,先解释核心概念,再结合自身经验谈谈应用中的难点
  • 对于系统设计问题,从多维度分析(计算、存储、通信),给出取舍方案
  • 请介绍一个你做过的高性能算子优化案例,具体优化了哪些指标?
  • 如何理解Flash Attention的原理?如果让你实现一个变体,你会怎么做?
  • 在大模型分布式训练中,如何平衡计算与通信开销?
  • CUDA中如何有效利用shared memory和寄存器?
  • 谈谈你对Triton和TVM的对比,各自适用场景是什么?

职位点评

71
综合评分

顶级大厂AI基础设施岗位,技术前沿性强,发展空间巨大,但工作强度未知,WLB缺乏保障。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和职业发展、对前沿AI基础设施有热情、能接受不确定工作节奏的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活45
使命价值72

薪资福利

70中等

薪资未在JD中明确披露,但字节跳动作为头部大厂,薪酬包通常竞争力强,福利体系完善。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

该岗位处于AI训练系统最前沿,技术深度和广度兼备,能接触大规模分布式系统,成长空间极大。

技术前沿前沿/新兴技术
技术栈C/C++、CUDA、PyTorch、Triton、NCCL、RDMA、大模型训练
业务类型ambiguous

工作生活

45较低

JD未提及工作弹性或加班情况,大型互联网公司高性能计算岗位通常工作节奏较快,工作与生活平衡存在不确定性。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

72中等

团队使命强调探索通用智能,工作成果能支撑豆包等大规模应用,对社会具有影响力,但同时也服务于商业目标。

行业发展高速增长赛道
社会影响中性/一般
使命信号为科技和社会发展作出贡献
创新程度积极采用新技术
Watch Jobs