ByteDance logo
字节跳动
硬件加速训练AI Infra工程师-Data

硬件加速训练AI Infra工程师-Data

发布于 大约 2 个月前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
学历未注明
软件工程
Tp
分布式训练
硬件加速
算子开发
DP
GPU
Megatron-LM
NPU
PP

AI 估算 · 30k–50k

上海一线大厂AI Infra岗位,技能稀缺,薪资竞争力强,参考市场水平。

职位详情

关于这个职位

该职位负责字节跳动自研硬件(如AI芯片)的训练框架开发与优化,对接豆包等大模型训练任务

你将深入分布式并行技术(DP、SP、TP、PP),研发通信与计算融合算子,提升训练效率
适合1-5年经验、熟悉PyTorch和Megatron的AI Infra工程师,是参与前沿硬件加速与大规模分布式训练的绝佳机会

最低要求

-5年异构硬件、GPU相关领域训练开发经验,熟悉PyTorch、FSDP、Megatron-LM、VeRL分布式训练框架

对数据并行、模型并行、分布式数据并行等常见训练模式有深入理解
参与过硬件加速器训练相关研发工作,包含Torch Compiler、算子开发、编译调度优化等
有主动学习、快速解决问题的能力和自我驱动力

工作职责

负责自研硬件训练框架开发(Torch、Megatron、Dtensor等)

对接业务大模型例如豆包、Seedance等模型在自研硬件上训练任务支持
开发DP、SP、TP、PP等分布式并行方式并且优化
训练业务通信、计算、通算融合算子研发以及性能优化

优先资格

有大模型训练百、千卡以上集群训练落地经验

有异构硬件、NPU等训练、推理开发经验,对硬件比较了解
熟悉计算机体系结构和并行计算
有GPU、FPGA或AI芯片相关的开发和评测经验

AI 洞察

优缺点分析

优点

  • 参与自研硬件训练框架从0到1的建设,技术含金量高,积累稀缺经验
  • 字节跳动平台资源丰富,接触百亿级大模型训练场景,视野开阔
  • 团队技术氛围浓厚,与顶尖工程师合作,快速提升分布式系统能力
  • 自研硬件生态尚不成熟,需要大量从底层调试和适配,工作强度较大
  • 技术更新快,需持续学习新硬件特性和并行策略,保持竞争力
  • 大规模集群训练问题复杂,排错和优化需要极强的耐心和系统思维
  • 适合对AI基础设施和硬件加速有浓厚兴趣、喜欢底层系统优化、抗压能力强且希望在技术前沿深耕的工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 技术深度路径:从框架开发到芯片-算法联合优化,成为AI Infra领域的专家
  • 管理路径:未来可带领团队负责更大规模训练集群的架构设计
  • 跨领域机会:接触前沿硬件架构,可转向硬件设计或系统架构方向
  • 开发和优化自研硬件的训练框架,基于PyTorch、Megatron等主流框架进行二次开发
  • 为豆包等大模型在自研芯片上的训练提供技术支持,解决分布式训练中的通信和计算瓶颈
  • 设计和实现DP、TP、PP等多种并行策略,并研发融合算子以提升训练性能
  • 参与从算子到编译调度全栈优化,确保训练任务高效稳定运行
  • 扎实的分布式训练基础,熟悉PyTorch、FSDP、Megatron-LM等框架
  • 深入理解数据并行、模型并行等分布式范式,有实际调优经验
  • 具备硬件加速器训练经验,如Torch Compiler、算子开发、编译优化
  • 强烈的自驱力和快速解决问题的能力,能独立应对复杂技术挑战

申请策略

  • 在简历中强调对自研硬件的热情和快速学习能力,可附上相关技术博客或开源贡献
  • 关注字节跳动Data团队的招聘动态,了解团队在AI Infra领域的最新成果,面试中展示对业务的理解
  • 突出分布式训练框架的使用和修改经验,尤其是Megatron或PyTorch相关项目
  • 展示在GPU/NPU等硬件上的性能优化成果,如算子调优、通信压缩等
  • 强调参与大规模多卡训练(百卡以上)的经历,量化加速比或资源节省
  • 如有Torch Compiler或自定义算子开发经历,务必详细描述
  • 提前复习计算机体系结构,特别是并行计算和存储层次
  • 动手复现一个简单的分布式训练任务(如使用PyTorch FSDP),理解底层原理

面试指南

  • 原理+实践:先解释核心概念和机制,再结合项目经验说明具体实现和优化
  • 问题-分析-方案:遇到瓶颈时,从现象出发,逐步分析根因,提出解决方案并评估效果
  • 对比+权衡:比较不同并行策略的优劣,根据业务场景选择合适的方案
  • 请解释PyTorch的DistributedDataParallel(DDP)和FullyShardedDataParallel(FSDP)在通信上的区别
  • 如何在多层次并行(TP+PP+DP)下设计高效的通信拓扑?结合Megatron框架说明
  • 描述一次你优化训练性能的经历,遇到了哪些计算或通信瓶颈?如何解决的?
  • 对于自研硬件,Torch Compiler需要做哪些适配?请举例说明
  • 在大规模集群训练中,如何诊断和解决通信瓶颈(如AllReduce耗时过长)?

职位点评

70
综合评分

字节AI Infra岗位,技术前沿、成长空间大,但WLB一般且薪资未明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合高发展动机、愿意在技术前沿高强度投入的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值75

薪资福利

70中等

薪资未明确,但字节跳动薪资竞争力强,福利完善,但未在JD中具体说明,需面试确认。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

岗位聚焦前沿AI硬件加速,技术深度强,能接触最新分布式训练技术,成长空间大。

技术前沿前沿/新兴技术
技术栈PyTorch、Megatron、Torch Compiler、分布式并行、算子开发、自研硬件
业务类型ambiguous

工作生活

40较低

仅现场办公,未提及弹性工作或WLB信息,大厂高性能计算岗位通常工作强度较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

AI Infra属于高速增长赛道,推动大模型技术落地,有一定技术使命感,但社会影响力中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs