ByteDance logo
字节跳动
大模型训练存储系统专家-Seed

大模型训练存储系统专家-Seed

发布于 大约 3 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
系统与安全工程
Go
Hdd
Megatron-Lm
Pytorch
Rdma
Ssd
分布式存储
对象存储
文件系统

AI 估算 · 50k–80k

大模型存储专家稀缺,技术门槛高,字节跳动薪资竞争力强,为中高层技术岗位

职位详情

关于这个职位

该职位负责字节跳动Seed团队大模型训练存储系统的设计与开发,涵盖文件系统、Kubernetes存储接入、多机房数据调度等核心组件

你将参与优化大规模训练任务的IO性能与成本,是支撑AI基础设施的关键角色
适合对分布式存储和机器学习系统有深入理解的技术专家

最低要求

熟练掌握Linux环境下的C++/Go/Python/Shell等1至2种以上语言

熟悉Kubernetes架构和生态,熟悉PV/CSI等云原生容器存储技术,有丰富的机器学习系统实践和开发经验
掌握分布式系统原理,参与过分布式系统的设计、开发和维护
有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分
有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动
有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档

工作职责

负责机器学习系统存储相关组件的设计和开发,服务于各方向场景(LLM/CV/Speech等)的数据加载模块和模型状态持久化,从而优化任务IO性能,提升有效训练时间

负责设计和实现面向机器学习场景的文件系统,使用内存、SSD、HDD以及云端对象存储等介质进行数据的持久化存储和管理,均衡的优化存储性能与成本
负责Kubernetes场景下各类存储系统的接入、管理、治理、监控
负责多机房、多地域、多云场景的在任务数据联合调度,优化跨区域数据传输,实现负载的合理化分布

优先资格

熟悉至少一种主流的机器学习框架(如PyTorch/Megatron-LM)

熟悉Fuse用户态文件系统,分布式缓存系统(如Alluxio),云原生存储编排系统(如Fluid)等
熟悉操作系统内核,高性能RDMA网络通信等
在计算机系统存储顶会(包括但不限于OSDI/SOSP/FAST)上有文章发表经验

AI 洞察

优缺点分析

优点

  • 深度参与大模型训练的核心基础设施,技术前沿性强
  • 团队氛围技术导向,能接触分布式系统最新技术(如RDMA、用户态文件系统)
  • 技术栈较深,需掌握存储、网络、内核等多领域知识
  • 适合对分布式系统和存储技术有浓厚兴趣,能接受高强度工作,并希望在AI基础设施领域深耕的技术专家

缺点 / 挑战

  • 字节跳动平台资源丰富,业务场景多,有大量实际挑战
  • 工作强度较高,大型训练任务对稳定性和性能要求苛刻
  • 需快速响应线上问题,运维压力较大

角色解读

  • 成为AI基础设施领域顶尖的存储系统专家,主导核心组件设计
  • 向系统架构师发展,负责整体训练平台的存储架构
  • 可转向更广泛的AI系统优化或管理层方向,如技术Leader
  • 设计和开发机器学习系统的存储组件,优化数据加载与模型持久化的IO性能,提升训练效率
  • 实现面向机器学习场景的分布式文件系统,平衡存储性能与成本
  • 在Kubernetes环境下管理存储系统的接入、监控与治理,支持多机房、多地域数据调度
  • 精通C++/Go/Python及Shell,熟悉Linux环境
  • 深入理解Kubernetes存储生态(PV/CSI),有分布式系统开发经验
  • 掌握分布式系统原理,能设计并维护大型分布式存储系统

申请策略

  • 关注字节跳动Seed团队的技术博客和开源项目,了解其技术栈
  • 面试前准备可扩展的存储架构设计案例,体现抽象和系统设计能力
  • 突出分布式存储系统的设计或优化经验,特别是参与过大规模集群的存储方案
  • 强调Kubernetes存储相关项目(如CSI驱动开发、存储编排)
  • 如有机器学习系统优化经历(如PyTorch数据加载优化),重点说明
  • 补充Fuse用户态文件系统、Alluxio、Fluid等开源项目实践
  • 学习RDMA网络编程和操作系统内核知识

面试指南

  • 先明确需求场景(如训练作业的IO模式),然后分层设计:客户端缓存、元数据服务、数据持久化层,并考虑故障恢复
  • 对于优化问题,从瓶颈分析入手(IOPS、带宽、延迟),提出针对性方案(如RDMA、本地SSD缓存等)
  • 如何设计一个面向大模型训练的高性能文件系统?
  • Kubernetes中CSI的实现原理?如何优化存储插件性能?
  • 你在分布式系统中遇到过的数据一致性问题及解决方法?
  • 如何处理多机房数据传输的延迟和带宽瓶颈?
  • 复习分布式系统经典论文(如GFS、Ceph架构),以及Kubernetes存储文档
  • 准备1-2个自己主导的存储系统优化项目,有量化效果(如IO吞吐提升X%)

职位点评

76
综合评分

大厂前沿、技术顶尖、薪资优厚,但工作强度大、WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合发展性动机强、追求技术成长的求职者,愿意为之牺牲部分生活平衡。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值85

薪资福利

80较高

字节跳动薪资水平业内领先,但该JD未明确薪资范围,也未提及具体福利,因此补偿性动机满足程度中等偏上。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

95较高

使用前沿技术(Kubernetes、分布式存储、大模型),团队技术导向强,有大量成长空间。

技术前沿前沿/新兴技术
技术栈Kubernetes、分布式存储、RDMA、Fuse、Alluxio、Fluid
业务类型profit_center

工作生活

40较低

工作地点北京,仅现场办公,未提及弹性工作或WLB,典型大厂高强度节奏,生活化动机满足度较低。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

85较高

AI大模型是高速增长赛道,字节跳动Seed团队致力于通用智能,社会影响力较大,但JD未直接提及使命愿景。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs