
字节跳动
AI Infra平台研发工程师(大模型开发机方向)-Seed
AI Infra平台研发工程师(大模型开发机方向)-Seed
发布于 大约 3 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
本科
平台工程
Ai Infra
Go
Gpu调度
Mlops
云原生
分布式系统
后端开发
资源编排
AI 估算 · 25k–50k
AI Infra稀缺技能,大厂高薪,北京水平高。
职位详情
关于这个职位
该职位负责字节跳动大模型开发机平台的后端研发,涉及Kubernetes资源调度、GPU管理等前沿技术
你将参与建设支撑豆包等顶尖大模型应用的内部平台,与算法、基础架构团队紧密合作
适合对云原生和AI基础设施有深厚兴趣、渴望在AI浪潮中发挥技术价值的工程师
最低要求
本科及以上学历,计算机、软件工程或相关专业优先
具备扎实的软件工程能力与架构基础:
)熟悉至少一种主流后端开发语言,如Go、Java、Python、C++等,有较强的系统设计和代码实现能力
)理解分布式系统、高可用设计、服务治理、异步任务、缓存、消息队列、数据库设计等常见后端架构模式
熟悉应用开发和平台开发,有复杂业务系统、基础平台、研发平台、云平台或机器学习平台建设经验
熟悉容器化和Kubernetes生态,理解Pod、Deployment、StatefulSet、CRD、Operator、Scheduler、Volume、Network政策等核心机制
理解资源编排与调度相关技术,有CPU/GPU调度、队列、配额、多租户隔离、弹性伸缩、资源回收等经验者优先
具备良好的问题分析、故障排查与跨团队协作能力:能独立定位复杂线上问题
能够和算法、平台、SRE、基础设施团队高效配合
工作职责
负责大模型平台开发机的后端系统设计与研发,包括开发机生命周期管理、用户权限与资源隔离等能力
设计和优化基于Kubernetes的资源编排与调度体系,支持CPU/GPU、共享存储、网络、镜像等复杂资源管理场景
建设面向算法研发的云端开发体验,包括VS Code Server、SSH、Web IDE、任务环境复用、镜像管理、数据挂载等能力
负责平台架构设计,提升系统的稳定性、可扩展性、可观测性和运维效率
与算法、训练平台、基础架构、运维等团队协作,持续提升大模型研发效率和资源利用率
参与平台工程化建设,包括服务治理、监控告警、日志链路、故障诊断、灰度发布、容量规划和成本优化,跟进云原生、AI Infra、GPU调度、分布式训练、AI Agent等方向的技术演进,并推动在平台中的落地
优先资格
有机器学习平台、训练平台、开发机平台、AI Infra、MLOps平台建设经验
熟悉Kubeflow、JupyterHub、Ray、Volcano、Kueue、Argo Workflows、KServe、MLflow等相关技术
有GPU集群、异构资源调度、分布式训练、模型开发环境建设经验
熟悉Linux、容器运行时、网络、存储、镜像构建、远程开发协议等底层技术
有云厂商、AI平台或基础架构团队经验
对研发效率、平台产品体验、稳定性和成本优化有深入理解
了解AI Agent 相关技术,有Agent IDE、AI Coding、自动化研发助手、数据/训练Agent等产品或平台建设经验者优先
AI 洞察
优缺点分析
优点
- 参与顶尖AI大模型平台建设,技术栈前沿,涵盖云原生、GPU调度、分布式训练等
- 团队氛围强调创新和长期愿景,个人成长空间广阔
- 技术深度要求高,需要不断学习新知识,保持竞争力
- 公司内部竞争激烈,需要持续产出高质量成果
缺点 / 挑战
- 公司平台大,资源丰富,可接触豆包等亿万级应用场景,技术挑战和影响力兼备
- 工作强度可能较高,需要应对复杂系统问题和高并发场景
- 适合对AI基础设施有热情、喜欢技术挑战、抗压能力强且渴望在AI浪潮中快速成长的工程师
角色解读
- 可向AI Infra架构师或技术专家方向发展,深入云原生与GPU调度领域
- 有机会转向机器学习平台、训练平台的核心研发,成为AI基础设施领域的领军人才
- 未来可晋升为技术团队负责人或基础架构负责人,带领团队建设更大规模平台
- 负责大模型开发机平台的后端系统设计,包括生命周期管理、权限隔离等核心功能
- 优化基于Kubernetes的资源编排与调度体系,支持CPU/GPU、存储、网络等复杂资源管理
- 建设云端开发环境,如VS Code Server、SSH、Web IDE等,提升算法研发效率
- 参与平台架构设计,保证稳定性、可扩展性和可观测性
- 熟练掌握至少一种主流后端语言(Go/Java/Python等),具备扎实的系统设计能力
- 深入理解Kubernetes生态,熟悉Pod、CRD、Operator、Scheduler等核心机制
- 具备分布式系统、高可用架构、缓存、消息队列、数据库设计等后端架构经验
- 了解GPU调度、资源隔离、弹性伸缩等资源编排技术
申请策略
- 在简历中展示对AI Infra领域的独特见解,可提及对字节跳动Seed团队的了解
- 准备一个完整的平台项目案例,从需求分析到架构设计再到落地效果
- 突出Kubernetes和容器化项目经验,特别是Operator、调度器相关开发
- 强调分布式系统或平台开发经历,展示系统架构设计能力
- 如有GPU集群、资源调度、MLOps平台经验,务必重点描述
- 体现与算法、基础设施团队协作的跨团队沟通能力
- 深入学习Kubernetes operator开发模式和自定义控制器实现
- 了解GPU虚拟化技术(如MIG、vGPU)和主流调度框架(如Volcano、Kueue)
面试指南
- 使用STAR法则:情境、任务、行动、结果,结构化地展示项目经验
- 对于设计类问题,先明确需求,再提出架构,强调可扩展性和容错性
- 结合具体技术细节,深入原理,体现技术深度
- 如何设计一个支持多租户的开发机平台,保证资源隔离和高效调度?
- Kubernetes调度器如何实现GPU资源分配?请谈谈你的理解
- 如何保证平台的高可用和可扩展性?
- 请详细讲解你过去负责的一个平台系统,从设计到部署
- 如何排查线上故障,比如Pod无法启动或资源不足?
职位点评
67
综合评分
字节跳动AI Infra平台,技术前沿、薪资优厚,但工作强度大且WLB不明。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术前沿、渴望在AI基础设施领域深入发展的求职者,愿意接受高强度工作以换取快速成长。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活50
使命价值75
薪资福利
60中等
字节跳动薪资竞争力强,但具体数字未在JD中明确,福利也未提及,薪酬吸引力更多依赖公司品牌。
薪资信号未披露(AI估算:25K-50K/月)
成长发展
85较高
AI Infra领域技术前沿,平台规模大,能深入云原生、GPU调度等核心技术,成长机会显著。
技术前沿前沿/新兴技术
技术栈Kubernetes、GPU、云原生、分布式训练、资源调度
业务类型cost_center
工作生活
50较低
未提及远程或弹性办公,需现场工作,加班情况不明确,可能面临较高工作强度。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
AI大模型行业高速增长,岗位支撑的核心技术对社会有较大影响,使命感较强。
行业发展高速增长赛道
社会影响中性/一般
使命信号为科技和社会发展作出贡献
创新程度积极采用新技术
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs