Baidu logo
百度
分布式计算研发工程师(J92969)

分布式计算研发工程师(J92969)

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 深圳市
中级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Go
Gpu
云原生
分布式系统
虚拟化
高性能计算

AI 估算 · 30k–50k

百度作为一线大厂,该职位涉及前沿AI基础设施,技能要求高,薪资处于市场高位,加上年终奖等,月薪中位数约4万元。

职位详情

关于这个职位

该职位主要负责百度大规模AI计算集群(十万卡级GPU)的研发平台和异构计算底座设计与研发,涉及Kubernetes生态、GPU虚拟化、在离线混布等核心技术

适合有后端/基础设施开发经验、熟悉Kubernetes和分布式系统的工程师,是深度参与AI基础设施前沿技术的机会

最低要求

计算机相关专业本科及以上学历,2年以上后端/基础设施开发经验

熟悉Kubernetes原理及开发,包括调度器、Device Plugin、CRI、CNI等机制
熟练掌握Go/Python/C++中至少一门语言

工作职责

负责大规模AI计算集群(十万卡级GPU)的AI研发平台和异构计算底座设计与研发,实现算力的极致利用与全流程效率的提升

构建异构多芯计算平台,建设与优化GPU虚拟化,智能超发、在离线混布等能力,实现算力供给的 Serverless 化
基于Kubernetes生态,研发云原生AI组件,设计面向多场景(开发、训练、推理等)的异构计算平台产品与解决方案
打通AI存储、高性能网络、Sandbxo等周边生态,持续演进系统架构 ,保障大规模集群的稳定性、性能与可扩展性

优先资格

有GPU集群、HPC、AI Infra相关经验

熟悉Kubeflow、Volcano、Ray等AI编排框架
了解GPU架构(CUDA、NVLink、InfiniBand)
有大规模分布式系统设计经验
具备独立定位和解决复杂系统问题的能力,注重工程质量

AI 洞察

优缺点分析

优点

  • 百度在AI领域积累深厚,平台资源丰富,可接触前沿AI Infra技术
  • 薪资福利有竞争力,大厂背书对职业生涯发展有利
  • 团队技术氛围浓厚,与优秀同事共事,能快速提升工程能力
  • 工作强度可能较大,涉及大规模系统稳定性保障,需随时响应故障
  • 技术栈较深,需要持续学习Kubernetes、GPU、分布式系统等新知识
  • 跨团队协作频繁,沟通成本高,需要较强的协调能力

缺点 / 挑战

  • 参与业界顶尖的十万卡级GPU集群研发,技术挑战大,成长迅速
  • 适合对AI基础设施有浓厚兴趣、技术功底扎实、渴望挑战大规模系统难题的工程师

角色解读

  • 技术路线:从Kubernetes开发专家成长为AI基础设施架构师,主导超大规模集群设计
  • 管理路线:积累平台研发经验后,可晋升为技术Leader或团队经理
  • 行业前景:AI算力需求爆发,该方向人才稀缺,未来可转向云原生、HPC、自动驾驶等热门领域
  • 设计并研发大规模AI计算集群的底层平台,优化GPU资源利用率与任务调度效率
  • 基于Kubernetes构建云原生AI组件,支持开发、训练、推理等多场景
  • 打通AI存储、网络等生态,保障集群稳定性与可扩展性
  • 参与异构计算平台建设,实现算力Serverless化
  • 精通Kubernetes核心原理及二次开发,熟悉调度器、Device Plugin等机制
  • 熟练掌握Go/Python/C++中至少一门语言,具备扎实的编程能力
  • 了解分布式系统设计,有大规模集群或AI基础设施经验者优先
  • 具备独立定位和解决复杂系统问题的能力

申请策略

  • 面试前了解百度AI平台(如百舸)的产品动态,思考其技术挑战
  • 准备一个系统性故障排查的案例,展现你的工程思维
  • 突出Kubernetes相关项目经验,尤其是调度器、Device Plugin等自定义开发
  • 展示大规模分布式系统或GPU集群的优化案例,如性能提升、资源利用率改进
  • 如有AI框架(Kubeflow、Ray)或HPC经验,务必醒目呈现
  • 强调独立解决复杂问题的能力,可附上技术博客或开源贡献
  • 深入学习Kubernetes源码,尤其是调度器和设备管理插件
  • 补充GPU架构知识(CUDA、NVLink)和阿里云/百度云等云原生产品

面试指南

  • 从问题定义、背景分析、技术选型、实现细节、验证效果五步法回答
  • 突出权衡(trade-off)思考,如性能与灵活性、复杂度与维护成本
  • 结合百度实际场景(如AI训练),给出针对性方案
  • 请描述Kubernetes调度器的工作流程,如何实现自定义调度策略?
  • 如何设计一个GPU虚拟化方案,使得多个任务共享GPU且隔离?
  • 大规模集群中,如何保障网络稳定性(如InfiniBand)?
  • 遇到过最复杂的分布式系统问题是什么?如何解决?
  • 对在离线混布的理解?如何保证任务优先级和资源抢占?

职位点评

77
综合评分

百度AI Infra核心岗位,前沿技术栈,薪资优厚,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长、拥抱前沿AI基础设施挑战的求职者,愿意接受较高工作强度以换取快速职业发展。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值75

薪资福利

85较高

百度作为大厂,薪资福利处于行业领先水平,月薪中位数约4万,16薪,福利完善。但JD未明确列出具体福利,仅从公司背景判断较高。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

95较高

该职位涉及AI Infra前沿技术,如十万卡级GPU集群、Serverless、Kubernetes云原生等,技术挑战大,成长空间极高。百度内部有完善的导师制和晋升通道,但JD未明确提及。

技术前沿前沿/新兴技术
技术栈Kubernetes、GPU、AI、分布式系统、云原生、Serverless、虚拟化、高性能计算
业务类型profit_center

工作生活

40较低

工作地点在北京/深圳,需现场办公。大厂研发岗位通常强度较大,JD未提及WLB,可能包含高强度工作。但未明确要求加班。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

75中等

AI基础设施是当前高速增长赛道,助力AI产业发展,社会价值较高。百度作为行业巨头,有较强使命感,但JD未提及具体使命。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
Watch Jobs