
百度
分布式计算研发工程师(J92969)
分布式计算研发工程师(J92969)
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 深圳市
中级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Go
Gpu
云原生
分布式系统
虚拟化
高性能计算
AI 估算 · 30k–50k
百度作为一线大厂,该职位涉及前沿AI基础设施,技能要求高,薪资处于市场高位,加上年终奖等,月薪中位数约4万元。
职位详情
关于这个职位
该职位主要负责百度大规模AI计算集群(十万卡级GPU)的研发平台和异构计算底座设计与研发,涉及Kubernetes生态、GPU虚拟化、在离线混布等核心技术
适合有后端/基础设施开发经验、熟悉Kubernetes和分布式系统的工程师,是深度参与AI基础设施前沿技术的机会
最低要求
计算机相关专业本科及以上学历,2年以上后端/基础设施开发经验
熟悉Kubernetes原理及开发,包括调度器、Device Plugin、CRI、CNI等机制
熟练掌握Go/Python/C++中至少一门语言
工作职责
负责大规模AI计算集群(十万卡级GPU)的AI研发平台和异构计算底座设计与研发,实现算力的极致利用与全流程效率的提升
构建异构多芯计算平台,建设与优化GPU虚拟化,智能超发、在离线混布等能力,实现算力供给的 Serverless 化
基于Kubernetes生态,研发云原生AI组件,设计面向多场景(开发、训练、推理等)的异构计算平台产品与解决方案
打通AI存储、高性能网络、Sandbxo等周边生态,持续演进系统架构 ,保障大规模集群的稳定性、性能与可扩展性
优先资格
有GPU集群、HPC、AI Infra相关经验
熟悉Kubeflow、Volcano、Ray等AI编排框架
了解GPU架构(CUDA、NVLink、InfiniBand)
有大规模分布式系统设计经验
具备独立定位和解决复杂系统问题的能力,注重工程质量
AI 洞察
优缺点分析
优点
- 百度在AI领域积累深厚,平台资源丰富,可接触前沿AI Infra技术
- 薪资福利有竞争力,大厂背书对职业生涯发展有利
- 团队技术氛围浓厚,与优秀同事共事,能快速提升工程能力
- 工作强度可能较大,涉及大规模系统稳定性保障,需随时响应故障
- 技术栈较深,需要持续学习Kubernetes、GPU、分布式系统等新知识
- 跨团队协作频繁,沟通成本高,需要较强的协调能力
缺点 / 挑战
- 参与业界顶尖的十万卡级GPU集群研发,技术挑战大,成长迅速
- 适合对AI基础设施有浓厚兴趣、技术功底扎实、渴望挑战大规模系统难题的工程师
角色解读
- 技术路线:从Kubernetes开发专家成长为AI基础设施架构师,主导超大规模集群设计
- 管理路线:积累平台研发经验后,可晋升为技术Leader或团队经理
- 行业前景:AI算力需求爆发,该方向人才稀缺,未来可转向云原生、HPC、自动驾驶等热门领域
- 设计并研发大规模AI计算集群的底层平台,优化GPU资源利用率与任务调度效率
- 基于Kubernetes构建云原生AI组件,支持开发、训练、推理等多场景
- 打通AI存储、网络等生态,保障集群稳定性与可扩展性
- 参与异构计算平台建设,实现算力Serverless化
- 精通Kubernetes核心原理及二次开发,熟悉调度器、Device Plugin等机制
- 熟练掌握Go/Python/C++中至少一门语言,具备扎实的编程能力
- 了解分布式系统设计,有大规模集群或AI基础设施经验者优先
- 具备独立定位和解决复杂系统问题的能力
申请策略
- 面试前了解百度AI平台(如百舸)的产品动态,思考其技术挑战
- 准备一个系统性故障排查的案例,展现你的工程思维
- 突出Kubernetes相关项目经验,尤其是调度器、Device Plugin等自定义开发
- 展示大规模分布式系统或GPU集群的优化案例,如性能提升、资源利用率改进
- 如有AI框架(Kubeflow、Ray)或HPC经验,务必醒目呈现
- 强调独立解决复杂问题的能力,可附上技术博客或开源贡献
- 深入学习Kubernetes源码,尤其是调度器和设备管理插件
- 补充GPU架构知识(CUDA、NVLink)和阿里云/百度云等云原生产品
面试指南
- 从问题定义、背景分析、技术选型、实现细节、验证效果五步法回答
- 突出权衡(trade-off)思考,如性能与灵活性、复杂度与维护成本
- 结合百度实际场景(如AI训练),给出针对性方案
- 请描述Kubernetes调度器的工作流程,如何实现自定义调度策略?
- 如何设计一个GPU虚拟化方案,使得多个任务共享GPU且隔离?
- 大规模集群中,如何保障网络稳定性(如InfiniBand)?
- 遇到过最复杂的分布式系统问题是什么?如何解决?
- 对在离线混布的理解?如何保证任务优先级和资源抢占?
职位点评
77
综合评分
百度AI Infra核心岗位,前沿技术栈,薪资优厚,但工作强度可能较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长、拥抱前沿AI基础设施挑战的求职者,愿意接受较高工作强度以换取快速职业发展。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值75
薪资福利
85较高
百度作为大厂,薪资福利处于行业领先水平,月薪中位数约4万,16薪,福利完善。但JD未明确列出具体福利,仅从公司背景判断较高。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
95较高
该职位涉及AI Infra前沿技术,如十万卡级GPU集群、Serverless、Kubernetes云原生等,技术挑战大,成长空间极高。百度内部有完善的导师制和晋升通道,但JD未明确提及。
技术前沿前沿/新兴技术
技术栈Kubernetes、GPU、AI、分布式系统、云原生、Serverless、虚拟化、高性能计算
业务类型profit_center
工作生活
40较低
工作地点在北京/深圳,需现场办公。大厂研发岗位通常强度较大,JD未提及WLB,可能包含高强度工作。但未明确要求加班。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
75中等
AI基础设施是当前高速增长赛道,助力AI产业发展,社会价值较高。百度作为行业巨头,有较强使命感,但JD未提及具体使命。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
百度 的其他在招职位
相似职位推荐
Watch Jobs