
百度
百度百舸_AI计算通信加速研发工程师(J77978)
百度百舸_AI计算通信加速研发工程师(J77978)
发布于 大约 4 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
本科
软件工程
Pcie
Rdma
体系结构
大模型
网络
Ai集群
计算通信加速
AI 估算 · 25k–45k
北京百度AI方向,技能稀缺,市场薪资较高,通常可达30K以上。
职位详情
关于这个职位
该职位负责百度百舸AI集群的计算通信加速研发工作,涉及需求定义、交付验证、问题定位及工具研发
需要深入理解AI集群架构、网络技术(如RDMA/PCIe)和底层系统,适合对高性能计算和AI基础设施感兴趣的技术人才
最低要求
计算机等相关专业本科及以上学历
对操作系统、体系结构、网络、大模型计算等有深入了解
熟悉AI集群内常见的服务器和网络技术,如PCIe、RDMA等
熟练掌握python、shell等语言编程
工作职责
负责百度百舸AI集群的需求定义
负责百度百舸AI集群的交付验证
负责百度百舸AI集群的问题定位
负责百度百舸AI集群的相关工具研发
AI 洞察
优缺点分析
优点
- 身处AI基础设施前沿,技术栈先进且有深度
- 百度大厂平台,业务稳定,薪资福利有竞争力
- 技术难度大,需要同时掌握多领域知识
- 行业变化快,需持续学习新技术
- 适合热爱底层技术、对高性能计算和AI基础设施有强烈好奇心,且能接受一定工作强度的工程师
缺点 / 挑战
- 积累底层系统优化经验,职业护城河较高
- AI集群问题定位复杂,可能面临较大工作压力
角色解读
- 成为AI基础设施领域的专家,主导集群架构设计
- 向系统架构师发展,负责百舸整体计算通信架构
- 也可转向AI应用优化或云原生技术方向
- 负责百度百舸AI集群的计算通信加速相关研发工作,包括需求定义、交付验证
- 进行集群问题定位,确保AI训练和推理的高效稳定运行
- 开发相关工具,提升集群运维和性能优化效率
- 深入理解操作系统、体系结构和网络协议栈
- 熟悉RDMA、PCIe等高速网络和互联技术
- 掌握Python和Shell编程,能快速开发脚本和工具
- 了解大模型分布式训练的基本原理和通信模式
申请策略
- 在申请中表达对AI基础设施的热情,可提及对百度百舸的了解
- 准备1-2个能体现系统级优化能力的技术细节案例
- 突出HPC、AI集群或网络优化相关项目经验
- 强调对RDMA、PCIe等技术的实际应用和理解
- 展示系统性能调优和问题定位的案例
- 深入学习RDMA通信库(如libfabric、UCX)的使用
- 复习计算机体系结构(缓存、NUMA、PCIe拓扑)
- 实践分布式训练框架(如PyTorch DDP、DeepSpeed)的通信配置
面试指南
- 对于技术原理类问题,先给出定义,再结合实际应用场景说明重要性
- 对于问题定位类,采用STAR法则:情境-任务-行动-结果,突出分析思路
- 对于优化类,强调数据驱动和系统性方法,不要只提直觉
- 请解释RDMA的工作原理及其在AI训练中的优势
- 如何定位AI集群中的网络瓶颈?请举例说明
- 描述一次你优化系统性能的经历,使用了哪些方法?
- PCIe Gen4/Gen5的带宽和延迟特性如何影响AI训练?
- 大模型训练中常用的通信方式有哪些(如AllReduce、AllToAll)?
职位点评
71
综合评分
百度AI集群核心研发,前沿技术栈,高薪资高成长,但工作强度大且需现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术深度和职业发展,对工作生活平衡要求较低,且对AI基础设施充满热情的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活30
使命价值70
薪资福利
80较高
百度大厂,薪资水平在行业内有竞争力,福利体系完善,但JD未明确薪资,保守评分。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
90较高
该职位接触前沿AI基础设施技术,技能成长空间大,百度内部有丰富学习资源,但JD未明确培训晋升。
技术前沿前沿/新兴技术
技术栈RDMA、PCIe、AI集群、大模型、计算通信加速
业务类型profit_center
工作生活
30较低
仅现场办公,北京工作地点可能通勤压力大,未提及弹性工作或WLB信息,推测工作强度较高。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
70中等
AI基础设施推动产业智能化,具有积极社会价值,但职位更偏技术实现,使命感不强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
百度 的其他在招职位
相似职位推荐
Watch Jobs