ZTE logo
中兴通讯
高速网卡架构专家

高速网卡架构专家

发布于 大约 3 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
硬件工程
Ai集群
Dpu
Nccl
Pcie
Rdma
Rocev2
拥塞控制
网络协议
400G/800G网卡

AI 估算 · 50k–80k

资深专家级岗位,技术门槛高,稀缺性强,上海薪资水平高,综合估算月薪5-8万。

职位详情

关于这个职位

负责中兴通讯的400G/800G高速网卡整体架构设计,专注于RDMA引擎、PCIe接口等核心模块,并深度优化GPU与网卡交互,实现跨机高效通信

主导NCCL卸载和拥塞控制策略,提升AI集群通信效率和智算推理竞争力
该岗位技术前沿,适合网络与硬件领域资深专家

最低要求

硕士研究生8年以上工作经验,本科10年以上工作经验

精通200G/400G以太网RoCEv2/IB协议栈
有实际GPUDirect RDMA开发与调优经验,熟悉NVIDIA Magnum IO或AMD ROCm
深入理解NCCL源码或内部实现原理,有NCCL plugin或集合通信硬件卸载经验
熟悉PCIe协议(TLP/Ordering/SR-IOV)及网卡内部DMA/缓存流水线
理解PFC、ECN、DCQCN等流控机制,有大规模数据中心RDMA部署经验

工作职责

负责400G/800G网卡的整体软硬件架构设计,定义RDMA引擎、PCIe接口等关键模块

深度优化现有网卡与GPU之间的交互流程,实现跨机GPU间的高效网络通信
主导NCCL集合通信库在自研网卡上的硬件卸载与加速,提升AI集群通信效率
针对互联网典型场景(推荐/存储/微服务)设计RDMA传输策略与拥塞控制方案
负责设计及实施GPU、网卡与存储之间的高效协同方案,提升智算推理解决方案的竞争力
具备跨层协同分析能力,能够从应用层(CCL/PyTorch)到网卡硬件(PCIe/RDMA引擎)再到交换机(PFC/ECN)全链路定位性能瓶颈

优先资格

有AI大模型公司或DPU厂商工作经验

参与过万卡级以上集群网络设计
熟悉UEC标准或NVLink/NVSwitch架构

AI 洞察

优缺点分析

优点

  • 技术前沿,覆盖AI大模型和智算中心核心基础设施,行业前景广阔
  • 中兴通讯平台大,资源多,有机会接触大规模集群实际部署场景
  • 岗位稀缺性强,技术壁垒高,长期职业竞争力强
  • 涉及多领域知识(网络、硬件、软件、AI),学习曲线陡峭
  • 技术迭代快,需持续跟进新标准(如UEC、NVLink)

缺点 / 挑战

  • 要求跨层调试能力,问题定位可能非常复杂,工作压力较大
  • 适合具备深厚RDMA和网络架构经验、热爱技术挑战、希望在AI基础设施领域深耕的资深工程师

角色解读

  • 成为网络硬件领域的架构专家,主导未来1.6T/3.2T网卡设计
  • 向AI基础设施方向延伸,发展为智算中心网络总架构师
  • 可能转向技术管理,带领团队负责数据中心网络整体解决方案
  • 设计高速网卡整体架构,定义RDMA引擎、PCIe接口等关键模块,确保软硬件协同
  • 优化GPU与网卡交互,实现跨机GPU高效通信,重点支持AI训练和推理场景
  • 主导NCCL硬件卸载,提升集合通信效率,并针对互联网场景设计RDMA策略
  • 从应用层到交换机全链路分析性能瓶颈,解决大规模数据中心网络问题
  • 精通200G/400G以太网RoCEv2/IB协议栈,理解RDMA原理和实现
  • 具备GPUDirect RDMA开发调优经验,熟悉NVIDIA Magnum IO或AMD ROCm
  • 深入理解NCCL源码,有集合通信硬件卸载或plugin开发经验
  • 熟悉PCIe协议、网卡DMA/缓存流水线,理解PFC/ECN/DCQCN等流控机制

申请策略

  • 面试时准备具体案例,展示从应用层到硬件链路的问题定位思路
  • 关注中兴通讯在智算和DPU方向的业务布局,在面试中体现契合度
  • 突出GPUDirect RDMA实际项目经验,写明性能优化成果
  • 详细描述NCCL相关开发或卸载经验,展示对源码的理解
  • 强调PCIe协议、拥塞控制等底层技术细节的掌握程度
  • 如参与过大规模集群(万卡级)网络设计,务必重点标注
  • 深入研究NVIDIA Magnum IO和ROCm等GPU通信库
  • 学习UEC标准、NVLink/NVSwitch架构,了解前沿发展

面试指南

  • 先明确问题边界,再分层拆解:应用层、协议层、硬件层、网络层
  • 结合具体项目经验,用STAR法则突出行动和结果
  • 展示跨层思维,强调从整体系统角度优化性能
  • 如何设计一个400G网卡的RDMA引擎?请描述关键模块和数据流
  • NCCL集合通信在硬件卸载时,你如何处理多层级缓存一致性?
  • 在万卡级集群中,RoCEv2部署遇到PFC风暴怎么解决?
  • 解释GPUDirect RDMA的零拷贝原理,并说明调优要点
  • 如果发现GPU通信瓶颈在上层CCL库,你会如何定位和优化?

职位点评

68
综合评分

核心技术前沿、成长空间大,但工作强度未明确,Lifestyle满足有限。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术深度和前沿发展、对AI基础设施有热情的求职者,愿意投入高强度工作以换取长期成长。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活45
使命价值60

薪资福利

70中等

薪资水平较高,中兴作为上市巨头提供稳定福利,但具体薪资未披露,薪酬竞争力可能不如互联网头部。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

85较高

岗位技术前沿,涉及400G/800G网卡、NCCL卸载等核心领域,成长空间大,但公司内部晋升路径未明确。

技术前沿前沿/新兴技术
技术栈RDMA、NCCL、PCIe、GPUDirect、RoCEv2、PFC、ECN
业务类型profit_center

工作生活

45较低

未提及远程或弹性工作,上海办公,但未明确加班情况。预计现场办公,生活化满足程度一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

AI基础设施领域属于高速增长赛道,但岗位偏向技术实现,社会价值中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs