VMware logo
威睿
Principal (or Staff) Solution Architect

Principal (or Staff) Solution Architect

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
信息技术与基础设施
Ai Infrastructure
Ai Models
Broadcom
Communication Library
Deepep
Gpu Architecture
Rdma Nic
Shmem

AI 估算 · 60k–100k

高级架构师岗位,AI基础设施方向热门,跨国大厂,上海薪资水平高,但未明确披露薪资,参考市场水准估算。

职位详情

关于这个职位

作为高级解决方案架构师,你将与中国数据中心客户、XPU供应商、AI模型公司和OEM厂商深度合作,基于Broadcom的芯片、固件、SDK等资产,定义并验证面向AI基础设施的解决方案架构

该职位需要扎实的RDMA网络和GPU架构知识,以及独立推动原型开发的技术能力,是连接客户需求与Broadcom技术优势的关键角色

最低要求

教育 - 硕士学历

博士优先
年以上RDMA NIC软件开发、解决方案架构师、芯片架构师或系统架构师相关工作经验
熟悉主流GPU架构、内存模型、NoC和Scale-up者优先
熟悉主流AI基础设施软件栈,包括通信库、SHMEM和DeepEP,以及主流AI模型者优先
具有AI集群网络或类似领域的架构设计、协议设计、实现和调试经验者优先
卓越的分析能力,能够将客户需求、Broadcom产品组合和生态伙伴产品组合“连接起来”
能够独立推动技术解决方案调研、架构设计和原型开发
优秀的组织和沟通能力
流利的英语口头和书面沟通能力
探索新技术的强大动力和热情
积极主动,自我驱动,能够独立工作

工作职责

与中国数据中心客户、XPU供应商、AI模型公司和OEM厂商一起推动解决方案架构活动

在Broadcom现有资产(芯片、固件、微码、SDK/驱动和应用程序软件)上进行深度技术工作,定义解决方案架构
与Broadcom客户紧密合作,定义解决方案架构,并亲手进行原型开发,以验证这些架构的关键方面,证明Broadcom的技术优势
与Broadcom客户和业界紧密合作,进行需求识别、架构定义和讨论,为新的Broadcom资产提供支持
与Broadcom内部跨职能团队密切协作

优先资格

熟悉主流GPU架构、内存模型、NoC和Scale-up者优先

熟悉主流AI基础设施软件栈,包括通信库、SHMEM和DeepEP,以及主流AI模型者优先
具有AI集群网络或类似领域的架构设计、协议设计、实现和调试经验者优先

AI 洞察

优缺点分析

优点

  • 接触AI基础设施最前沿的技术,如RDMA、GPU集群和AI通信优化
  • 与头部客户和生态伙伴(如GPU厂商、AI公司)深度合作,积累高端人脉
  • Broadcom作为半导体巨头,平台资源丰富,稳定性和薪资竞争力强
  • 技术深度要求极高,需要同时理解硬件(芯片、固件)和软件栈(驱动、通信库)
  • 跨国协作频繁,对英语沟通能力要求高
  • 适合有5年以上RDMA、GPU或AI Infra相关经验,热爱底层系统架构,愿意深入客户场景并独立解决技术难题的高级工程师

缺点 / 挑战

  • 需要独立驱动技术方案调研和原型开发,工作自主性强但压力较大

角色解读

  • 技术路线:成为Broadcam AI Infra领域的首席架构师或技术专家
  • 管理路线:转向技术团队管理或产品管理岗位
  • 行业路线:积累AI基础设施经验后,可拓展至数据中心系统级架构师
  • 与数据中心客户和生态伙伴合作,定义基于Broadcom芯片和软件的AI基础设施解决方案架构
  • 亲手参与原型开发,验证架构可行性并展示Broadcom的技术优势
  • 收集客户需求,参与下一代Broadcom产品的架构定义和讨论
  • 深入掌握RDMA网络和GPU架构,包括内存模型、NoC和Scale-up技术
  • 熟悉AI基础设施软件栈,如通信库、SHMEM、DeepEP等
  • 具备系统架构设计、协议设计和原型开发能力
  • 出色的分析和沟通能力,能够将客户需求转化为技术方案,并流利使用英语交流

申请策略

  • 提前了解Broadcom在AI Infra领域的战略,面试中展示与公司方向一致的技术兴趣
  • 准备英文技术案例,能够清晰描述架构设计思路和解决的关键问题
  • 突出RDMA NIC开发或AI集群网络架构设计的项目经验,量化成果(如带宽提升、延迟降低)
  • 强调GPU架构和AI通信库(如NCCL、SHMEM)的实际使用经验
  • 展示独立进行技术原型开发和问题排查的能力,可附GitHub或技术博客
  • 深入学习Broadcom的Tomahawk/Jericho系列芯片及SDK,了解其产品在AI网络中的定位
  • 熟悉最新的AI模型训练通信模式,如全Reduce、All-to-All等优化技巧

面试指南

  • 技术类问题:先阐述基本原理,再结合实际项目经验,最后提出优化建议
  • 项目类问题:使用STAR法则(情境、任务、行动、结果),突出个人贡献和量化效果
  • 请描述RDMA over Converged Ethernet (RoCE) 的基本原理和优缺点
  • 如何设计一个大规模GPU集群的互联网络?请从架构和通信库角度说明
  • 讲述一个你独立推动技术方案从调研到落地的项目,遇到了哪些挑战?
  • Broadcom的芯片在AI集群中扮演什么角色?与竞争对手相比的优势是什么?
  • 如何优化分布式训练中的通信瓶颈?请举例说明
  • 复习RDMA(IB/RoCE)协议、GPU Direct技术、NCCL/RCCL等通信库原理

职位点评

78
综合评分

技术前沿、薪资优厚、成长性高,但现场办公且WLB未明确

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合高度重视前沿技术成长和职业发展的求职者,愿意接受现场办公和可能的高强度工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活60
使命价值85

薪资福利

80较高

薪资未明确披露,但Broadcom作为跨国大厂,薪酬通常具有竞争力;福利未在JD中提及,无额外信号。

薪资信号未披露(AI估算:60K-100K/月)

成长发展

85较高

技术栈前沿(AI Infra、RDMA、GPU),能深入参与架构设计,与顶尖客户合作,成长空间大。但JD未提及内部培训或晋升路径。

技术前沿前沿/新兴技术
技术栈RDMA、GPU、AI Infrastructure、SHMEM、DeepEP
业务类型profit_center

工作生活

60中等

工作地点在张江科技园,要求现场办公,未提及弹性工时或远程,WLB信号缺乏,可能需要一定强度。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

85较高

AI基础设施行业高速增长,岗位涉及前沿技术探索,社会影响中性但技术推动力强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs