
威睿
Principal (or Staff) Solution Architect
Principal (or Staff) Solution Architect
发布于 大约 14 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
硕士
信息技术与基础设施
Ai Infrastructure
Ai Models
Broadcom
Communication Library
Deepep
Gpu Architecture
Rdma Nic
Shmem
AI 估算 · 60k–100k
高级架构师岗位,AI基础设施方向热门,跨国大厂,上海薪资水平高,但未明确披露薪资,参考市场水准估算。
职位详情
关于这个职位
作为高级解决方案架构师,你将与中国数据中心客户、XPU供应商、AI模型公司和OEM厂商深度合作,基于Broadcom的芯片、固件、SDK等资产,定义并验证面向AI基础设施的解决方案架构
该职位需要扎实的RDMA网络和GPU架构知识,以及独立推动原型开发的技术能力,是连接客户需求与Broadcom技术优势的关键角色
最低要求
教育 - 硕士学历
博士优先
年以上RDMA NIC软件开发、解决方案架构师、芯片架构师或系统架构师相关工作经验
熟悉主流GPU架构、内存模型、NoC和Scale-up者优先
熟悉主流AI基础设施软件栈,包括通信库、SHMEM和DeepEP,以及主流AI模型者优先
具有AI集群网络或类似领域的架构设计、协议设计、实现和调试经验者优先
卓越的分析能力,能够将客户需求、Broadcom产品组合和生态伙伴产品组合“连接起来”
能够独立推动技术解决方案调研、架构设计和原型开发
优秀的组织和沟通能力
流利的英语口头和书面沟通能力
探索新技术的强大动力和热情
积极主动,自我驱动,能够独立工作
工作职责
与中国数据中心客户、XPU供应商、AI模型公司和OEM厂商一起推动解决方案架构活动
在Broadcom现有资产(芯片、固件、微码、SDK/驱动和应用程序软件)上进行深度技术工作,定义解决方案架构
与Broadcom客户紧密合作,定义解决方案架构,并亲手进行原型开发,以验证这些架构的关键方面,证明Broadcom的技术优势
与Broadcom客户和业界紧密合作,进行需求识别、架构定义和讨论,为新的Broadcom资产提供支持
与Broadcom内部跨职能团队密切协作
优先资格
熟悉主流GPU架构、内存模型、NoC和Scale-up者优先
熟悉主流AI基础设施软件栈,包括通信库、SHMEM和DeepEP,以及主流AI模型者优先
具有AI集群网络或类似领域的架构设计、协议设计、实现和调试经验者优先
AI 洞察
优缺点分析
优点
- 接触AI基础设施最前沿的技术,如RDMA、GPU集群和AI通信优化
- 与头部客户和生态伙伴(如GPU厂商、AI公司)深度合作,积累高端人脉
- Broadcom作为半导体巨头,平台资源丰富,稳定性和薪资竞争力强
- 技术深度要求极高,需要同时理解硬件(芯片、固件)和软件栈(驱动、通信库)
- 跨国协作频繁,对英语沟通能力要求高
- 适合有5年以上RDMA、GPU或AI Infra相关经验,热爱底层系统架构,愿意深入客户场景并独立解决技术难题的高级工程师
缺点 / 挑战
- 需要独立驱动技术方案调研和原型开发,工作自主性强但压力较大
角色解读
- 技术路线:成为Broadcam AI Infra领域的首席架构师或技术专家
- 管理路线:转向技术团队管理或产品管理岗位
- 行业路线:积累AI基础设施经验后,可拓展至数据中心系统级架构师
- 与数据中心客户和生态伙伴合作,定义基于Broadcom芯片和软件的AI基础设施解决方案架构
- 亲手参与原型开发,验证架构可行性并展示Broadcom的技术优势
- 收集客户需求,参与下一代Broadcom产品的架构定义和讨论
- 深入掌握RDMA网络和GPU架构,包括内存模型、NoC和Scale-up技术
- 熟悉AI基础设施软件栈,如通信库、SHMEM、DeepEP等
- 具备系统架构设计、协议设计和原型开发能力
- 出色的分析和沟通能力,能够将客户需求转化为技术方案,并流利使用英语交流
申请策略
- 提前了解Broadcom在AI Infra领域的战略,面试中展示与公司方向一致的技术兴趣
- 准备英文技术案例,能够清晰描述架构设计思路和解决的关键问题
- 突出RDMA NIC开发或AI集群网络架构设计的项目经验,量化成果(如带宽提升、延迟降低)
- 强调GPU架构和AI通信库(如NCCL、SHMEM)的实际使用经验
- 展示独立进行技术原型开发和问题排查的能力,可附GitHub或技术博客
- 深入学习Broadcom的Tomahawk/Jericho系列芯片及SDK,了解其产品在AI网络中的定位
- 熟悉最新的AI模型训练通信模式,如全Reduce、All-to-All等优化技巧
面试指南
- 技术类问题:先阐述基本原理,再结合实际项目经验,最后提出优化建议
- 项目类问题:使用STAR法则(情境、任务、行动、结果),突出个人贡献和量化效果
- 请描述RDMA over Converged Ethernet (RoCE) 的基本原理和优缺点
- 如何设计一个大规模GPU集群的互联网络?请从架构和通信库角度说明
- 讲述一个你独立推动技术方案从调研到落地的项目,遇到了哪些挑战?
- Broadcom的芯片在AI集群中扮演什么角色?与竞争对手相比的优势是什么?
- 如何优化分布式训练中的通信瓶颈?请举例说明
- 复习RDMA(IB/RoCE)协议、GPU Direct技术、NCCL/RCCL等通信库原理
职位点评
78
综合评分
技术前沿、薪资优厚、成长性高,但现场办公且WLB未明确
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合高度重视前沿技术成长和职业发展的求职者,愿意接受现场办公和可能的高强度工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活60
使命价值85
薪资福利
80较高
薪资未明确披露,但Broadcom作为跨国大厂,薪酬通常具有竞争力;福利未在JD中提及,无额外信号。
薪资信号未披露(AI估算:60K-100K/月)
成长发展
85较高
技术栈前沿(AI Infra、RDMA、GPU),能深入参与架构设计,与顶尖客户合作,成长空间大。但JD未提及内部培训或晋升路径。
技术前沿前沿/新兴技术
技术栈RDMA、GPU、AI Infrastructure、SHMEM、DeepEP
业务类型profit_center
工作生活
60中等
工作地点在张江科技园,要求现场办公,未提及弹性工时或远程,WLB信号缺乏,可能需要一定强度。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
85较高
AI基础设施行业高速增长,岗位涉及前沿技术探索,社会影响中性但技术推动力强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs