IBM logo
国际商业机器公司
AI Data Center Architect

AI Data Center Architect

发布于 大约 14 小时前

普通员工/个人贡献者

Taipei, Taipei City, Taiwan
专家级经验
全职员工
仅现场办公
本科
架构师
Ai基础设施
Gpu集群
Nvidia
Nvlink
客户咨询
数据中心
混合云
解决方案架构

AI 估算 · 80k–120k

资深架构师,AI基础设施领域稀缺,跨国巨头薪资竞争力强,台湾地区薪资水平较高。

职位详情

关于这个职位

该职位负责为大型多租户AI基础设施平台提供端到端的解决方案架构设计,涵盖GPU计算、网络、存储、Kubernetes、自动化、安全等

您将作为技术桥梁,将客户业务需求转化为高/低层设计,并协调各领域专家,确保架构的可扩展性、安全性和可运营性
此角色需要出色的客户沟通和跨职能领导力,适合具备深厚基础设施背景、希望深入AI前沿领域的资深架构师

最低要求

· 计算机科学、信息技术、工程、电信、商业/技术管理或相关领域的学士或硕士学位,或同等专业经验

· 10年以上企业技术、电信、基础设施、数字化转型、解决方案咨询、产品/解决方案管理或架构相关经验
· 具备将业务和技术需求转化为解决方案架构、平台设计、实施路线图或技术商业建议的经验
· 具备企业数据平台、AI/大数据计划、云/本地集成、数字化转型或类似技术项目的经验
· 对企业基础设施基础有深入理解,包括数据中心、网络、IP连接、云服务、安全边界和服务依赖
· 具有领导复杂跨职能或跨国项目,并协调业务、IT、工程、产品和供应商团队的经验
· 能够编写HLD、架构蓝图、需求规格、决策记录、依赖映射、风险评估和执行级技术演示
· 具备面向客户的咨询和研讨会引导技能,包括与高层管理人员互动,并在业务和技术视角之间进行转换
· 能够在复杂项目环境中管理不断变化的需求、优先级冲突、交付风险和跨团队依赖
· 具备流利的专业中文能力,用于客户研讨会、技术讨论、架构审查和项目文档
· 具备工作英语能力,用于技术文档、跨国协作和供应商沟通
· 能够在台湾本地工作,并定期在客户办公室和数据中心设施提供现场支持

工作职责

· 领导需求发现和架构研讨会,与客户、业务、IT、数据、基础设施、安全、运营和供应商利益相关者合作

· 将业务、工作负载、安全、性能、可用性和运营需求转化为解决方案蓝图、HLD、架构原则和实施路线图
· 定义跨GPU计算、网络、存储、管理、安全、自动化、监控、平台服务和Day-2运营的端到端架构
· 与领域架构师和工程师协调LLD开发,确保与批准的HLD、技术标准和项目目标一致
· 定义可扩展性、可用性、性能、安全性、可恢复性、可观测性、可支持性和运营就绪性的非功能性需求
· 维护架构决策、假设、依赖关系、技术风险、兼容性要求和设计审查记录
· 评估AI和数据平台需求,并将训练、推理、验证、开发和租户工作负载映射到适当的基础设施和服务模型
· 设计跨本地数据中心、私有云和云环境的集成方法,包括数据流、控制流、连接、安全边界和运营依赖
· 与数据、AI、软件和基础设施团队合作,使平台架构与工作负载需求、数据生命周期、容量、服务级别和未来扩展保持一致
· 支持多租户资源池、工作负载隔离、配额、预留、标签、上线、下线和服务治理的架构评估
· 定义MVP、POC、试点和生产就绪评估的架构验证标准
· 与GPU专家合作,为NVIDIA GB200、GB300、B200、B300或同等加速器平台定义基础设施原则,包括容量、生命周期、监控和升级考虑
· 与网络架构师合作,定义计算、管理、租户、存储、服务和带外网络平面,包括分段、路由、安全和高带宽连接要求
· 与存储专家合作,为数据集、模型、工件、训练、推理、检查点、备份、恢复和恢复定义存储架构
· 协调操作系统、容器、Kubernetes、驱动程序、固件、运行时组件、可观测性和平台集成的技术基线
· 与相关领域专家一起审查高级技术的详细设计,如NVLink、InfiniBand、Spectrum-X、RoCE、CUDA、NCCL和GPU调度
· 定义集群生命周期、租户管理、资源供应、网络自动化、存储服务、监控和服务编排的集成架构
· 协调Rafay、Netris、Weka或类似平台的架构需求,包括API、工作流、状态流、审计跟踪、重试、恢复和回滚
· 在适当的地方推广API优先集成、可重用模板、自动化验证、基础设施即代码和GitOps实践
· 定义接口所有权、数据交换、控制点、依赖管理和平台组件与外部系统之间的运营交接
· 确保架构支持未来的自动化、服务目录、计费/退款、可观测性和运营治理需求
· 领导客户研讨会、架构审查、设计走查和技术决策会议,以结构化和咨询的方式
· 与客户高管和技术利益相关者互动,以协调业务优先级、架构选择、交付范围、风险和路线图决策
· 协调内部工程、产品、数据、软件和运营团队以及外部技术供应商和实施合作伙伴
· 向项目和执行利益相关者提供清晰的架构状态、决策理由、风险评估和建议
· 支持知识转移、解决方案赋能和可重用架构模式及最佳实践

优先资格

· 具备AI基础设施、GPU集群、HPC、私有云、Kubernetes或多租户平台架构经验

· 熟悉NVIDIA GPU系统和技术,如NVLink、InfiniBand、Spectrum-X、RoCE、CUDA、NCCL、GPU Operator或类似的加速器生态系统
· 具备Rafay、Netris、Weka或类似的Kubernetes管理平台经验

AI 洞察

优缺点分析

优点

  • AI基础设施是当前热门领域,技术前沿,发展前景广阔
  • IBM作为跨国巨头,提供全球化的平台和资源,有助于拓展视野
  • 职位涉及客户咨询和架构设计,能积累丰富的行业经验和人脉
  • 需要频繁出差和现场支持,工作强度大,可能影响工作生活平衡
  • 技术更新快,需要持续学习,保持知识更新
  • 适合具备深厚基础设施背景,对AI技术充满热情,善于沟通和解决复杂问题的资深技术专家

缺点 / 挑战

  • 薪资水平较高,福利完善
  • 客户需求多变,需要应对复杂项目环境和跨团队协调压力

角色解读

  • 可晋升为首席架构师或技术总监,负责更大规模的架构决策和团队领导
  • 可转向AI解决方案架构或产品管理,深入行业解决方案
  • 可成为独立顾问,为多家企业提供AI基础设施咨询服务
  • 负责与客户和内部团队沟通,将业务需求转化为AI数据中心的整体解决方案架构,包括高/低层设计
  • 协调GPU、网络、存储、Kubernetes等领域的专家,确保技术方案的一致性和可行性
  • 主导客户研讨会、架构评审和技术决策会议,提供专业咨询和指导
  • 持续跟踪AI基础设施技术趋势,并推动架构的演进和优化
  • 深厚的企业基础设施知识,包括数据中心、网络、云服务和安全
  • 熟悉AI基础设施技术,如GPU集群、NVIDIA技术栈、Kubernetes、HPC
  • 出色的客户沟通和咨询能力,能够与高层管理人员和技术专家有效互动
  • 强大的跨团队协调和项目管理能力,能够管理复杂项目中的依赖和风险

申请策略

  • 了解IBM在AI基础设施领域的解决方案和客户案例,以便在面试中展示匹配度
  • 准备一个完整的架构设计案例,展示从需求到落地的全过程
  • 突出10年以上企业级架构设计经验,特别是AI基础设施或GPU集群项目
  • 强调客户咨询和跨团队领导能力,展示如何推动复杂项目落地
  • 列出NVIDIA、Kubernetes、云平台等具体技术栈的实践经验
  • 展示HLD/LLD、架构蓝图等文档编写能力
  • 深入学习NVIDIA GPU架构和AI加速技术,如NVLink、CUDA
  • 熟悉Kubernetes生态和基础设施即代码工具,如Terraform、GitOps

面试指南

  • 使用STAR法则(情境、任务、行动、结果)回答行为问题,突出你的决策和影响
  • 对于技术问题,结合具体项目经验,说明技术选型的原因和权衡
  • 强调客户导向,展示你如何将业务需求转化为技术方案
  • 请描述一个你设计过的AI数据中心架构,包括关键决策和权衡
  • 如何协调不同技术团队(如GPU、网络、存储)以确保架构一致性?
  • 面对客户需求频繁变更,你如何管理架构设计?
  • 如何评估和选择AI基础设施技术栈?
  • 请解释NVLink和InfiniBand在GPU集群中的作用

职位点评

69
综合评分

AI基础设施前沿技术,发展空间大,但工作强度高,需现场办公。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和职业发展,能接受高强度工作节奏的资深技术专家。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活30
使命价值70

薪资福利

75中等

该职位提供有竞争力的薪资和福利,但具体薪资未披露,且需要频繁出差,可能影响稳定性。

薪资信号未披露(AI估算:80K-120K/月)

成长发展

90较高

职位处于AI基础设施前沿,涉及最新GPU技术,提供丰富的学习和发展机会,且IBM作为行业巨头,有完善的职业发展路径。

技术前沿前沿/新兴技术
技术栈NVIDIA、GPU、Kubernetes、NVLink、InfiniBand、CUDA、NCCL
业务类型ambiguous

工作生活

30较低

职位要求现场办公,且需要定期在客户现场支持,工作地点固定,灵活性低,可能影响工作生活平衡。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施是推动数字化转型的关键,职位对行业有积极影响,但具体社会价值不明确。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs