IBM logo
国际商业机器公司
AI Factory Operations Design and Management Lead

AI Factory Operations Design and Management Lead

发布于 大约 14 小时前

中层管理(经理/总监)

Taipei, Taipei City, Taiwan
专家级经验
全职员工
仅现场办公
本科
技术管理
Ai数据中心
Itil
Netris
Noc
Nvidia
Rafay
Soc
Sre
Weka

AI 估算 · 80k–120k

高级运营管理岗位,跨国企业,AI基础设施领域,薪资水平较高。

职位详情

关于这个职位

该职位负责建立并协调大规模多租户AI数据中心和GPU服务环境的运营模式,涵盖运营治理、服务管理设计、利益相关者协调、事件管理、沟通、项目执行和持续改进

您将与基础设施架构师、平台工程师、安全团队、服务台/NOC/SOC等紧密合作,将运营需求转化为清晰的流程和治理机制
适合具备丰富跨职能领导经验、技术素养和优秀沟通能力的管理者

最低要求

年以上全球或企业环境工作经验,在项目管理、运营治理、服务管理、利益相关者管理、问题管理、沟通或类似跨职能领导方面承担重要职责

具备在复杂组织中设计并执行战略、项目、治理机制、沟通和运营流程的能力
强大的项目/项目管理能力,包括规划、优先级排序、多工作流协调、风险和问题跟踪,以及在时间敏感条件下交付
有与高级管理层和多个利益相关者群体合作的经验,能够提供咨询建议、促进决策和推动协调
有处理高可见度问题、事件或危机沟通、升级或其他时间紧迫情况的经验,需要结构化协调和清晰的信息传达
能够创建清晰的管理报告、运营文档、流程材料、会议产出和利益相关者沟通
能够在技术驱动的环境中有效工作,并发展足够的技术素养

工作职责

领导AI工厂运营模式的定义和持续改进,涵盖服务管理、服务台、NOC、SOC、平台运营、网络运营、存储运营、SRE、客户团队和供应商

促进所有权、RACI、L1/L2/L3支持边界、升级路径、治理论坛和服务审查机制
协调事件、重大事件、问题、变更、请求、发布、缺陷和知识管理流程的设计和采用
定义清晰的沟通、决策、审批、维护窗口、升级和关闭要求
创建治理例程,为管理层提供服务健康、风险、行动、依赖关系、决策和持续改进优先级的可见性
领导面向客户的运营研讨会、服务审查、准备会议和跨职能治理会议
协调重大事件和高优先级运营问题的沟通,包括利益相关者更新、高管摘要、行动跟踪和事后跟进
建立清晰的沟通协议,用于中断、服务降级、计划变更、维护活动、安全事件和服务恢复
确保技术发现、服务风险、决策和行动项被转化为简洁、适合受众的沟通
支持问题和危机管理活动,维护准确的状态、所有权、时间线、决策日志和升级沟通
与SOC、NOC、SRE、安全、平台、网络和存储专家合作,定义警报接收、分类、升级、通知、调查和关闭工作流
协调GPU、服务器、网络、存储、平台服务和面向客户的服务组件的监控和服务健康要求
帮助定义警报严重性模型、运营仪表板、服务报告格式、工单要求和报告
协调监控集成、警报路由、自动工单创建、待命职责和供应商升级的运营准备
确保运营程序包括适当的审计证据、沟通检查点和利益相关者通知要求
与平台和基础设施专家合作,定义NVIDIA GPU基础设施和相关AI平台服务的运营程序、所有权、升级标准和服务控制
协调集群接入、租户设置、资源分配、网络配置、存储访问、服务变更、恢复和退役的治理要求
维护跨计算、GPU、网络、存储、安全、平台软件、监控和供应商支持的操作依赖视图
确保供应商升级路径、支持联系人、所需诊断证据和服务责任得到记录和审查
与主题专家合作,支持NVIDIA、Rafay、Netris、Weka或类似产品的平台特定运行手册
协调服务KPI和运营指标的定义和报告,如可用性、事件响应、恢复时间、配置成功、变更成功、积压和服务请求性能
促进服务记分卡、运营审查、风险审查、RCA跟进、已知错误跟踪和持续改进积压
制定和治理运营准备审查、服务过渡、启动、交接和验收检查清单
与技术负责人协调知识转移、运营演练、桌面演练、故障模拟和恢复演练
使用结构化报告和利益相关者反馈来识别流程差距并推动运营有效性的可衡量改进
开发和维护运营模式文档、治理章程、RACI矩阵、升级矩阵、服务审查包、SOP框架、运行手册标准、准备检查清单和过渡计划
计划并跟踪跨职能工作流、里程碑、依赖关系、风险、决策和行动项,涵盖客户、内部和供应商团队
向管理层和客户提供结构化状态报告,清晰说明结果、未解决风险、所需决策和下一步行动
促进多元文化和多利益相关者团队的协调,确保商定的行动得到落实
支持启用、入职、知识共享和运营沟通计划,以促进服务采用和Day-2准备

优先资格

硕士学位优先

有AI基础设施、数据中心运营或云服务管理经验者优先
熟悉ITIL、COBIT或其他服务管理框架者优先
有跨文化团队管理经验者优先

AI 洞察

优缺点分析

优点

  • 在AI基础设施前沿领域,有高成长性
  • 在跨国巨头企业,平台大,资源丰富
  • 工作内容多样,涉及技术、管理和沟通
  • 有机会与高层和客户互动,提升影响力
  • 跨文化团队协调复杂,需要高情商
  • 技术变化快,需要持续学习
  • 适合有丰富运营管理经验,擅长跨部门协调,对AI基础设施有兴趣的资深人士

缺点 / 挑战

  • 需要处理高可见度事件,压力大

角色解读

  • 可晋升为运营总监或基础设施主管
  • 可转向更广泛的IT领导角色,如CIO或CTO
  • 在AI基础设施领域成为专家,领导更大规模的运营
  • 负责AI数据中心和GPU服务环境的运营模式设计,包括流程、治理和所有权模型
  • 协调跨职能团队(基础设施、安全、服务台、NOC/SOC等)确保运营顺畅
  • 管理重大事件和客户沟通,确保信息透明和问题解决
  • 推动持续改进,通过KPI和审查机制优化运营效率
  • 深厚的项目管理能力,能管理复杂多工作流
  • 优秀的沟通和协调能力,能处理高管和客户关系
  • 对IT服务管理框架(如ITIL)有深入理解
  • 技术素养,能理解GPU、网络、存储等基础设施

申请策略

  • 了解IBM的AI战略和业务
  • 准备展示如何设计运营模型
  • 突出运营管理经验,特别是大型基础设施或数据中心
  • 强调项目管理成果,如成功交付复杂项目
  • 展示与高管和客户沟通的案例
  • 提及ITIL或类似框架的认证
  • 学习AI基础设施知识,如GPU、数据中心
  • 提升危机沟通和事件管理能力

面试指南

  • 使用STAR方法回答行为问题
  • 强调结构化思维和结果导向
  • 展示领导力和跨文化经验
  • 描述你如何设计一个运营模型?
  • 如何处理重大事件和客户沟通?
  • 如何协调多个团队?
  • 如何衡量运营效率?
  • 你如何推动持续改进?

职位点评

72
综合评分

AI基础设施运营管理,高成长,高压力,适合技术管理专家。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求职业成长和技术前沿,能接受高强度工作,对AI基础设施有热情的管理者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值70

薪资福利

75中等

薪资水平较高,但具体福利未提及,可能包括标准福利。

薪资信号未披露(AI估算:80K-120K/月)

成长发展

85较高

职位涉及前沿AI基础设施,有大量学习和成长机会,但晋升路径未明确。

技术前沿前沿/新兴技术
技术栈AI、GPU、NVIDIA、Rafay、Netris、Weka
业务类型profit_center

工作生活

50较低

工作地点在台北,现场办公,可能涉及高强度工作,但未提及弹性。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施是新兴领域,有社会价值,但具体使命未提及。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs