
国际商业机器公司
AI System Engineer
AI System Engineer
发布于 大约 14 小时前普通员工/个人贡献者
Taipei, Taipei City, Taiwan
中级经验
全职员工
仅现场办公
本科
IT运维
Nvidia Gpu
Tcp/Ip
Vmware
Yaml
Netris
Rafay
Weka
AI 估算 · 25k–40k
AI基础设施运维岗位,技术要求高,IBM作为跨国巨头提供有竞争力的薪资,台湾地区薪资水平中等偏上。
职位详情
关于这个职位
该职位负责大型AI数据中心平台的日常运维与技术支持,涵盖NVIDIA GPU基础设施、Kubernetes、虚拟化、监控及网络存储集成
你将执行已批准的部署、测试和变更流程,并与高级架构师协作处理复杂问题
适合具备GPU、虚拟化或云原生经验的运维工程师,希望深入AI基础设施领域发展
最低要求
· 计算机科学、信息技术、工程或相关领域的学士学位或更高学历,或同等实践经验
· 约2-5年系统工程师、基础设施支持、虚拟化、云原生平台、数据中心运营或相关技术岗位的实践经验
· 具有NVIDIA GPU或vGPU基础设施、GPU服务器或类似加速器环境的实践经验
· 具有Kubernetes和容器化基础设施的实践经验
掌握Helm和YAML
· 具有VMware虚拟化或类似企业虚拟化平台的经验
· 使用Prometheus、Grafana或类似可观测性平台的经验
· 基本的Linux管理能力,能够解释操作系统、平台和应用日志
· 熟悉TCP/IP及常见基础设施服务,如VLAN、路由、DNS、NTP和防火墙
· 能够准确遵循runbooks、测试用例、变更工单和维护流程,并清晰记录结果
· 在项目驱动环境中具备较强的客户沟通和技术协调能力
· 具备中文专业水平,能进行日常沟通、问题处理、工单更新和操作文档编写
· 具备基础至中级英语能力,用于阅读技术手册、产品界面、供应商文档和支持案例
· 能够在台湾主要现场工作,并支持计划维护窗口和偶尔的非工作时间活动
工作职责
支持NVIDIA GPU服务器和GPU基础设施的安装、配置、验证和运维检查
执行GPU节点健康检查、诊断收集、基本拓扑验证以及性能或功能测试
支持NVIDIA vGPU或物理GPU环境,包括驱动和运行时验证
协助服务器、OOB/BMC、操作系统、证书、DNS、NTP、防火墙和端到端连接检查
收集系统、GPU、平台和应用日志,为升级到高级工程师或供应商准备诊断证据
支持VMware基础设施和云原生平台的部署、测试和部署后故障排除
使用YAML和Helm部署和维护Kubernetes工作负载,包括命名空间、资源限制、服务和基本GPU调度
通过Rafay或类似Kubernetes管理平台支持集群接入、租户或项目设置、用户访问、配额和资源池
执行批准的配置、升级、重试、恢复、回滚和配置验证流程
协助跨基础设施、Kubernetes、监控和客户应用的平台集成测试
使用文档化流程执行TCP/IP、VLAN、路由、DNS、NTP、防火墙和服务连接性验证
通过Netris或类似网络自动化工具支持批准的租户网络、IP地址、VLAN/VRF、路由和分段变更
协助存储客户端安装、挂载、CSI集成、NFS/S3访问以及容量或延迟检查,使用Weka或类似存储平台
验证租户隔离、网络可达性、存储连接和变更结果
必要时升级高级结构或存储问题
使用Prometheus、Grafana或类似工具实施和操作监控代理、导出器、仪表板和日志收集
执行常规GPU、系统、Kubernetes、网络和存储健康检查,并识别异常情况
进行第一级告警分类、问题复现、日志分析、工单更新、故障排除和升级
在计划维护窗口内执行批准的变更、更新、服务重启、证书续期、验证和回滚
支持事件、请求、变更、租户上线、下线、退役活动,并保持完整的操作记录
执行功能、集成、回归、基本性能、恢复和端到端测试用例
维护配置记录、测试证据、事件笔记、工单、SOP、runbooks和已知错误文档
为内部团队、客户和合作伙伴准备清晰的技术发现、状态更新和交接材料
在需要时支持技术演示、操作指导和用户或合作伙伴启用会话
优先资格
具有管理NVIDIA驱动、固件、CUDA、NCCL、GPU遥测或GPU性能基准测试的经验
具有Rafay、Netris、Weka或类似Kubernetes管理、网络自动化、IPAM/SDN或高性能存储平台的经验
接触过NVLink、InfiniBand、Spectrum-X、RoCE、高速以太网或其他AI集群互连技术
具有企业存储、CSI、NFS、S3、备份/恢复、快照或存储性能监控的经验
具有使用事件、问题、变更或ITSM流程支持生产环境的经验,包括NOC/SRE风格的操作
使用Python、Shell、Ansible、API或类似工具进行脚本编写或自动化经验
相关认证,如CKA、CKAD、NVIDIA AI基础设施/运维、Linux、Kubernetes、网络或存储认证
AI 洞察
优缺点分析
优点
- 接触前沿AI基础设施,积累GPU、Kubernetes等高端技术经验
- IBM作为行业巨头,提供稳定的平台和丰富的学习资源
- 工作内容多样,涉及运维、测试、客户支持,综合能力提升快
- 需要现场办公,可能涉及非工作时间维护,工作强度较大
- 技术栈广泛,需要不断学习新工具和平台
- 客户支持要求高,需要良好的沟通和抗压能力
- 适合有2-5年基础设施经验,对AI技术充满热情,愿意在运维领域深耕的工程师
缺点 / 挑战
暂无明显挑战项
角色解读
- 可向高级AI基础设施工程师、架构师或技术专家方向发展
- 有机会接触前沿AI技术,积累大规模数据中心运维经验
- 在IBM这样的跨国企业,可参与全球项目,拓展职业视野
- 负责AI数据中心平台的日常运维,包括GPU服务器、Kubernetes集群、网络和存储的部署、监控和故障排除
- 执行标准化的操作流程,如变更、升级、回滚,并记录操作结果
- 与客户和内部团队沟通,提供技术支持和问题升级
- 熟悉NVIDIA GPU基础设施,包括驱动、CUDA、vGPU等
- 精通Kubernetes和容器化技术,掌握Helm和YAML
- 具备VMware虚拟化、Linux系统管理、网络基础(TCP/IP、VLAN)和监控工具(Prometheus、Grafana)经验
申请策略
- 了解IBM AI基础设施产品线,展示对公司的兴趣
- 强调客户沟通和文档能力,因为职位涉及客户支持
- 突出GPU、Kubernetes、VMware等核心技能的实际项目经验
- 强调在数据中心或云环境中的运维和故障排除能力
- 展示脚本自动化经验,如Python、Ansible
- 深入学习Kubernetes和GPU调度,获取CKA等认证
- 熟悉NVIDIA AI基础设施相关工具,如CUDA、NCCL
- 了解网络自动化工具如Netris、存储平台如Weka
面试指南
- 使用STAR法则(情境、任务、行动、结果)回答行为问题,突出技术细节和结果
- 对于技术问题,先解释原理,再结合经验
- 描述一次你处理Kubernetes集群故障的经历
- 如何监控GPU服务器的健康状态?
- 解释VMware和Kubernetes的虚拟化区别
- 你如何与客户沟通技术问题?
- 你如何编写和维护运维文档?
- 复习Kubernetes、GPU、网络和存储的基础知识
职位点评
69
综合评分
AI基础设施运维岗位,技术前沿,成长性强,但工作强度大,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、对AI基础设施充满热情,能接受现场工作和一定加班的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活40
使命价值75
薪资福利
70中等
薪资未明确,但IBM作为跨国巨头提供有竞争力的薪酬和福利,但台湾地区薪资水平相对大陆可能略低。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
85较高
职位涉及AI基础设施前沿技术,提供丰富的学习和发展机会,但晋升路径未明确提及。
技术前沿前沿/新兴技术
技术栈NVIDIA GPU、Kubernetes、VMware、Helm、YAML、Prometheus、Grafana、Linux、TCP/IP、AI
业务类型ambiguous
工作生活
40较低
要求主要现场办公,可能涉及维护窗口和加班,工作地点在台北,生活便利性一般。
工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词
使命价值
75中等
AI基础设施是高速增长领域,IBM的品牌影响力大,但职位本身的社会影响力有限。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
国际商业机器公司 的其他在招职位
(2026 Campus Hire) Associate Business Consultant
国际商业机器公司 · Taipei, Taipei City, TaiwanAI 估算 · 20k-30kAI Factory Operations Design and Management Lead
国际商业机器公司 · Taipei, Taipei City, TaiwanAI 估算 · 80k-120kAI Data Center Architect
国际商业机器公司 · Taipei, Taipei City, TaiwanAI 估算 · 80k-120k【2026校招】品牌技术销售专员(深圳)
国际商业机器公司 · 深圳市AI 估算 · 10k-18kBusiness Transformation Consultant-IoT & PLM
国际商业机器公司 · Taipei, Taipei City, TaiwanAI 估算 · 20k-35k
相似职位推荐
Watch Jobs