Ant Group logo
蚂蚁集团
蚂蚁集团-服务器硬件质量专家-杭州

蚂蚁集团-服务器硬件质量专家-杭州

发布于 大约 8 小时前

普通员工/个人贡献者

杭州市
专家级经验
全职员工
仅现场办公
本科
质量管理
Bmc/Ipmi
Gpu
Npu
Nvme
Roce/Rdma
X86/Arm
供应商质量管理
可靠性评估
服务器硬件

AI 估算 · 45k–70k

硬件质量专家,8年以上经验,AI服务器方向热门,蚂蚁大厂薪资竞争力强,估算月薪4.5-7万。

职位详情

关于这个职位

该职位专注于蚂蚁集团内部服务器硬件质量的全面保障,尤其是AI异构服务器(GPU/NPU芯片)的端到端交付质量

你将主导供应商质量管理、重大问题处理以及质量改进机制的建立,需要扎实的硬件知识体系和丰富的实战经验
适合8年以上硬件质量背景的资深专家

最低要求

● 计算机、电子工程、通信等相关专业,本科及以上学历,8年以上服务器研发质量/出货质量/业务线质量/运维等相关工作经验

● 扎实的计算机体系结构基础知识,熟悉x86/ARM架构CPU、GPU加速卡、NVMe存储、高速网络(RoCE/RDMA)、液冷散热等技术细节,具备一线硬件故障定位与评测实操能力,能独立完成 BMC/IPMI 日志抓取、性能压测、FA 根因分析等工作
● 熟悉BIOS、BMC、FW、结构、AC/DC电源、信号仿真、散热、测试等领域知识,可组织各团队完成可靠性分析及质量问题定位
● 具有强烈的质量意识和客户导向,逻辑清晰、目标导向,沟通协调能力佳、推动解决问题能力强,较好的英语读写能力及团队合作精神

工作职责

● 负责蚂蚁内部服务器质量,对服务器在内部业务侧的满意度负责,牵头量产服务器的日常及重大问题处理,保障问题解决进度与质量,输出并推进最优解决方案落地,通过复盘形成技术侧、管理侧改进机制

● 负责AI异构服务器(GPU/NPU芯片)的端到端交付质量保障,搭建异构服务器的可靠性评估及预测体系、风险应急及恢复体系
● 主导供应商质量管理,建立供应商质量管理流程,通过季度审查、质量稽核等运作,确保质量目标与标准的落实和持续改进,开展供应商质量审核、质量体系评估与运维能力管理
● 识别服务器运行质量风险,主动规划并开展质量专项活动,保障应用侧风险可控、业务侧满意度达成
● 对标业界标杆,引入先进质量运维管理方法,制定相关服务器的全流程质量运维管控方案并主导实施,确保改善措施的有效落地

优先资格

● 有互联网/云计算基础设施硬件质量管理相关工作经验优先,尤其有AI训练、推理技术场景的GPU故障分析经验优先

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台庞大,技术资源和业务场景丰富,职业稳定性高
  • AI异构服务器是当前最热门的技术方向,技能含金量和市场价值持续上升
  • 工作内容涵盖质量管理、供应商管理和技术攻关,综合能力提升空间大
  • 薪资待遇在杭州市场具有较强竞争力,且大厂福利体系完善
  • 硬件故障定位复杂,需要非常深厚的知识积累和实战经验
  • 适合具备丰富服务器硬件质量管理经验、热爱技术钻研且能够有效推动多方协作的资深工程师

缺点 / 挑战

  • 涉及跨团队、跨供应商协作,沟通协调成本较高
  • 可能需要应对突发的生产故障,工作压力较大

角色解读

  • 可成长为硬件质量领域的技术专家或团队负责人
  • 向AI基础设施方向深入,成为AI算力硬件质量的权威专家
  • 有机会转向供应链管理或更高层次的技术管理岗位
  • 负责蚂蚁集团内部服务器量产质量与重大问题处理,通过复盘驱动技术和管理改进
  • 搭建AI异构服务器(GPU/NPU)的可靠性评估、风险应急和恢复体系,保障端到端交付质量
  • 主导供应商质量管理,通过季度审查、质量稽核等方式提升供应商质量能力
  • 引入业界先进质量运维方法,制定全流程质量管控方案并推动落地
  • 熟悉x86/ARM架构、GPU加速卡、NVMe存储、高速网络(RoCE/RDMA)等技术细节
  • 具备一线硬件故障定位能力,能独立完成BMC/IPMI日志抓取、性能压测和FA根因分析
  • 掌握BIOS、BMC、电源、散热、信号仿真等跨领域知识,可组织多团队进行可靠性分析
  • 具备强烈的质量意识、客户导向以及优秀的沟通协调和问题推动能力

申请策略

  • 提前了解蚂蚁集团在AI算力和数据中心方面的技术布局,在面试中展现行业洞察
  • 准备一个完整的硬件质量改进项目案例,用STAR法则清晰陈述
  • 突出服务器硬件质量项目的具体成果,特别是AI异构服务器GPU故障分析的案例
  • 强调供应商质量管理体系的搭建和优化经验,附上量化结果
  • 展示技术实操细节,如BMC/IPMI日志分析、性能压测、FA根因分析等
  • 体现跨团队协作和问题推动能力,举例说明如何解决复杂质量问题
  • 补充GPU/NPU硬件架构和AI计算集群的基础知识,了解主流加速卡和互连技术
  • 学习RoCE/RDMA、液冷散热等新兴技术在服务器中的应用

面试指南

  • 使用STAR法则,清晰说明情境、任务、行动和结果,突出个人贡献
  • 从技术和管理两个维度综合分析,展现系统性思考能力
  • 强调数据驱动的决策和持续改进的理念
  • 请描述一次你主导服务器重大质量问题的处理经验,最终结果如何?
  • 如何搭建AI异构服务器的可靠性评估体系?
  • 面对供应商质量不达标,你会如何推动其改进?
  • 在跨团队协作中,如何有效推动问题解决?
  • 谈谈你对GPU故障分析的具体经验和方法

职位点评

72
综合评分

蚂蚁硬件质量专家,前沿AI算力硬件,技术成长性强,但现场办公强度未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和前沿硬件领域发展、对AI基础设施质量管理充满热情的专业人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活50
使命价值80

薪资福利

70中等

职位未明确薪资范围,但蚂蚁集团作为行业巨头,薪酬福利体系完善,具有较强吸引力,稳定性好。

薪资信号未披露(AI估算:45K-70K/月)

成长发展

88较高

涉及AI异构服务器和前沿硬件技术,学习成长空间大,职业发展前景广阔。

技术前沿前沿/新兴技术
技术栈GPU、NPU、x86、ARM、NVMe、RoCE、RDMA、BMC、IPMI
业务类型cost_center

工作生活

50较低

要求现场办公,未提及弹性工作或远程选项,且硬件质量工作可能面临应急响应,工作强度存在不确定性。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

80较高

服务器质量保障对云计算和AI基础设施至关重要,行业增长快,工作具有高度的技术价值和社会意义。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs