ZTE logo
中兴通讯
AI-Infra 资深架构师(智能运维、训推优化)

AI-Infra 资深架构师(智能运维、训推优化)

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
架构师
Aiops
Deepspeed
Llm
Megatron
Pytorch
Sglang
Vllm
分布式存储
大模型

AI 估算 · 40k–60k

资深架构师岗位,AI基础设施方向前沿,上海地区,大型上市企业,薪资处于市场中高水平。

职位详情

关于这个职位

该职位是中兴通讯AI基础设施方向的资深架构师,负责大规模云平台的智能运维(AIOPS)与训练推理优化

你将用AI方法进行异常检测、根因定位、故障预测,并设计高性能分布式存储系统,支持万卡级集群的训推任务,是算力底座的的关键角色

最低要求

计算机、数学、数据科学或者相关专业,硕士及以上学历,8年以上工作经验

熟悉时间序列分析,运筹优化,大模型,自然语言处理等相关算法,精通大模型技术及衍生的RAG工程、Agent工程技术、模型训练和精调、算法优化,并具有成功的工程化案例
具备异常检测、根因定界定位、资源优化等智能运维业务场景实践经验
有智算云或通算云的业务背景,有大语言模型(LLM)在AIOPS领域的落地经验者优先
精通Pytorch、Megatron、Deepspeed等至少一种深度学习框架,精通Hadoop、Flink等大数据处理框架
要求具有良好的沟通与协作和表达能力,对新技术敏感,有强烈的求知和探索精神
精通vLLM/SGLang等推理框架
精通NVMe-oF、S3、POSIX、HDFS等协议与分布式存储调优
精通内存计算技术

工作职责

智能运维:

负责运维团队智能运维相关业务场景分析与产品技术规划,运维平台数据与智能模块架构设计与演进,智能运维领域相关前沿技术研究,技术竞争力提升
对大规模云平台进行异常检测、根因定位和故障预测,用AI方法建设智能化运维平台(AIOPS)
对业务、平台和硬件的统计画像与建模,追求极致的软硬件匹配和定制化,提升整个平台的资源效率
训推优化:
精通训练、推理框架,能够详细了解训练或推理框架上的性能瓶颈并给出解决方案
精通智算训练/推理存算一体架构和分级存储系统,能够设计出低延迟的高性能分布式存储系统,支持冷热数据自动迁移等存储功能
有万卡、十万卡集群的设计开发经验,深入了解大规模集群场景下分布式存储系统的性能瓶颈并给出优化方案
关注行业动态,能够及时进行分析并指导项目落地

优先资格

有大语言模型(LLM)在AIOPS领域的落地经验者优先

AI 洞察

优缺点分析

优点

  • 身处AI基础设施核心赛道,技术前沿,有大规模实战场景
  • 中兴通讯平台大,资源多,能接触万卡集群等顶级基础设施
  • 岗位重点突出,既能深耕AI算法,又能深入底层系统,技术复合度高
  • 对深度和广度要求极高,需要具备从算法到系统的全栈理解
  • 运维和优化工作通常需要极高的责任心,紧急情况可能随时响应
  • 适合技术底蕴深厚、对AI基础设施充满热情、喜欢解决复杂系统问题的资深工程师

缺点 / 挑战

  • 工作强度可能较大,需要同时关注多个技术领域,持续学习压力大

角色解读

  • 可向AI基础设施技术专家或架构师方向发展,成为算力平台的核心决策者
  • 也可转型为AI平台产品负责人,将技术能力转化为产品竞争力
  • 负责智能运维平台的架构设计与演进,用AI技术实现大规模云平台的异常检测、根因定位和故障预测
  • 研究并优化训练/推理框架的性能瓶颈,设计低成本、低延迟的分布式存储系统
  • 参与万卡/十万卡集群的存储与计算优化,提升整体资源效率
  • 精通AI算法和大模型技术,如时间序列分析、异常检测、RAG、Agent工程等
  • 熟悉主流深度学习框架(PyTorch、Megatron、DeepSpeed)和推理框架(vLLM、SGLang)
  • 具备分布式存储系统设计经验,熟悉NVMe-oF、S3、POSIX、HDFS等协议

申请策略

  • 提前研究中兴在智算和AI领域的产品线,面试中展示对业务的理解
  • 准备好讲述一个从问题发现到优化落地的完整技术案例
  • 突出大规模集群的实战经验,特别是万卡级分布式训练或存储优化项目
  • 强调AIOPS落地案例,如异常检测、根因定位等具体效果数据
  • 展示在AI算法和系统架构方面的双重能力,如主导过大型平台设计
  • 补强分布式存储和网络知识,熟悉NVMe-oF、RDMA等底层技术
  • 了解主流大模型推理框架的优化技巧,如vLLM的连续批处理、PagedAttention

面试指南

  • 采用STAR结构,突出场景-任务-行动-结果,用量化指标说明成效
  • 先界定问题边界,再给出技术选型对比和理由,最后总结推广价值
  • 强调方法论,体现可复制的优化思路
  • 请讲讲你在大规模集群上做分布式存储优化的具体方案和效果
  • 如何用AI技术实现根因定位?你有哪些实践经验?
  • 训练框架的性能瓶颈一般有哪些?如何定位和解决?
  • 谈谈你对AIOPS未来发展趋势的理解
  • 你在万卡集群上遇到的最大挑战是什么?如何克服的?

职位点评

70
综合评分

前沿AI基础设施架构岗,技术成长快,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和行业前沿、对工作生活平衡要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活45
使命价值65

薪资福利

75中等

大型上市公司,薪资水平预计较高,但具体未披露。

薪资信号未披露(AI估算:40K-60K/月)

成长发展

85较高

岗位涉及前沿AI技术,能参与大规模基础设施建设和优化,技能成长迅速。

技术前沿前沿/新兴技术
技术栈AIOPS、LLM、PyTorch、Megatron、DeepSpeed、vLLM、分布式存储
业务类型cost_center

工作生活

45较低

未提及远程或弹性工作,工作强度可能较高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

AI基础设施行业高速增长,但岗位本身的社会价值不明显。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs