GLM logo
智谱
AI 院--MOE 训练/推理Infra工程师

AI 院--MOE 训练/推理Infra工程师

发布于 4 个月前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
软件工程
分布式训练
模型优化
系统设计
负载均衡
高性能计算
CUDA
MoE
PyTorch

AI 估算 · 35k–60k

岗位聚焦前沿AI基础设施,技术门槛高,位于北京且要求高级经验,薪资具备较强市场竞争力。

职位详情

关于这个职位

这是一个专注于MOE(专家混合)模型训练与推理基础设施开发的高级工程师职位

你将负责设计、实现并优化支持大规模分布式训练和推理的框架,解决专家选择、负载均衡、通信优化等技术难题,并与算法团队紧密合作,确保前沿AI算法的顺利落地

最低要求

关键技能:

分布式训练技术:
掌握分布式训练框架(如 Horovod、PyTorch Distributed)的使用和优化
具备设计和实现高效分布式训练系统的能力
硬件加速优化:
熟悉 GPU、TPU 等硬件架构,能够进行硬件级性能调优
了解 CUDA、cuDNN 等相关技术,能够利用硬件加速提升训练和推理效率
模型优化技术:
了解量化、剪枝、压缩等模型优化方法,以提升推理效率
能够在实际项目中应用这些技术,优化模型大小和推理速度
负载均衡与通信优化
能够设计高效的负载均衡策略和通信机制,以应对 MOE 模型的稀疏性挑战
优化分布式系统中的通信开销,提高数据传输效率
系统设计能力:
具备分布式系统设计经验,能够解决大规模模型训练和推理中的工程问题
能够设计和实现高可用、高扩展性的系统架构
其他:
计算机科学、软件工程、人工智能或相关领域的本科及以上学历
熟悉至少一种深度学习框架,如 TensorFlow、PyTorch 等
具备扎实的分布式系统和高性能计算的相关知识,熟悉 MPI、NCCL 等通信库
熟悉 Linux 操作系统及常用命令,具备良好的脚本编写能力(如 Bash、Python 等)
具备良好的问题解决能力和团队协作精神,能够承受工作压力,保证项目按时完成
良好的英语阅读和写作能力,能够阅读和理解英文技术文档

工作职责

主要职责:

设计并实现高效的 MOE 训练/推理框架:
设计并开发支持大规模分布式训练和推理的 MOE 框架,确保其在各种硬件配置下的高效运行
优化训练和推理性能,通过算法优化、并行计算、缓存策略等方式,缩短训练和推理时间,提高效率
解决 MOE 训练/推理过程中的技术难题:
针对专家网络的选择问题,研究和实现有效的专家选择算法,确保模型在训练和推理过程中的稳定性和准确性
解决负载均衡问题,通过动态调整专家网络的负载分配,提高系统资源的利用率,避免过载或空闲状态
优化通信过程,减少分布式训练和推理中的通信开销,提高数据传输效率,缩短训练和推理时间
与算法团队密切合作:
与算法团队保持密切沟通,了解算法需求,根据需求调整和优化训练和推理基础设施,确保算法的顺利实现
跟踪业界最新技术动态,引入适合项目需求的新技术、新方法,提升团队整体技术水平

优先资格

优先考虑:

具有 MOE 或相关领域(如分布式训练、模型并行等)的开发经验
在相关领域发表过高质量论文或拥有相关专利

AI 洞察

优缺点分析

优点

  • 技术前沿:直接参与MOE等前沿AI模型的基础设施建设,技术栈领先,积累价值高
  • 平台优势:智谱在AI领域具有知名度,提供接触核心项目和行业顶尖人才的机会
  • 综合锻炼:岗位横跨算法、系统、硬件,能全面提升复杂工程问题的解决能力
  • 技术难度高:需要同时精通分布式系统、深度学习和硬件优化,学习曲线陡峭
  • 竞争激烈:岗位要求高,面向的是有丰富经验的高级工程师,求职竞争可能较为激烈
  • 适合拥有扎实分布式系统和AI工程背景,追求技术深度,并希望在前沿AI基础设施领域做出贡献的高级工程师

缺点 / 挑战

  • 工作压力大:负责核心基础设施,需保证系统高可用与高性能,项目交付压力可能较大

角色解读

  • 技术路径:可向AI系统架构师、首席工程师等深度技术专家方向发展
  • 管理路径:积累项目经验后,有机会转向技术管理岗位,带领团队攻坚
  • 行业路径:在AI基础设施领域的深厚积累,是进入顶级科技公司或AI独角兽的宝贵资本
  • 核心工作是开发与优化支持MOE(专家混合)模型的大规模分布式训练和推理框架
  • 需要解决专家选择、负载均衡、通信优化等具体技术难题,确保系统高效稳定运行
  • 与算法团队紧密协作,将前沿算法需求转化为可落地的工程实现
  • 扎实的分布式系统与高性能计算知识,精通PyTorch Distributed、Horovod等框架
  • 深入的硬件加速优化能力,熟悉GPU/TPU架构及CUDA、cuDNN等底层技术
  • 系统架构设计能力,能够设计高可用、高扩展性的大规模训练推理系统

申请策略

  • 提前了解智谱AI的主要研究方向和技术产品,思考你的技能如何与其业务结合
  • 在沟通中展现出对解决底层技术难题的热情和强大的学习能力
  • 重点突出大规模分布式训练系统的实际设计和开发经验,特别是性能优化案例
  • 详细描述在GPU/TPU等硬件上进行性能调优、解决通信瓶颈的具体项目
  • 如有MOE、模型并行等相关经验或高质量论文/专利,务必作为核心亮点展示
  • 深入研读MOE及相关稀疏化训练的最新论文,理解其核心挑战与工程实现
  • 系统性复习分布式系统原理、通信库(MPI, NCCL)及深度学习框架的底层机制
  • 准备1-2个能体现你解决复杂系统性能问题的完整项目案例,梳理清楚技术细节

面试指南

  • 采用STAR原则(情境、任务、行动、结果)来结构化回答项目经验类问题
  • 对于技术方案题,先阐述问题本质与核心目标,再分步骤给出你的设计思路与权衡考量
  • 结合具体数据(如性能提升百分比、规模数据)来量化你的工作成果,增强说服力
  • 请详细描述你设计或优化过的一个分布式训练系统,遇到了哪些挑战,如何解决的?
  • 在GPU集群上训练大模型时,如何分析和优化通信开销?
  • 你对MOE模型的理解是什么?在工程实现上,你认为最大的挑战是什么?
  • 请谈谈你使用PyTorch Distributed或Horovod进行性能调优的具体经验
  • 如果专家网络负载严重不均衡,你会设计怎样的策略来动态调整?

职位点评

79
综合评分

技术前沿、成长性极佳的高级AI基础设施岗位,位于北京,预计工作强度较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合那些将技术成长和职业发展置于首位,愿意为前沿技术挑战投入大量精力,对薪资有合理期望但对WLB要求不高的资深技术人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活50
使命价值85

薪资福利

80较高

薪资预计具备市场竞争力,但具体福利待遇未在JD中明确披露,存在一定不确定性。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

95较高

岗位技术栈前沿,涉及AI基础设施核心,与算法团队合作紧密,技能成长和行业视野提升空间巨大。

技术前沿前沿/新兴技术
技术栈MOE、分布式训练、PyTorch、CUDA、GPU、TPU、负载均衡、模型优化
成长机会提升团队整体技术水平
业务类型ambiguous

工作生活

50较低

工作地点明确为北京,需现场办公。JD中未提及任何弹性工作或WLB相关信号,且包含“能够承受工作压力”的表述。

工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词

使命价值

85较高

投身于前沿AI模型的基础设施建设,推动AI技术进步,行业前景广阔且富有技术使命感。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs