iFLYTEK logo
科大讯飞
【星火X计划】面向超大尺寸MoE的大EP推理工程优化(J13983)

【星火X计划】面向超大尺寸MoE的大EP推理工程优化(J13983)

发布于 大约 8 小时前

实习/见习

合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Gpu集群
Moe
Nccl
Pytorch
Tensorrt-Llm
Vllm
分布式系统
大模型推理
并行计算

AI 估算 · 6k–12k

顶尖AI人才实习,大模型推理方向稀缺,薪资高于普通实习;北京和合肥生活成本不同,但科大讯飞提供有竞争力补贴。

职位详情

关于这个职位

该职位是科大讯飞星火X顶尖AI人才计划下的研究型实习岗位,聚焦超大尺寸MoE大模型在专家并行(EP128+)场景下的分布式推理优化

你将参与解决all-to-all通信拥塞、专家负载均衡、多维并行调度等核心技术难题,涉及系统优化、高性能计算与前沿AI框架
适合拥有扎实分布式系统功底、渴望挑战前沿课题的顶尖在读硕博生

最低要求

届及以后在读硕士及以上学历,人工智能、计算机科学、高性能计算、数学、电子信息等相关专业,其他专业但具备突出工程能力者同样欢迎

扎实深度学习、并行计算、分布式系统基础,精通 Transformer 与 MoE 混合专家模型原理,熟悉大模型训练 / 推理分布式并行范式
熟练 C/C++ 或 Python
熟悉 MoE 路由机制、专家并行 EP、All-to-All 通信、分布式通信原语(NCCL 等)
具备分布式系统、高性能网络、调度算法相关背景
拥有独立问题建模、理论推导、仿真与大规模实验验证能力,能够搭建分布式评测基线,对标业界前沿并行方案并提出创新解法
良好跨团队协作能力,能够协同模型、推理框架、硬件、业务团队推进技术落地
具备较强抗压能力,擅长解决工业大规模集群场景下复杂技术瓶颈

工作职责

【课题介绍】

本课题聚焦超大规模 MoE 大模型超大专家并行(EP128 以上) 场景下的核心瓶颈,围绕跨节点高带宽通信优化、动态专家负载均衡、多并行维度协同调度三大主线,构建低通信开销、高资源利用率、低尾部延迟的 MoE 分布式推理体系
针对 EP 规模扩张带来的 all-to-all 通信拥塞、专家访问热度倾斜、跨机通信时延激增、调度与路由开销放大等核心痛点开展研究
打通路由策略、通信算法、分布式调度器、底层通信库的协同优化,建立从专家路由、流量调度、动态负载重平衡到框架层落地的完整技术方案
支撑百专家乃至上千专家规模 MoE 大模型在大规模 GPU 集群高效部署,建立面向线上业务 MoE 分布式推理性能评测体系
【课题挑战】
EP128 及以上超大专家并行场景,All-to-All 通信流量爆炸、跨节点通信冲突与时延抖动问题,设计轻量化通信压缩、流量规整与通信调度策略
MoE 请求路由不均衡引发专家负载倾斜、长尾延迟显著,研究无侵入 / 低开销动态负载均衡、专家路由优化、冷热专家自适应调度机制
张量并行 TP、专家并行 EP、流水线并行 PP 多维度并行策略协同寻优,解决并行扩展过程中的资源碎片化、通信叠加问题
适配 Prefill/Decode 两阶段差异化流量特征,针对长序列推理、高并发在线业务设计动态路由与弹性调度方案
搭建自动化分布式仿真与实测评测平台,可复现大规模集群下通信拥塞、负载失衡现象,完成方案有效性验证

优先资格

熟悉 PyTorch、vLLM、TensorRT-LLM 等推理框架优先

有 MoE 分布式优化、负载均衡、高性能通信相关研究经历优先
有大规模 GPU 集群调试经验者优先
在 ICLR/NeurIPS/ICML 等顶会发表 MoE、分布式推理、并行优化相关论文优先
拥有 MoE 开源项目贡献、分布式推理框架二次开发经验优先

AI 洞察

优缺点分析

优点

  • 公司为上市大厂,拥有大规模GPU集群和业务场景,研究可落地,能切实解决线上业务问题
  • 有机会发表高水平论文,提升个人学术影响力,为后续深造或求职强背书
  • 课题难度大,涉及通信、负载均衡、调度等多个交叉领域,需要极强的系统性和深度思考能力
  • 作为实习生,需要快速适应并融入团队,与模型、框架、硬件等多方协作,对沟通能力要求高

缺点 / 挑战

  • 课题前沿性强,聚焦MoE大模型EP128+下的推理瓶颈,是当前AI基础设施热门的“卡脖子”难题,技术含金量高
  • 工作压力可能较大,需要同时兼顾理论研究、工程实现和实验验证,且要面对工业级集群的复杂性
  • 适合对分布式系统和大模型推理有强烈兴趣、具备出色工程和研究能力、能承受高强度科研挑战的顶尖硕士/博士在读生

角色解读

  • 在顶尖AI实验室参与前沿大模型分布式推理课题,有望产出高影响力学术论文或关键工具,成为该领域专家
  • 可深入接触工业级大规模GPU集群,积累稀缺的分布式推理优化实战经验,未来可向大模型系统架构师或研究员方向发展
  • 表现优异者可能获得转正机会,进入科大讯飞核心AI研发团队,参与更广泛的业务落地
  • 研究超大尺寸MoE大模型在专家并行EP128+场景下的推理性能瓶颈,重点解决All-to-All通信拥塞、动态专家负载均衡、多维度并行协同调度等问题
  • 设计并实现低通信开销、高资源利用率的分布式推理方案,打通路由策略、通信算法、分布式调度器与底层通信库的协同优化
  • 搭建分布式仿真与实测评测平台,可复现大规模集群下的通信拥塞与负载失衡现象,验证方案有效性,并输出学术论文或工具模块
  • 扎实的分布式系统、并行计算与高性能计算基础,精通Transformer和MoE模型原理,熟悉大模型训练/推理并行范式
  • 熟练使用C/C++或Python,熟悉PyTorch、vLLM、TensorRT-LLM等推理框架,掌握NCCL等分布式通信原语
  • 具备独立的问题建模、理论推导和大规模实验验证能力,能够搭建分布式评测基线并提出创新解法

申请策略

  • 在简历和面试中展现对课题的真实热情,最好能结合自身经历提出一两个针对EP通信优化的初步想法
  • 了解科大讯飞星火大模型业务和团队研究方向,准备相关问题
  • 突出分布式系统、并行计算相关项目经历,尤其是涉及MoE、NCCL、大规模GPU集群调优的经验
  • 强调C++/Python掌握程度,以及PyTorch、vLLM等框架的开发魔改经历
  • 如有ICLR/NeurIPS/ICML等顶会论文(哪怕挂名)或开源项目贡献,务必重点展示
  • 提前深入理解MoE模型架构和专家并行(EP)原理,动手跑通一个简单的MoE推理案例并尝试优化通信
  • 学习NCCL源码或阅读SGLang/vLLM等推理框架中MoE相关代码,了解当前主流优化手段
  • 练习性能分析方法(如ncu、nsys),熟悉GPU集群环境,尝试复现相关论文实验

面试指南

  • 先阐述原理,再分析问题痛点,最后提出可能的解决思路,可用具体数据或案例支撑
  • 对于优化类问题,可按照“问题分析-方案设计-实验验证”结构回答,强调系统性思考
  • 若有相关项目经验,采用STAR法则(情境、任务、行动、结果)详细说明
  • 请解释MoE中专家并行EP的原理及其通信开销主要来源?
  • 如何处理MoE推理中专家负载不均衡的问题?有哪些经典方法?
  • 如果要在EP128+场景下优化All-to-All通信,你会从哪些方面入手?
  • 如何设计一个实验来验证你的推理优化方案有效性?
  • 谈谈你对NCCL等底层通信库的理解,以及如何与上层调度协同优化?

职位点评

63
综合评分

前沿MoE大模型推理优化研究岗,技术含金量高,成长性强,但工作强度大,WLB不确定。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合以技术成长为核心追求的求职者,愿意投入高强度研究挑战,对WLB要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展88
工作生活40
使命价值70

薪资福利

60中等

上市大厂平台稳定,实习薪资未披露但通常有竞争力,但作为实习生福利有限,需视具体offer而定。

薪资信号未披露(AI估算:6K-12K/月)

成长发展

88较高

聚焦最前沿的MoE大模型分布式推理场景,参与者将深入核心系统优化,技能成长极快,且有机会发表顶会论文。

技术前沿前沿/新兴技术
技术栈MoE、EP、All-to-All、NCCL、PyTorch、vLLM、TensorRT-LLM、分布式系统、高性能计算、GPU集群
业务类型cost_center

工作生活

40较低

JD未提及弹性或远程安排,研究型岗位通常需要现场协作,且课题强度大,WLB不明朗。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型基础设施是高速增长赛道,课题突破对行业有推动作用,但社会影响相对间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
Watch Jobs