iFLYTEK logo
科大讯飞
【星火X计划】面向超大尺寸MoE的大EP推理工程优化(J13801)

【星火X计划】面向超大尺寸MoE的大EP推理工程优化(J13801)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市 / 北京市
无经验要求
全职员工
仅现场办公
硕士
机器学习工程
Moe
Nccl
Pytorch
Tensorrt-Llm
Vllm
分布式推理
并行计算
性能优化
All-To-All通信

AI 估算 · 25k–40k

AI大模型核心技术岗,顶尖人才计划,硕士学历,合肥和北京薪资水平差异,整体竞争力强。

职位详情

关于这个职位

该职位是科大讯飞星火X顶尖AI人才计划下的研究型工程岗位,专注于超大尺寸MoE模型的分布式推理优化

你将参与EP128以上专家并行场景的通信优化、负载均衡和调度系统研发,解决大规模GPU集群推理的瓶颈问题,有机会发表高水平论文并推动技术落地

最低要求

-27届硕士及以上学历,人工智能、计算机科学、高性能计算、数学、电子信息等相关专业,其他专业但具备突出工程能力者同样欢迎

扎实深度学习、并行计算、分布式系统基础,精通 Transformer 与 MoE 混合专家模型原理,熟悉大模型训练 / 推理分布式并行范式
熟练 C/C++ 或 Python
熟悉 MoE 路由机制、专家并行 EP、All-to-All 通信、分布式通信原语(NCCL 等)
具备分布式系统、高性能网络、调度算法相关背景
拥有独立问题建模、理论推导、仿真与大规模实验验证能力,能够搭建分布式评测基线,对标业界前沿并行方案并提出创新解法
良好跨团队协作能力,能够协同模型、推理框架、硬件、业务团队推进技术落地
具备较强抗压能力,擅长解决工业大规模集群场景下复杂技术瓶颈

工作职责

岗位职责:【课题介绍】本课题聚焦超大规模 MoE 大模型超大专家并行(EP128 以上) 场景下的核心瓶颈,围绕跨节点高带宽通信优化、动态专家负载均衡、多并行维度协同调度三大主线,构建低通信开销、高资源利用率、低尾部延迟的 MoE 分布式推理体系

针对 EP 规模扩张带来的 all-to-all 通信拥塞、专家访问热度倾斜、跨机通信时延激增、调度与路由开销放大等核心痛点开展研究
打通路由策略、通信算法、分布式调度器、底层通信库的协同优化,建立从专家路由、流量调度、动态负载重平衡到框架层落地的完整技术方案
支撑百专家乃至上千专家规模 MoE 大模型在大规模 GPU 集群高效部署,建立面向线上业务 MoE 分布式推理性能评测体系
【课题挑战】
EP128 及以上超大专家并行场景,All-to-All 通信流量爆炸、跨节点通信冲突与时延抖动问题,设计轻量化通信压缩、流量规整与通信调度策略
MoE 请求路由不均衡引发专家负载倾斜、长尾延迟显著,研究无侵入 / 低开销动态负载均衡、专家路由优化、冷热专家自适应调度机制
张量并行 TP、专家并行 EP、流水线并行 PP 多维度并行策略协同寻优,解决并行扩展过程中的资源碎片化、通信叠加问题
适配 Prefill/Decode 两阶段差异化流量特征,针对长序列推理、高并发在线业务设计动态路由与弹性调度方案
搭建自动化分布式仿真与实测评测平台,可复现大规模集群下通信拥塞、负载失衡现象,完成方案有效性验证
【课题价值】
有效抑制 EP 横向扩展带来的通信开销增长,提升超大集群 MoE 推理吞吐,降低尾部延迟,支撑更高并发业务承载
突破现有 MoE 专家并行扩展瓶颈,形成适配 EP128 + 规格的自研分布式 MoE 推理方案,支撑更大规模稀疏大模型工程落地
大幅提升 GPU 集群有效利用率,缓解专家负载不均衡造成的算力浪费,降低 MoE 业务部署成本
输出高质量学术论文、分布式 MoE 推理工具模块,夯实公司在超大规模稀疏模型分布式推理方向的核心技术竞争力

优先资格

熟悉 PyTorch、vLLM、TensorRT-LLM 等推理框架优先

有 MoE 分布式优化、负载均衡、高性能通信相关研究经历优先
有大规模 GPU 集群调试经验者优先
在 ICLR/NeurIPS/ICML 等顶会发表 MoE、分布式推理、并行优化相关论文优先
拥有 MoE 开源项目贡献、分布式推理框架二次开发经验优先

AI 洞察

优缺点分析

优点

  • 处于AI大模型前沿赛道,技术含金量高,个人成长空间大
  • 科大讯飞平台资源丰富,顶尖人才计划提供高关注度和培养资源
  • 研究成果能直接落地到实际业务,兼具学术价值和工业影响力
  • 薪资福利具有竞争力,可能包含股票激励等长期回报
  • 技术难度大,涉及分布式系统、通信、调度等多领域知识,学习曲线陡峭
  • 对数学和工程能力要求极高,需要持续学习和适应快速迭代的技术环境
  • 适合热爱底层系统、对大规模分布式推理有浓厚兴趣,并具备扎实算法与工程能力的硕士/博士

缺点 / 挑战

  • 工作强度和压力较大,需应对工业级集群的复杂问题和紧迫的交付节点

角色解读

  • 可向AI基础设施/分布式系统专家方向发展,成为大模型推理优化领域的核心技术专家
  • 在科大讯飞星火X计划中快速成长,未来可主导核心项目或带领团队
  • 通过顶会论文和工业落地积累影响力,可转向研究或工程管理方向
  • 研究并优化超大尺寸MoE模型的分布式推理,重点解决EP128以上专家并行场景的通信瓶颈
  • 设计并实现跨节点通信优化、动态专家负载均衡和多并行维度协同调度算法
  • 搭建分布式仿真与实测评测平台,验证方案有效性,支撑大规模GPU集群部署
  • 与模型、推理框架、硬件及业务团队协作,推进技术落地并输出学术论文和工具模块
  • 扎实的深度学习与并行计算基础,精通Transformer和MoE混合专家模型原理
  • 熟悉分布式通信原语(如NCCL)和主流推理框架(vLLM、TensorRT-LLM等)
  • 精通C/C++或Python,具备高性能编程和系统调优能力
  • 独立的问题建模、理论推导和大规模实验验证能力

申请策略

  • 关注星火X计划招聘流程,准备深度技术面试和系统设计问题
  • 了解科大讯飞星火大模型的技术栈和业务聚焦点,思考与职位的结合点
  • 突出MoE、分布式推理、并行计算相关的研究或项目经历,特别是EP、All-to-All通信优化
  • 展示扎实的C++/Python编程能力和PyTorch、vLLM等框架的实战经验
  • 如有顶会论文或开源贡献,务必突出展示
  • 强调解决复杂系统问题的能力和实验设计、性能分析能力
  • 深入学习NCCL通信原理和vLLM源码,尝试进行二次开发或性能调优
  • 复习Transformer、MoE路由机制以及分布式并行范式(TP/EP/PP)

面试指南

  • 分层次回答:先阐述基本原理,再结合项目/论文经验,最后提出优化思路或方案
  • 算法设计类问题采用“问题定义-约束分析-方法对比-实验验证”的结构
  • 经验类问题使用STAR法则(情境-任务-行动-结果)来叙述
  • 解释MoE模型中的专家并行(EP)原理,并分析All-to-All通信的瓶颈
  • 如何设计一个动态负载均衡算法来缓解专家访问倾斜?
  • 描述一次你优化分布式系统性能的经历,你是如何定位和解决的?
  • 谈谈你对vLLM等推理框架中并行策略的理解
  • 如何评估一个大规模分布式推理系统的性能瓶颈?

职位点评

76
综合评分

顶尖AI人才计划,前沿MoE分布式推理技术,薪资有望偏高,但工作强度大,WLB不明。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求前沿技术成长、热爱挑战且不在乎工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值85

薪资福利

75中等

该职位为顶尖人才计划,公司平台大,薪资预计有竞争力,但JD未明确具体数值,稳定性好。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

90较高

职位处于AI大模型前沿,技术挑战大,成长机会多,且有机会发表论文和积累顶尖工程经验。

技术前沿前沿/新兴技术
技术栈MoE、分布式推理、EP、NCCL、vLLM、TensorRT-LLM、All-to-All、负载均衡、并行计算
业务类型ambiguous

工作生活

50较低

工作地点在合肥和北京,要求现场办公,JD未提及WLB,可能面临高强度工作,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

AI大模型行业高速增长,技术研究具有前瞻性,对产业发展有较大价值,使命感较强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs