
科大讯飞
【星火X计划】面向超大尺寸通用LLM的预训练Infra工程(J13981)
【星火X计划】面向超大尺寸通用LLM的预训练Infra工程(J13981)
发布于 大约 8 小时前实习/见习
合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Cuda
Gpu
Llm
分布式训练
并行计算
昇腾Npu
混合精度
训练框架
AI 估算 · 8k–20k
顶尖AI实习岗位,合肥/北京薪酬水平较高,叠加人才计划补贴,预估月薪范围。
职位详情
关于这个职位
该职位聚焦超大尺寸通用大模型的预训练基础设施,负责分布式训练框架的设计与优化,包括混合并行策略、训练稳定性保障、性能调优等
你将参与千卡/万卡集群的高效稳定训练,对接算法团队,推动前沿技术落地
适合对LLM训练系统有浓厚兴趣、具备扎实底层编程能力的在读硕博
最低要求
届及以后在读硕士及以上学历,计算机、软件工程、高性能计算、电子信息、数学等相关专业,计算机体系结构、深度学习相关理论功底扎实,学业排名、科研成果、硬核竞赛表现突出者优先
编程基础牢靠,熟练掌握Python,同时精通C++、CUDA二者其一,能够产出规范、高性能的工程代码
掌握如下技术/知识一种:主流LLM深度学习训练框架、GPU/国产芯片高性能算子编程、编译优化
掌握GPU架构特性以及CUDA开发手段,了解昇腾NPU、海光DCU等国产加速硬件配套软件栈,熟悉算子优化方法与FP16/BF16/FP8混合精度训练方案
良好的沟通协作能力,自驱力和责任心足够强,可以和团队共同攻坚并落地新技术
工作职责
【课题挑战】
结合具体结构的规模化并行方案设计:针对万亿参数模型结构信息结合训练集群体系结构,设计多维的混合并行策略,平衡计算效率、显存占用和通信开销,达到系统利用率最高
训练稳定性保障:大规模长周期的训练任务,芯片、存储、通信的稳定性以及训练过程中的Loss Spike无法避免,如何联合平台对软硬件进行监测,实现高效故障恢复,静默数据损坏识别等,是长时训练的难题
【课题价值】
参与大规模分布式训练框架的设计、迭代与优化,适配预训练以及后训练完整流程,联合平台保障千卡/万卡量级集群实现高效稳定训练
落地多维度并行策略优化,涵盖数据并行、张量并行、流水线并行、专家并行,完成通信、显存、计算在特定集群和结构下的优化,充分挖掘芯片硬件性能上限
定位并解决训练环节的各类性能瓶颈、抖动故障,联动平台侧完善运维策略,保障超大算力集群训练任务平稳运行
对接算法研发团队,跟进全新模型架构的特性,从框架层面完成定制适配,匹配算法迭代的底层诉求
跟踪训练Infra领域前沿技术进展,参考业界成熟方案迭代自有框架,持续压低训练开销、提升运行效率与系统稳定性
AI 洞察
优缺点分析
优点
- 海量资源与平台:依托科大讯飞的超算集群和“星火X计划”,可能获得独特培养资源,接触千卡/万卡级别真实环境
- 技能复合型成长:同时涉及分布式系统、高性能计算、深度学习和芯片优化,培养稀缺的跨领域能力
- 职业起点高:为顶尖AI人才计划,有机会与业界大牛合作,为未来职业发展奠定坚实基础
- 长周期项目:训练稳定性保障需要长时间投入,成果产出周期长,短期内可能难以看到显著成果
- 适合对系统底层和AI训练有强烈好奇心和钻研精神,能享受攻克技术难题,抗压能力强的高年级在读硕博
缺点 / 挑战
- 技术前沿性极高:聚焦万亿参数大模型预训练基础设施,是AI领域的核心挑战之一,能参与建设下一代AI底座
- 技术难度大:需要同时掌握系统底层、并行计算和深度学习,学习曲线陡峭,压力较大
- 工作强度可能较高:大规模训练任务往往需要随时响应问题,可能涉及7x24小时值班或紧急故障处理
角色解读
- 在训练基础设施领域深耕,成为分布式系统或LLM训练优化专家,引领大规模AI基础设施架构演进
- 横向拓展至AI平台、云计算、芯片生态等方向,成为跨领域技术专家
- 在科大讯飞这样的大型AI企业,有机会参与国家级重大课题,接触真实超大规模集群,快速积累顶尖工程经验
- 负责设计并优化大模型预训练的高性能分布式训练框架,实现多维混合并行策略(数据/张量/流水线/专家并行)以平衡计算、显存和通信开销
- 保障超大规模集群(千卡/万卡)在数周甚至数月内的稳定训练,处理硬件故障、Loss Spike等异常,实现高效故障恢复与静默数据损坏识别
- 与算法团队紧密协作,针对新型模型架构进行框架层定制适配,并持续跟踪业界前沿技术,迭代优化框架性能
- 扎实的编程能力:精通Python,并熟练掌握C++或CUDA,能编写高性能工程代码
- 深度学习与体系结构理论基础:理解GPU架构、显存管理、混合精度训练(FP16/BF16/FP8)等
- 熟悉分布式训练框架或高性能计算,具备并行计算或编译优化经验
- 了解国产加速硬件(昇腾NPU、海光DCU)的软件栈和算子优化方法更佳
申请策略
- 在简历和面试中展现对预训练Infra的热情和深入思考,如分析过百亿/千亿模型训练时的性能瓶颈
- 了解科大讯飞星火大模型的技术路线,并准备1-2个关于训练稳定性或效率优化的具体想法
- 突出分布式系统或高性能计算项目经历:如设计过并行训练方案、优化过通信瓶颈、参与过大规模集群调优
- 展示底层编程能力:提供GitHub或代码片段,证明C++/CUDA的高效编码能力,以及Python的工程熟练度
- 强调与LLM训练相关的实践:如使用过PyTorch/DeepSpeed/Megatron等进行模型预训练,或写过高性能算子
- 科研与竞赛成果:如有体系结构或AI方向高水平论文、竞赛获奖(如ACM竞赛)等,务必显著列明
- 系统学习CUDA优化技术:掌握kernel编写、shared memory使用、Tensor Core编程,并尝试实现常见算子
- 阅读主流训练框架源码:如DeepSpeed、Megatron-LM、vLLM,理解其并行策略和通信机制
面试指南
- 对于系统设计类问题:先明确约束(模型尺寸、集群规模、硬件特性),然后阐述并行维度组合的思路,最后权衡计算、显存、通信的开销,可使用具体数字进行说明
- 对于故障排查类问题:采用“定位-隔离-恢复-预防”的框架,结合监控数据、日志分析、硬件状态等,体现系统性思维
- 对于底层优化类问题:从算法计算过程出发,分析瓶颈(访存/计算/通信),再针对瓶颈提出优化手段(如循环展开、向量化、使用Tensor Core等),并对比效果
- 如何在大规模分布式训练中设计混合并行策略?请以具体模型为例
- 训练过程中出现Loss Spike,你会如何排查和解决?
- 请解释CUDA中的内存层次结构,并说明如何优化一个矩阵乘法的kernel
- 同步训练与异步训练的区别?在万卡集群中如何选择?
- 如何在没有大量测试资源的情况下,评估一个训练框架的扩展性?
职位点评
69
综合评分
顶尖AI实习计划,技术极前沿,成长空间大,但薪资未披露且工作强度可能较高。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合高度重视技术成长、渴望挑战顶尖AI基础设施难题、能承受高强度工作的研究生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展88
工作生活45
使命价值75
薪资福利
55较低
JD未提及薪资和福利,但作为顶尖AI人才计划,预计薪酬有竞争力,但不确定性较高。
薪资信号未披露(AI估算:8K-20K/月)
成长发展
88较高
该岗位处于大模型训练技术最前沿,能接触万亿参数规模和万卡集群,技能成长空间极大,是极佳的技术跳板。
技术前沿前沿/新兴技术
技术栈LLM、CUDA、分布式训练、混合精度、GPU、昇腾NPU、FP8、并行计算
业务类型ambiguous
工作生活
45较低
工作地合肥/北京,要求现场办公,JD未提弹性或WLB,大模型训练岗位通常强度大,生活平衡可能受影响。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
预训练基础设施是AI发展的基石,对推动大模型技术落地有重要价值,但JD未特别强调社会使命感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs