
科大讯飞
【星火X计划】面向超大尺寸通用LLM的预训练Infra工程(J13799)
【星火X计划】面向超大尺寸通用LLM的预训练Infra工程(J13799)
发布于 大约 8 小时前普通员工/个人贡献者
合肥市 / 北京市
无经验要求
全职员工
仅现场办公
硕士
平台工程
Cuda
Gpu
Llm
分布式训练
并行计算
性能优化
混合精度训练
集群调度
AI 估算 · 20k–40k
顶尖AI人才计划,热门LLM方向,薪资有溢价,合肥与北京差异大,综合估算月薪2-4万。
职位详情
关于这个职位
该岗位聚焦于超大尺寸通用大语言模型的预训练基础设施构建与优化,你将参与分布式训练框架的设计与迭代,负责混合并行策略(数据/张量/流水线/专家并行)的落地与调优,保障千卡/万卡级集群的稳定高效训练
同时需要跟进新模型架构,从框架层面进行定制适配,推动训练效率提升与成本降低
最低要求
-27届硕士及以上学历,计算机、软件工程、高性能计算、电子信息、数学等相关专业,计算机体系结构、深度学习相关理论功底扎实
编程基础牢靠,熟练掌握Python,同时精通C++、CUDA二者其一,能够产出规范、高性能的工程代码
掌握如下技术/知识一种:主流LLM深度学习训练框架、GPU/国产芯片高性能算子编程、编译优化
掌握GPU架构特性以及CUDA开发手段,了解昇腾NPU、海光DCU等国产加速硬件配套软件栈,熟悉算子优化方法与FP16/BF16/FP8混合精度训练方案
良好的沟通协作能力,自驱力和责任心足够强,可以和团队共同攻坚并落地新技术
工作职责
参与大规模分布式训练框架的设计、迭代与优化,适配预训练以及后训练完整流程,联合平台保障千卡/万卡量级集群实现高效稳定训练
落地多维度并行策略优化,涵盖数据并行、张量并行、流水线并行、专家并行,完成通信、显存、计算在特定集群和结构下的优化,充分挖掘芯片硬件性能上限
定位并解决训练环节的各类性能瓶颈、抖动故障,联动平台侧完善运维策略,保障超大算力集群训练任务平稳运行
对接算法研发团队,跟进全新模型架构的特性,从框架层面完成定制适配,匹配算法迭代的底层诉求
跟踪训练Infra领域前沿技术进展,参考业界成熟方案迭代自有框架,持续压低训练开销、提升运行效率与系统稳定性
优先资格
学业排名、科研成果、硬核竞赛表现突出者优先
AI 洞察
优缺点分析
优点
- 参与核心大模型预训练基础设施,技术含量高,紧跟AI前沿
- 科大讯飞是AI领军企业,星火大模型战略地位重要,平台资源丰富
- 能够接触千卡/万卡集群,积累大规模分布式系统实战经验,行业竞争力强
- 工作强度较大,需要应对大规模训练中的各类突发问题,可能涉及值班/Oncall
- 技术难度高,需要不断学习新架构和硬件,保持自我驱动力
- 跨团队协作多,需要良好沟通和快速适应能力
缺点 / 挑战
- 适合对大规模分布式系统和高性能计算有强烈兴趣,具备扎实计算机基础,追求技术深度和挑战的应届硕博毕业生
角色解读
- 技术专家方向:深入训练基础设施领域,成为分布式训练与性能优化方向的顶级专家
- 架构师方向:主导大规模训练平台的架构设计与演进,成为系统架构的决策者
- 管理方向:随着经验积累,可带领Infra团队,负责更广泛的AI基础设施战略
- 设计和优化大规模分布式训练框架,针对万亿参数模型实现多维混合并行策略(数据/张量/流水线/专家并行)的高效调度
- 联合平台团队保障千卡/万卡级集群在数周长周期训练中的稳定性和可靠性,处理硬件故障、性能抖动等工程问题
- 与算法团队紧密协作,针对新模型架构进行框架层的定制适配,并持续跟进业界前沿技术迭代自有训练系统
- 进行性能瓶颈分析,实施算子优化、混合精度训练等方案,充分挖掘GPU/国产芯片的算力潜力
- 扎实的编程功底:熟练掌握Python,精通C++或CUDA之一,能编写高质量高性能代码
- 深度学习框架知识:熟悉主流LLM训练框架(如PyTorch、Megatron、DeepSpeed等),理解分布式训练原理
- 并行计算和体系结构:理解GPU架构、CUDA优化,了解国产加速硬件(昇腾NPU、海光DCU)软件栈
- 问题解决能力:具备定位复杂系统中性能瓶颈和稳定性问题的能力,良好的团队协作与自驱力
申请策略
- 在申请中强调对星火大模型的兴趣和了解,展现对AI基础设施的热情
- 建议提前熟悉科大讯飞的业务和技术栈,在面试中体现对预训练基础设施挑战的思考
- 突出分布式训练、并行计算相关的项目经历,如深入参与过大规模模型训练或高性能算子开发
- 强调编程能力,展示C++/CUDA的高质量代码实现,附上GitHub或技术博客更佳
- 如果参与过开源框架(如PyTorch、DeepSpeed)贡献,会大大加分
- 体现竞赛或科研实力,如挑战杯、ACM、论文等,证明学习能力
- 提前学习Megatron-LM、DeepSpeed等主流分布式框架的源码,理解其并行策略实现
- 掌握CUDA优化技巧,熟练掌握NVIDIA Nsight等性能分析工具
面试指南
- 对于技术问题,使用STAR法则(情境、任务、行动、结果)结构化回答,突出你的工程决策和量化成果
- 涉及原理问题时,先阐明核心概念,再结合自身理解给出实际应用中的权衡
- 对于开放性问题(如故障定位),展示系统性思考:从现象入手,分层排查,结合监控数据和日志,最后给出预防措施
- 请介绍一个你参与过的分布式训练项目,遇到过哪些挑战?如何解决的?
- 数据并行、张量并行、流水线并行各自的优缺点和适用场景是什么?
- 如何诊断和解决大规模训练中的Loss Spike问题?
- 请解释混合精度训练的原理,以及FP16和BF16的区别
- 如何优化CUDA kernel的显存带宽利用率?
职位点评
72
综合评分
顶尖AI人才计划,前沿技术栈,核心大模型训练Infra,薪资未披露但竞争力佳,工作强度大。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求技术成长和挑战、愿意投入高强度工作、对AI基础设施有热情的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值70
薪资福利
65中等
薪资水平在行业内属中上,上市公司稳定性好,但具体薪酬未披露,综合来看补偿性满足程度一般。
薪资信号未披露(AI估算:20K-40K/月)
成长发展
90较高
职位深度涉及大模型训练基础设施,属前沿技术领域,参与核心研发,成长潜力极大。
技术前沿前沿/新兴技术
技术栈LLM、分布式训练、CUDA、混合精度、并行计算、GPU、昇腾NPU、编译优化
成长机会顶尖AI人才计划
业务类型ambiguous
工作生活
50较低
工作地点在合肥或北京,需现场办公,工作强度可能较大,生活化动机满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
参与大模型基础设施研发,对AI技术进步有推动,但直接社会价值不明显。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs