Cambricon logo
寒武纪
大模型训练系统实习生-27届

大模型训练系统实习生-27届

发布于 大约 3 小时前

实习/见习

北京市
无经验要求
实习生
仅现场办公
硕士
实习与临时职位
Llm
Megatron-Lm
Nsight Systems
Pytorch
Verl
分布式训练
性能优化

AI 估算 · 6k–12k

大模型方向实习薪资较高,北京地区硕士实习月薪通常在6k-12k,寒武纪作为上市AI公司待遇有竞争力。

职位详情

关于这个职位

该实习岗位专注于大模型训练系统的底层优化,你将参与训练框架适配、性能瓶颈分析和前沿技术调研,深入理解LLM训练全流程

适合对分布式训练和高性能计算有强烈兴趣的硕士生,是进入AI基础设施领域的绝佳起点

最低要求

学历背景:硕士及以上学历在读,计算机、微电子、通信、自动化、应用数学、物理等相关专业,2027届毕业生

框架基础:熟练使用 PyTorch,理解大模型(LLM)的主流训练方法(如 RL, Pre-training)及混合精度训练技巧
编程能力:熟悉 Linux 开发环境,具备扎实的 C/C++ 与 Python 编程功底,代码风格规范
综合素质:具备良好的逻辑思维与抗压能力,善于团队协作,拥有强烈的技术好奇心和自驱力
至少实习6个月,每周出勤4天及以上

工作职责

框架优化:参与大模型训练框架的适配与开发,利用性能分析工具定位瓶颈,进行针对性的性能热点优化

技术攻坚:追踪大模型领域前沿技术(如 Megatron-LM, Verl, Triton 等),调研社区最新性能优化方案并推动落地,解决训练过程中的显存墙、通信墙等瓶颈问题
性能建模:负责模型训练的理论性能计算与预估,量化分析计算/通信开销占比,提出合理的架构调整或算子优化建议

优先资格

实战经验:有大模型分布式训练(Verl/Fsdp2/Megatron-LM)或 AI 框架底层开发经验者优先

性能调优:熟练使用 Nsight Systems、DLProf 或 Torch Profiler 等性能分析工具,有实际调优案例者优先

AI 洞察

优缺点分析

优点

  • 接触大模型训练核心系统,技术含量高,积累宝贵的高性能计算经验
  • 工作内容前沿,能深入理解业界最新分布式训练技术(如Megatron-LM、Triton)
  • 工作强度较大,需应对性能调优中的复杂问题,抗压能力要求高
  • 实习期至少6个月,时间投入较长,需平衡学业
  • 适合对AI系统底层优化有强烈兴趣、具备扎实编程和分布式知识的硕士研究生,尤其是希望在AI基础设施领域深入发展的同学

缺点 / 挑战

  • 寒武纪作为AI芯片上市企业,平台资源丰富,实习认可度较高
  • 对编程基础和理论功底要求较高,需要快速学习新工具和框架

角色解读

  • 从系统优化入手,深入底层硬件与框架交互,可向AI框架开发或高性能计算专家方向发展
  • 积累大模型分布式训练经验,未来可转向模型训练架构师或AI Infra负责人
  • 通过参与前沿技术调研,培养技术视野,向技术专家或团队技术骨干成长
  • 参与大模型训练框架的适配与开发,使用性能分析工具定位并优化性能瓶颈
  • 跟踪 Megatron-LM、Triton 等前沿技术,调研并落地最新优化方案以解决显存/通信瓶颈
  • 进行理论性能建模,量化计算/通信开销,提出架构或算子优化建议
  • 熟练使用 PyTorch,理解 LLM 训练方法和混合精度训练
  • 扎实的 C/C++ 和 Python 编程能力,熟悉 Linux 环境
  • 了解分布式训练框架(如 Megatron-LM、Verl)和性能分析工具(如 Nsight Systems)
  • 具备良好的逻辑思维、抗压能力和团队协作精神

申请策略

  • 在简历中明确能够实习6个月以上,每周4天以上
  • 展示对寒武纪产品(如思元系列)的了解,表达对AI芯片+系统优化的热情
  • 突出 PyTorch 使用经验和 LLM 训练相关项目,如参与过预训练或RL微调
  • 强调 C/C++ 编程能力和 Linux 开发经验,展示代码质量(如GitHub链接)
  • 如有分布式训练或性能调优经历,用具体数据说明效果(如训练速度提升百分比)
  • 体现技术好奇心,如博客、开源贡献或前沿技术调研报告
  • 提前熟悉 Megatron-LM、Verl 或 Triton 的基本用法和原理
  • 学习使用 Nsight Systems 或 PyTorch Profiler 进行性能分析

面试指南

  • 对于原理类问题,从基础概念入手,结合自己的实际项目或学习经历,最后总结关键点
  • 对于优化经历问题,使用STAR法则(情境、任务、行动、结果)清晰叙述,量化性能提升
  • 对于开放性问题,展示逻辑推理过程,先分析问题本质,再提出可能的解决方案并比较优劣
  • 请解释混合精度训练的原理及你如何使用过
  • 描述一次你使用性能分析工具优化模型训练的经历
  • Megatron-LM中的张量并行和流水线并行有什么区别?
  • 如何诊断并解决分布式训练中的通信瓶颈?
  • 你对C++内存管理有哪些理解?如何避免内存泄漏?

职位点评

64
综合评分

前沿大模型系统实习,技术成长极高,但工作强度大且要求长期现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合以技术成长为首要目标、能接受较高强度和较长实习期的学生,对生活方式灵活性要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活40
使命价值70

薪资福利

60中等

实习生薪资在北京属于中等偏上水平,但实习福利相对有限,稳定性不高,整体补偿性动机满足一般。

薪资信号未披露(AI估算:6K-12K/月)

成长发展

90较高

该实习岗位技术前沿,工作内容与大模型训练系统密切相关,能深入积累分布式训练和性能优化经验,发展性动机满足度很高。

技术前沿前沿/新兴技术
技术栈PyTorch、LLM、Megatron-LM、Verl、Triton、分布式训练、性能优化
业务类型ambiguous

工作生活

40较低

要求每周出勤4天以上,实习期至少6个月,且未提及弹性工作或远程,生活方式灵活性较低。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

AI大模型是高速增长赛道,寒武纪作为国产AI芯片企业具有一定使命感,但实习岗位本身社会影响力中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs