
寒武纪
分布式训练研发工程师-27届
分布式训练研发工程师-27届
发布于 大约 8 小时前普通员工/个人贡献者
上海市
无经验要求
全职员工
仅现场办公
本科
软件工程
Cuda
Megatron-Lm
Mlu
Nccl
Openmpi
Pytorch
Rdma
分布式训练
性能优化
AI 估算 · 20k–35k
AI芯片赛道热门,分布式训练研发技能稀缺,上海校招硕士月薪约2.5-3.5万。
职位详情
关于这个职位
该职位是寒武纪面向2027届毕业生的校招岗位,工作内容聚焦于基于自研MLU芯片的分布式训练通信库开发,以及大规模训练的性能优化
适合对C/C++底层系统开发、并行计算和高性能计算感兴趣的应届生
最低要求
本科及以上学历,计算机,软件工程,通信等相关专业
熟练掌握 C/C++,有扎实的编程基础、良好的编程风格和工作习惯
熟悉 Python/Shell 等脚本语言
具有良好的团队协作精神,责任心强,能够积极主动地完成相关工作
工作职责
基于MLU构建异构并行通信库,面向未来低时延、高带宽的计算通信需求,实现高性能设备通信加速库
大规模分布式训练中多机计算、通信和训练性能的优化
优先资格
满足以下一种或多种条件者优先:
具备并行程序开发经验,了解 CUDA, OpenMPI, NCCL 等并行程序开发和性能调优经验
掌握计算机系统结构知识和指令流水,有 Pipeline 优化经验
有集合通信算法开发,网络编程,RDMA 编程相关经验
了解 Pytorch/Megatron-LM 等框架分布式执行方式
AI 洞察
优缺点分析
优点
- 身处AI芯片头部公司,接触自研芯片和前沿分布式训练技术,技术含金量高
- 应届生可参与核心底层系统研发,积累高性能计算和并行优化经验,市场稀缺
- 上海地区薪资福利较好,上市公司平台稳定,有股权激励可能
- 底层系统研发门槛高,需要较强的C/C++和体系结构功底,学习曲线陡峭
缺点 / 挑战
- 涉及硬件与软件协同,调试难度大,可能面临较大工作压力
- 适合对高性能计算、分布式系统有浓厚兴趣,喜欢底层技术挑战的计算机相关专业毕业生
角色解读
- 向高性能计算/系统架构专家方向发展,成为分布式训练基础设施的核心技术骨干
- 可转岗至AI芯片软件栈、编译器、网络通信等更底层方向,或晋升为技术Leader
- 基于公司自研MLU芯片,开发高性能异构并行通信库,实现设备间高效数据传输
- 针对大规模分布式训练场景,优化多机多卡的计算、通信和整体训练性能
- 与算法和系统团队协作,定位性能瓶颈,进行底层调优
- 扎实的C/C++编程能力,熟悉Python/Shell脚本
- 理解计算机体系结构、并行计算原理,了解CUDA、NCCL、OpenMPI等并行开发技术
- 熟悉分布式训练框架(如PyTorch、Megatron-LM)的执行模式
申请策略
- 关注寒武纪技术博客或开源项目,了解MLU架构特点,在面试中展示对公司的了解和热情
- 准备好笔试环节,复习操作系统、计算机网络和数据结构基础知识
- 突出C/C++项目经验,如有高性能计算、并行编程或分布式训练相关项目最加
- 展示对CUDA、NCCL、OpenMPI等工具的使用或学习经历
- 强调系统编程、网络通信、性能优化方面的能力,以及Linux环境开发经验
- 补充学习CUDA编程和NCCL/OpenMPI的使用,动手实现简单集合通信示例
- 阅读PyTorch分布式训练源码(如DDP、NCCL后端),理解数据并行和模型并行
面试指南
- 使用STAR法则:情境、任务、行动、结果,强调量化指标
- 先阐述理论基础,再结合实践案例,最后总结优化思路和收获
- 面对未知问题,可展示逻辑推理过程,从系统层面逐层拆解
- 请介绍一次你使用C/C++进行性能优化的经历
- 解释NCCL中AllReduce的实现原理,如何优化带宽利用率?
- 分布式训练中常见的通信瓶颈有哪些?如何定位和解决?
- 你对CUDA编程模型哪些部分最熟悉?如何设计kernel来减少访存延迟?
- 谈谈你对异构计算的理解,以及MLU这类AI芯片与GPU的差异
职位点评
74
综合评分
AI芯片头部公司,前沿技术栈,成长性强,但薪资未披露且WLB不确定。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合追求技术成长、对高性能计算和底层系统有强烈兴趣,愿意挑战硬核技术难题的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展92
工作生活55
使命价值72
薪资福利
65中等
职位位于上海,上市公司平台,芯片行业薪资竞争力强,但JD未披露具体薪资和福利,存在不确定性。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
92较高
岗位涉及自研芯片高性能通信库和分布式训练优化,技术前沿,成长空间大,能积累稀缺的底层系统能力。
技术前沿前沿/新兴技术
技术栈C/C++、CUDA、OpenMPI、NCCL、RDMA、Pytorch、Megatron-LM、MLU、高性能计算、分布式训练
业务类型ambiguous
工作生活
55较低
JD未提及工作模式、加班情况或WLB信息,无法判断具体生活方式,默认现场办公,存在不确定性。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
72中等
AI芯片属于高速增长赛道,对人工智能算力发展有积极贡献,但JD未强调使命愿景,意义感中等偏上。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
寒武纪 的其他在招职位
相似职位推荐
Watch Jobs