Cambricon logo
寒武纪
大模型训练优化工程师-27届

大模型训练优化工程师-27届

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Cuda
Deepspeed
Gpu
Megatron
Pytorch
分布式训练
大模型
性能优化

AI 估算 · 22k–40k

AI芯片大模型优化岗位,技能门槛高,上海薪资竞争力强,校招薪酬丰厚

职位详情

关于这个职位

该职位负责在寒武纪AI芯片上优化大模型训练性能,涉及分布式训练、精度调优和 Benchmark 优化

你将接触前沿的 AI 芯片与大模型技术,与顶尖团队合作,推动国产芯片生态发展
适合对高性能计算和深度学习充满热情的同学

最低要求

EECS或相关专业,本科或硕士以上学历

熟悉 Megatron,deepseed 等分布式框架,有实际大规模分布式训练经验
对大模型、多模态、强化学习中的某一个场景有一定的积累和见解
有GPU性能优化分析和精度调优经验,熟练掌握 nvprof, nvvp, nsight 和 valgrind 等性能分析工具
熟悉掌握一种或以上主流框架(TensorFlow/ PyTorch等)
熟练操作Linux系统,熟练掌握C/C++/Python/Shell,有扎实的编程基础和调试经验

工作职责

负责客户AI模型在寒武纪人工智能芯片(MLU)上的端到端性能优化和精度调优,及时总结可泛化的实践,开发性能/精度分析工具

负责寒武纪model zoo的开发和维护,在寒武纪人工智能芯片上进行SOTA算法复现,并进行性能优化分析和精度调优,形成领域参考解决方案
针对公开的或私有的AI Benchmark(如MLPerf等)进行端到端的优化,并密切跟踪评估各AI平台厂商的优化技术实践,最大化MLU在这些benchmark上的表现

优先资格

对数据/模型并行等分布式方案有一定的见解和经验

对量化训练有一定的见解和经验
对一种或以上主流框架(TensorFlow/PyTorch等)有开发者视角的理解,对框架设计或者调优有一定的见解和经验
熟悉并喜欢高性能优化,对CUDA/OpenCL/BANG/C/OpenMP等并行计算模型有一定的开发经验
熟悉GPGPU/MLU/CPU微架构,对软硬件联合优化有一定的见解和经验

AI 洞察

优缺点分析

优点

  • 国产AI芯片领军企业,技术前沿,可深度接触大模型与芯片协同设计
  • 项目与行业顶尖客户合作,参与国际Benchmark,成长速度极快
  • 公司已上市,发展稳定,薪酬福利有竞争力
  • 大模型优化难度高,需要扎实的底层系统和并行计算知识
  • 工作强度可能较大,需适应快节奏的技术迭代
  • 芯片生态尚在成长,部分工具链不如GPU成熟,需要有耐心和钻研精神

缺点 / 挑战

  • 适合对高性能计算有浓厚兴趣,喜欢技术挑战,愿意深入底层并追求极致性能的应届生

角色解读

  • 技术方向:成为大模型性能优化专家,深入AI芯片底层架构和编译优化
  • 横向发展:可转向AI框架开发、编译器优化或芯片验证等方向
  • 管理方向:未来可带领团队负责整体性能优化生态建设
  • 负责客户AI模型在寒武纪MLU芯片上的性能优化和精度调优,开发性能/精度分析工具
  • 开发和维护Model Zoo,在芯片上复现SOTA算法并进行优化,形成参考解决方案
  • 参与MLPerf等AI Benchmark的端到端优化,跟踪行业技术实践,最大化MLU性能表现
  • 熟悉分布式训练框架(Megatron/DeepSpeed)并具备大规模训练经验
  • 掌握GPU性能分析工具(nvprof/nsight等)和精度调优方法
  • 熟练使用C++/Python/Linux,至少熟悉一种主流深度学习框架
  • 了解数据/模型并行、量化训练等分布式优化方案

申请策略

  • 关注寒武纪官方招聘动态,内推可提高简历曝光
  • 面试前准备对AI芯片行业趋势的见解,展现对国产芯片的热情
  • 突出分布式训练项目经验,如大规模模型训练调优的具体案例
  • 强调GPU性能分析工具的使用经历,如nsight、CUDA优化
  • 展示对深度学习框架源码的阅读或修改经验
  • 如有发表论文或在竞赛中获奖,务必突出
  • 熟悉Megatron/DeepSpeed源码,理解其并行策略
  • 实践使用nsight进行内核分析,掌握CUDA优化常用技巧

面试指南

  • 技术问题回答可采用STAR法则,先讲背景和任务,再说具体动作,突出数据分析和工具使用
  • 性能优化问题要体现系统性思维:先性能剖析,再定位瓶颈,给出优化方案,最后验证效果
  • 请描述一次大模型分布式训练调优的过程,如何定位性能瓶颈?
  • 你对Megatron的张量并行和数据并行有什么理解?
  • 如何优化一个PyTorch模型使其在GPU上更快?
  • 什么是精度调优?常见方法有哪些?
  • 如果MLU上算子性能差,你会如何调试?
  • 复习分布式训练原理和并行策略

职位点评

78
综合评分

AI芯片大模型优化,技术前沿,薪资优厚,但工作强度可能较高。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
该职位最合适追求技术成长和职业发展的求职者,尤其是对AI芯片和底层优化充满热情,能够接受高强度工作节奏的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利82
成长发展95
工作生活40
使命价值85

薪资福利

82较高

该职位薪资在AI芯片行业具有竞争力,公司已上市,提供稳定平台和良好福利预期。

薪资信号未披露(AI估算:22K-40K/月)

成长发展

95较高

技术前沿,涉及大模型与芯片协同优化,成长空间巨大。

技术前沿前沿/新兴技术
技术栈Megatron、DeepSpeed、CUDA、PyTorch、性能优化、分布式训练
业务类型profit_center

工作生活

40较低

工作地点上海,默认现场办公,未提及弹性或远程,强度可能较高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

国产AI芯片自主研发,支持大模型生态,使命感强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs