Cambricon logo
寒武纪
大模型训练优化工程师

大模型训练优化工程师

发布于 大约 3 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Deepspeed
Gpu优化
Megatron
Pytorch
Tensorflow
分布式训练
大模型
性能优化

AI 估算 · 30k–55k

大模型优化属前沿领域,市场需求旺盛,寒武纪为上市芯片公司,北京薪资水平较高,中级工程师月薪约3-5.5万。

职位详情

关于这个职位

该职位专注于在寒武纪人工智能芯片上进行大模型训练和推理的性能优化与精度调优,涉及分布式训练框架(如Megatron/DeepSpeed)和GPU优化工具

你将维护模型库、复现SOTA算法并参与AI Benchmark竞赛,是AI芯片生态建设的关键角色

最低要求

EECS或相关专业本科或硕士以上学历

熟悉Megatron,deepseed等分布式框架,有实际大规模分布式训练经验
对大模型、多模态、强化学习中的某一个场景有一定的积累和见解
有GPU性能优化分析和精度调优经验,熟练掌握nvprof, nvvp, nsight和valgrind等性能分析工具
熟悉掌握一种或以上主流框架(TensorFlow/ PyTorch等)
熟练操作Linux系统,熟练掌握C/C++/Python/Shell,有扎实的编程基础和调试经验
年以上大模型性能优化和精度调试经验

工作职责

负责客户AI模型在寒武纪人工智能芯片(MLU)上的端到端性能优化和精度调优,及时总结可泛化的实践,开发性能/精度分析工具

负责寒武纪model zoo的开发和维护,在寒武纪人工智能芯片上进行SOTA算法复现,并进行性能优化分析和精度调优,形成领域参考解决方案
针对公开的或私有的AI Benchmark(如MLPerf等)进行端到端的优化,并密切跟踪评估各AI平台厂商的优化技术实践,最大化MLU在这些benchmark上的表现

优先资格

对数据/模型并行等分布式方案有一定的见解和经验

对量化训练有一定的见解和经验
对一种或以上主流框架(TensorFlow/PyTorch等)有开发者视角的理解,对框架设计或者调优有一定的见解和经验
熟悉并喜欢高性能优化,对CUDA/OpenCL/BANG/C/OpenMP等并行计算模型有一定的开发经验
熟悉GPGPU/MLU/CPU微架构,对软硬件联合优化有一定的见解和经验

AI 洞察

优缺点分析

优点

  • 技术前沿性强,直接参与大模型和国产芯片的核心环节
  • 寒武纪作为国产AI芯片领军,平台资源和行业影响力大
  • 积累稀缺的芯片性能优化经验,职业护城河高
  • 芯片生态尚不完善,调试和优化工作可能较为繁琐
  • 对分布式、高性能计算能力要求高,学习曲线陡峭
  • 适合对底层性能优化有热情、喜欢研究并行计算和系统调优的工程师

缺点 / 挑战

  • benchmark压力大,需要在竞争中持续提升性能

角色解读

  • 深耕AI芯片性能优化领域,成为软硬件协同调优专家
  • 向AI系统架构师方向发展,设计高效训练/推理方案
  • 横向拓展至AI算法或芯片设计岗位,积累全栈经验
  • 针对客户AI模型在寒武纪芯片上进行性能与精度调优,开发自动化分析工具
  • 维护和扩展模型库,复现最新算法并形成行业参考方案
  • 参与AI Benchmark(如MLPerf)优化,提升芯片在标准测试中的表现
  • 掌握分布式训练框架(Megatron/DeepSpeed)及大规模训练经验
  • 精通GPU性能分析工具(nvprof、nsight等)和精度调优方法
  • 熟练使用C/C++、Python、Shell,有Linux下的调试能力
  • 了解大模型、多模态或强化学习等场景的技术细节

申请策略

  • 在简历中突出对国产芯片的热情和实际优化成果
  • 关注寒武纪技术博客和MLPerf成绩,展示行业认知
  • 突出大规模分布式训练经验,包括框架选择和优化效果
  • 展示性能优化案例,附上具体指标(如吞吐、显存提升)
  • 强调多框架掌握程度(PyTorch/TensorFlow)和C++/Python熟练度
  • 补充GPU微架构知识(如SM、warp调度)和性能分析工具深度使用
  • 学习量化训练(QAT/PTQ)和模型并行策略
  • 了解寒武纪MLU架构及BANG编程语言

面试指南

  • 使用STAR法则:背景-任务-行动-结果,突出量化指标
  • 从系统层面分析问题:计算瓶颈/显存瓶颈/通信瓶颈,对应策略
  • 对比不同方案优劣,展现技术深度和决策能力
  • 请介绍一个你做过的大模型性能优化案例,从问题到解决方案
  • Megatron和DeepSpeed的主要区别是什么?各自适用场景?
  • 在分布式训练中,如何实现数据并行和模型并行混合?显存如何优化?
  • 你对量化训练的了解?PTQ和QAT的优缺点?
  • 如何利用nsight分析kernel性能瓶颈?举例说明

职位点评

72
综合评分

国产芯片大模型优化,技术前沿,发展空间大,但WLB一般需现场办公。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和行业意义,对工作地点灵活性要求不高,愿意投入时间钻研的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值85

薪资福利

70中等

薪资水平具有竞争力,但职位描述未明确具体薪资和福利,补偿性动机部分满足。

薪资信号未披露(AI估算:30K-55K/月)

成长发展

85较高

处于大模型和AI芯片前沿技术领域,技能成长空间大,但JD未提及晋升通道,发展性动机较高。

技术前沿前沿/新兴技术
技术栈Megatron、DeepSpeed、GPU优化、CUDA、分布式训练、大模型、量化训练、MLPerf
业务类型ambiguous

工作生活

50较低

仅现场办公,无远程或弹性工作说明,未提及WLB信息,生活化动机满足有限。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

85较高

国产芯片行业高速增长,推动AI技术自主可控,具有较强社会意义,但JD未提及使命愿景。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs