
寒武纪
大模型训练优化工程师-27届
大模型训练优化工程师-27届
发布于 大约 8 小时前普通员工/个人贡献者
上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Cuda
Deepspeed
Gpu
Megatron
Pytorch
分布式训练
大模型
性能优化
AI 估算 · 22k–40k
AI芯片大模型优化岗位,技能门槛高,上海薪资竞争力强,校招薪酬丰厚
职位详情
关于这个职位
该职位负责在寒武纪AI芯片上优化大模型训练性能,涉及分布式训练、精度调优和 Benchmark 优化
你将接触前沿的 AI 芯片与大模型技术,与顶尖团队合作,推动国产芯片生态发展
适合对高性能计算和深度学习充满热情的同学
最低要求
EECS或相关专业,本科或硕士以上学历
熟悉 Megatron,deepseed 等分布式框架,有实际大规模分布式训练经验
对大模型、多模态、强化学习中的某一个场景有一定的积累和见解
有GPU性能优化分析和精度调优经验,熟练掌握 nvprof, nvvp, nsight 和 valgrind 等性能分析工具
熟悉掌握一种或以上主流框架(TensorFlow/ PyTorch等)
熟练操作Linux系统,熟练掌握C/C++/Python/Shell,有扎实的编程基础和调试经验
工作职责
负责客户AI模型在寒武纪人工智能芯片(MLU)上的端到端性能优化和精度调优,及时总结可泛化的实践,开发性能/精度分析工具
负责寒武纪model zoo的开发和维护,在寒武纪人工智能芯片上进行SOTA算法复现,并进行性能优化分析和精度调优,形成领域参考解决方案
针对公开的或私有的AI Benchmark(如MLPerf等)进行端到端的优化,并密切跟踪评估各AI平台厂商的优化技术实践,最大化MLU在这些benchmark上的表现
优先资格
对数据/模型并行等分布式方案有一定的见解和经验
对量化训练有一定的见解和经验
对一种或以上主流框架(TensorFlow/PyTorch等)有开发者视角的理解,对框架设计或者调优有一定的见解和经验
熟悉并喜欢高性能优化,对CUDA/OpenCL/BANG/C/OpenMP等并行计算模型有一定的开发经验
熟悉GPGPU/MLU/CPU微架构,对软硬件联合优化有一定的见解和经验
AI 洞察
优缺点分析
优点
- 国产AI芯片领军企业,技术前沿,可深度接触大模型与芯片协同设计
- 项目与行业顶尖客户合作,参与国际Benchmark,成长速度极快
- 公司已上市,发展稳定,薪酬福利有竞争力
- 大模型优化难度高,需要扎实的底层系统和并行计算知识
- 工作强度可能较大,需适应快节奏的技术迭代
- 芯片生态尚在成长,部分工具链不如GPU成熟,需要有耐心和钻研精神
缺点 / 挑战
- 适合对高性能计算有浓厚兴趣,喜欢技术挑战,愿意深入底层并追求极致性能的应届生
角色解读
- 技术方向:成为大模型性能优化专家,深入AI芯片底层架构和编译优化
- 横向发展:可转向AI框架开发、编译器优化或芯片验证等方向
- 管理方向:未来可带领团队负责整体性能优化生态建设
- 负责客户AI模型在寒武纪MLU芯片上的性能优化和精度调优,开发性能/精度分析工具
- 开发和维护Model Zoo,在芯片上复现SOTA算法并进行优化,形成参考解决方案
- 参与MLPerf等AI Benchmark的端到端优化,跟踪行业技术实践,最大化MLU性能表现
- 熟悉分布式训练框架(Megatron/DeepSpeed)并具备大规模训练经验
- 掌握GPU性能分析工具(nvprof/nsight等)和精度调优方法
- 熟练使用C++/Python/Linux,至少熟悉一种主流深度学习框架
- 了解数据/模型并行、量化训练等分布式优化方案
申请策略
- 关注寒武纪官方招聘动态,内推可提高简历曝光
- 面试前准备对AI芯片行业趋势的见解,展现对国产芯片的热情
- 突出分布式训练项目经验,如大规模模型训练调优的具体案例
- 强调GPU性能分析工具的使用经历,如nsight、CUDA优化
- 展示对深度学习框架源码的阅读或修改经验
- 如有发表论文或在竞赛中获奖,务必突出
- 熟悉Megatron/DeepSpeed源码,理解其并行策略
- 实践使用nsight进行内核分析,掌握CUDA优化常用技巧
面试指南
- 技术问题回答可采用STAR法则,先讲背景和任务,再说具体动作,突出数据分析和工具使用
- 性能优化问题要体现系统性思维:先性能剖析,再定位瓶颈,给出优化方案,最后验证效果
- 请描述一次大模型分布式训练调优的过程,如何定位性能瓶颈?
- 你对Megatron的张量并行和数据并行有什么理解?
- 如何优化一个PyTorch模型使其在GPU上更快?
- 什么是精度调优?常见方法有哪些?
- 如果MLU上算子性能差,你会如何调试?
- 复习分布式训练原理和并行策略
职位点评
78
综合评分
AI芯片大模型优化,技术前沿,薪资优厚,但工作强度可能较高。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
该职位最合适追求技术成长和职业发展的求职者,尤其是对AI芯片和底层优化充满热情,能够接受高强度工作节奏的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利82
成长发展95
工作生活40
使命价值85
薪资福利
82较高
该职位薪资在AI芯片行业具有竞争力,公司已上市,提供稳定平台和良好福利预期。
薪资信号未披露(AI估算:22K-40K/月)
成长发展
95较高
技术前沿,涉及大模型与芯片协同优化,成长空间巨大。
技术前沿前沿/新兴技术
技术栈Megatron、DeepSpeed、CUDA、PyTorch、性能优化、分布式训练
业务类型profit_center
工作生活
40较低
工作地点上海,默认现场办公,未提及弹性或远程,强度可能较高。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
国产AI芯片自主研发,支持大模型生态,使命感强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
寒武纪 的其他在招职位
相似职位推荐
Watch Jobs