Cambricon logo
寒武纪
大模型和分布式推理优化实习生(日常实习)

大模型和分布式推理优化实习生(日常实习)

发布于 大约 3 小时前

实习/见习

上海市
无经验要求
实习生
仅现场办公
本科
实习与临时职位
Gpu调优
Kvcache
Torch.Compile
分布式推理
多机多卡并行
大语言模型
推理优化
量化

AI 估算 · 6k–8k

实习生薪资,寒武纪上市企业,上海地区,按日薪300-400元估算,月薪约6-8k,具有行业竞争力。

职位详情

关于这个职位

该实习生职位专注于大语言模型和分布式推理的优化工作

你将参与搭建行业领先的LLM/多模态模型推理系统,通过端到端性能优化降低推理延迟、提升吞吐量,并进行精度分析与量化工具开发
适合对AI推理加速有浓厚兴趣、希望深入实践前沿技术的同学

最低要求

计算机、电子工程、自动化、数学等相关专业优先

精通Python/C++
深入理解LLM或者视觉生成模型框架和原理
深入理解量化、kvcache、多机多卡并行等加速技术
实习时间至少为6个月,每周出勤4天

工作职责

参与分布式推理系统建设,提供行业领先的LLM/多模态模型解决方案

针对大语言模型(LLM)等场景,开展端到端推理性能优化,重点降低推理延迟、提升吞吐量
针对大语言模型(LLM)等场景,开展端到端推理精度分析,提升模型精度
开发和维护大语言模型(LLM)量化工具等

优先资格

有GPU/加速卡调优实践经验

有开源仓库的贡献经验
参与过LLM或者视觉生成端到端推理优化项目,并实际落地
有集群部署经验
了解torch.compile/CUDAGraph/Triton
了解vllm, sglang, megatron, verl等

AI 洞察

优缺点分析

优点

  • 直接参与前沿大模型推理优化,技能贴合AI行业热点,积累稀缺经验
  • 寒武纪作为AI芯片上市企业,提供较好的平台资源和导师指导
  • 工作内容技术性强,能深入理解LLM从算法到工程的全链路
  • 日常实习转正机会不确定,需要主动争取并展现价值
  • 适合对AI推理优化有强烈兴趣、具备扎实编程基础和深度学习理论,并希望长期投身AI基础设施领域的学生

缺点 / 挑战

  • 实习期至少6个月且每周4天,时间投入要求较高,需平衡学业
  • 大模型优化涉及复杂系统知识,上手门槛较高,需要较强的自学能力

角色解读

  • 从实习生成长为分布式推理领域的专家,未来可转向系统架构师或算法优化工程师
  • 积累大模型部署经验后,可向AI Infra、MLOps等方向发展
  • 表现优异者有机会转正,进入寒武纪核心研发团队,参与下一代AI芯片的软件栈开发
  • 参与分布式推理系统的搭建与优化,为LLM/多模态模型提供高性能推理方案
  • 针对大语言模型进行端到端性能优化,包括降低延迟、提升吞吐量以及精度分析
  • 开发和维护LLM量化工具,支持模型部署时的精度与效率平衡
  • 精通Python和C++编程语言,能够高效实现算法和系统功能
  • 深入理解LLM或视觉生成模型的框架与原理,熟悉Transformer架构
  • 掌握量化、kvcache、多机多卡并行等主流推理加速技术
  • 了解GPU/加速卡调优、torch.compile、vllm、megatron等工具或框架者优先

申请策略

  • 在简历中明确标注实习可到岗时间和持续时长,表明稳定性
  • 面试前准备一个自己参与过的模型优化案例,用数据说话
  • 突出LLM/多模态模型相关的项目经验,尤其是涉及推理优化、性能调优的部分
  • 展示Python/C++编程能力,可附上GitHub代码仓库或开源贡献记录
  • 强调分布式系统、GPU编程(如CUDA)或量化工具的使用经历
  • 补全对大模型推理框架(如vllm、sglang)的理解,动手部署一个小型模型
  • 学习量化技术(如GPTQ、AWQ)和分布式并行策略(张量并行、流水线并行)
  • 熟悉Linux环境下的性能分析工具(如nsys、ncu)和调试技巧

面试指南

  • 对于技术问题,采用“原理+方法+案例”结构:先解释核心概念,再介绍常用优化手段,最后结合自己的项目或学习经历说明
  • 对于开放性问题,展示系统性思维:从问题定义、可能的方案对比、最终选择及理由、实验验证等角度回答
  • 请解释大语言模型推理中的KV Cache是什么,如何优化?
  • 在多GPU推理时,你会如何设计张量并行策略?
  • 描述一个你优化过的模型推理项目,你用到了哪些技术,取得了什么效果?
  • 如何降低LLM推理的端到端延迟?请列举至少三种方法
  • 你对量化了解多少?INT8和FP16的区别及其对精度的影响?
  • 复习Transformer架构细节、LLM推理流程(prefill+decode)

职位点评

62
综合评分

AI芯片上市公司实习生岗位,聚焦大模型推理优化,技术前沿但薪酬一般,需现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合以技能成长和前沿技术接触为首要目标的求职者,对薪资和WLB要求不高。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利30
成长发展85
工作生活50
使命价值60

薪资福利

30较低

实习生薪资相对较低,无明确福利信息,补偿性动机满足有限。

薪资信号未披露(AI估算:6K-8K/月)

成长发展

85较高

实习内容涉及前沿大模型推理优化技术,能深度参与分布式系统建设,成长性强,但未明确提及晋升或培训。

技术前沿前沿/新兴技术
技术栈大语言模型、分布式推理、量化、kvcache、torch.compile、vllm
业务类型ambiguous

工作生活

50较低

要求每周出勤4天,现场办公,未提及弹性或远程,生活化动机一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

60中等

AI基础设施对社会智能化有积极作用,行业增长强劲,但实习生角色直接影响力有限。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs