Cambricon logo
寒武纪
AI 智算平台研发工程师-27届

AI 智算平台研发工程师-27届

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
硕士
平台工程
Aiops
分布式系统
大模型

AI 估算 · 20k–28k

AI智算平台研发属于核心技术岗,硕士应届校招,上海薪资水平较高,预计月薪2-2.8万,年薪约30-42万。

职位详情

关于这个职位

作为寒武纪AI智算平台研发工程师,你将参与构建从模型开发到推理部署的一站式平台,包括高性能计算引擎、分布式训练调度、全链路监控系统、大模型对话平台等核心组件

工作涉及前后端开发、Kubernetes、性能优化与AIOps,适合对AI基础设施和系统开发感兴趣的硕士应届生

最低要求

硕士及以上学历,计算机相关专业

​​2、精通Golang/Python(至少一种),具备高性能、高并发系统开发经验
​​3、深入理解Linux系统机制(CPU调度、文件系统、网络协议栈),熟练使用perf/strace/bpftrace等性能分析工具
​​4、熟悉MySQL数据库原理与应用,掌握Git版本控制工具
​​5、具备Shell脚本开发能力,能够编写自动化运维工具
​​6、熟悉Kubernetes核心组件与工作机制,了解Docker容器技术原理
​​7、有开源社区贡献经验(GitHub项目、CNCF合并PR或技术博客)者优先
注:本岗位设置笔试环节,请留意邮件及短信通知

工作职责

负责AI智算平台核心组件研发(含前后端系统),构建从模型开发到推理部署的一站式解决方案,显著提升AI研发效率

设计高性能计算引擎,优化分布式训练/推理调度策略,有效支撑大模型训练/推理场景
研发全链路监控系统,实现秒级故障检测与自动恢复机制,确保系统高可用性
开发大模型对话平台,涵盖模型调优、智能体构建和知识库管理等核心功能模块
研发故障采集与根因分析系统,快速定位并解决智能加速卡集群运行问题
应用AIOps技术实现运维自动化,持续提升集群稳定性和可靠性

优先资格

有开源社区贡献经验(GitHub项目、CNCF合并PR或技术博客)者优先

AI 洞察

优缺点分析

优点

  • 所在赛道为AI基础设施,是当前热门方向,技术含量高,成长空间大
  • 公司为上市公司,平台稳定,能接触到大规模GPU集群和真实业务场景
  • 岗位涉及前后端、分布式、AIOps等多领域,技术栈丰富,个人能力提升快
  • 工作地点在上海,可能需要现场办公,工作节奏和强度未明确
  • 岗位设置笔试环节,求职流程竞争激烈

缺点 / 挑战

  • 校招岗位对技术深度要求较高,需要同时掌握系统、网络、容器等多方面知识
  • 适合对AI基础设施和系统研发有浓厚兴趣、喜欢挑战复杂技术问题、希望在大平台快速成长的计算机相关专业硕士应届生

角色解读

  • 从平台研发工程师起步,逐步成长为AI基础设施领域的技术专家
  • 可向分布式系统架构师、AI平台架构师方向发展
  • 也可转向AIOps、大模型工程化等前沿方向
  • 负责AI智算平台的核心组件研发,包括前后端系统,构建模型开发到推理部署的一站式解决方案
  • 设计高性能计算引擎,优化分布式训练/推理调度策略,支撑大模型训练/推理场景
  • 研发全链路监控系统和故障根因分析系统,确保集群高可用性和稳定性
  • 开发大模型对话平台,涵盖模型调优、智能体构建和知识库管理等核心功能
  • 精通Golang或Python,具备高性能、高并发系统开发经验
  • 深入理解Linux系统机制,熟练使用perf、strace、bpftrace等性能分析工具
  • 熟悉Kubernetes、Docker容器技术,了解MySQL、Shell脚本
  • 有开源社区贡献经验者优先,体现技术热情和协作能力

申请策略

  • 提前了解寒武纪的AI芯片和平台产品,在面试中展现对业务的兴趣
  • 关注笔试通知,复习数据结构、算法和操作系统基础知识
  • 突出Golang/Python的项目经验,尤其是高并发、高可用系统开发案例
  • 展示对Linux系统机制的理解,如有性能调优、故障排查经历更佳
  • 强调Kubernetes/Docker使用经验,以及任何分布式系统相关项目
  • 如有GitHub开源贡献或技术博客,务必重点列出
  • 系统学习Kubernetes核心组件和调度原理,练习部署和管理集群
  • 深入阅读MySQL源码或优化经验,掌握常见性能瓶颈排查方法

面试指南

  • 采用STAR原则:说明情境、任务、行动和结果,突出技术决策和量化效果
  • 对于系统排查类问题,展示系统性思维:从现象→假设→验证→根因→解决方案
  • 结合JD要求,将回答关联到实际应用场景,体现对AI智算平台的理解
  • 请介绍一个你参与过的高并发系统项目,如何设计架构并解决性能问题?
  • Kubernetes中Pod调度是怎样的过程?如何优化调度策略?
  • 如何定位Linux系统CPU使用率过高的问题?请说明排查步骤
  • 大模型训练时如何实现分布式训练?数据并行和模型并行有何区别?
  • 假设集群出现网络延迟异常,你会如何设计监控和告警机制?

职位点评

77
综合评分

前沿AI平台研发岗位,技术成长快、薪资竞争力强,但需现场办公且WLB不明确。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术成长和职业发展的应届硕士,能接受现场办公和一定工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展88
工作生活55
使命价值75

薪资福利

80较高

作为上市AI公司,薪资水平有竞争力,但JD未透露具体福利,综合评定较好。

薪资信号未披露(AI估算:20K-28K/月)

成长发展

88较高

岗位涉及AI智算平台、大模型、AIOps等前沿技术,能快速积累分布式系统和AI基础设施经验,成长空间大。

技术前沿前沿/新兴技术
技术栈Golang、Python、Kubernetes、Docker、Linux、AIOps、大模型、分布式训练
业务类型ambiguous

工作生活

55较低

工作地点在上海,要求现场办公,JD未提及弹性或远程,生活节奏可能受通勤和加班影响。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

AI智算平台推动AI技术落地,具备技术价值和社会意义,但JD未强调使命导向。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs