Cambricon logo
寒武纪
AI基础设施研发工程师-27届

AI基础设施研发工程师-27届

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
硕士
平台工程
Aiops

AI 估算 · 20k–35k

AI基础设施方向,硕士校招,上海地区薪资较高,寒武纪上市平台,15薪估算。

职位详情

关于这个职位

该职位主要负责智能加速卡Kubernetes插件的深度开发,实现算力资源池化与调度优化,并研发容器运行时和调度器扩展功能,提升大规模集群的管理效率

同时涉及故障采集与根因分析,应用AIOps实现运维自动化,保障集群稳定运行
适合对云原生和AI基础设施感兴趣的硕士应届生

最低要求

硕士及以上学历,计算机相关专业

精通Golang/Python(至少一种),具备高性能、高并发系统开发经验
深入理解Linux系统机制(CPU调度、文件系统、网络协议栈),熟练使用perf/strace/bpftrace等性能分析工具
熟悉MySQL数据库原理与应用,掌握Git版本控制工具
具备Shell脚本开发能力,能够编写自动化运维工具
熟悉Kubernetes核心组件与工作机制,了解Docker容器技术原理
有开源社区贡献经验(GitHub项目、CNCF合并PR或技术博客)者优先

工作职责

深度开发智能加速卡Kubernetes插件,实现算力资源池化管理,优化拓扑感知调度以降低通信延迟

研发容器运行时与调度器扩展功能,提升大规模集群任务编排效率与生命周期管理能力
研发故障采集与根因分析系统,快速定位并解决智能加速卡集群运行问题
应用AIOps技术实现运维自动化,持续提升集群稳定性和可靠性

优先资格

有开源社区贡献经验(GitHub项目、CNCF合并PR或技术博客)者优先

AI 洞察

优缺点分析

优点

  • 身处AI基础设施领域,技术栈前沿(Kubernetes、AIOps、高性能计算),学习机会多
  • 寒武纪作为AI芯片上市公司,平台稳定,能接触真实大规模智能加速卡集群
  • 对开源贡献有偏好,可能有机会参与CNCF等开源社区,扩大行业影响力
  • 需要扎实的底层系统知识,对Linux内核、调度机制有深入理解,学习曲线陡峭
  • 校招岗位竞争激烈,且设有笔试环节,对算法和系统基础要求高
  • 适合对云原生和AI基础设施有强烈兴趣、具备扎实计算机基础、愿意深入底层系统研究的硕士应届生

缺点 / 挑战

  • 工作内容涉及底层系统和分布式调度,技术挑战大,成长速度快
  • 工作涉及大规模集群运维,可能面临较高的责任压力,需要应对复杂故障

角色解读

  • 从云原生基础设施工程师起步,逐步成为AI集群调度和平台架构专家
  • 积累大规模分布式系统经验,可向技术专家或架构师方向发展
  • 借助AI芯片行业的高速增长,可横跨算力调度、运维自动化、云原生等前沿领域
  • 开发智能加速卡Kubernetes插件,实现算力资源池化和拓扑感知调度,降低分布式训练通信延迟
  • 扩展容器运行时和调度器,提升大规模集群的任务编排效率和生命周期管理能力
  • 构建故障采集与根因分析系统,高效定位智能加速卡集群运行中的问题
  • 应用AIOps技术推动运维自动化,持续提升集群的稳定性和可靠性
  • 精通Golang或Python,具备高性能、高并发系统开发经验
  • 深入理解Linux内核机制(CPU调度、文件系统、网络栈),熟练使用性能分析工具
  • 熟悉Kubernetes核心组件、工作原理和Docker容器技术
  • 掌握MySQL、Shell脚本,有Git和自动化运维工具开发能力

申请策略

  • 关注寒武纪的技术博客和开源项目,在面试中展现对AI芯片生态的理解
  • 提前准备笔试,复习数据结构、操作系统和网络协议等核心知识
  • 突出Kubernetes、Docker等容器化项目经验,尤其是集群调度或资源管理相关实践
  • 强调Golang/Python高并发、高性能系统开发的项目,展示技术深度
  • 如有Linux性能调优或故障排查案例,详细描述解决过程和效果
  • 列出GitHub或CNCF贡献记录、技术博客,体现开源参与度
  • 系统学习Kubernetes调度器和控制器扩展机制,动手实现一个Operator或自定义调度器
  • 深入练习perf/strace/bpftrace等工具,掌握系统瓶颈分析方法

面试指南

  • 使用STAR法则:先说明背景和任务,再描述具体行动,最后量化结果
  • 对于系统设计问题,从功能需求、架构选型、关键难点、扩展性四个维度展开
  • 对于故障排查问题,结合具体工具(strace、perf、kubectl)说明定位路径
  • 解释Kubernetes调度器的工作流程,如何实现自定义调度插件?
  • 如何排查Kubernetes集群中Pod启动慢的问题?你会使用哪些工具?
  • 设计一个大规模集群的故障根因分析系统,关键组件有哪些?
  • Golang中如何实现高并发网络服务?谈谈你的优化经验
  • 描述一次你参与的开源项目贡献,遇到了什么技术挑战?

职位点评

67
综合评分

AI芯片大厂校招,前沿技术栈,高成长性,但薪资未明示且工作强度可能较高。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
该职位最适合追求技术快速成长、愿意接受挑战、对AI基础设施有热情的求职者,对工作生活平衡要求高的人需谨慎。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展88
工作生活40
使命价值70

薪资福利

60中等

JD未披露薪资,但上市公司校园招聘一般提供有竞争力的薪酬和福利,补偿性动机得到一定满足。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

88较高

技术栈前沿,涉及Kubernetes、AIOps、高性能计算,且有开源贡献机会,发展性动机能得到很好满足。

技术前沿前沿/新兴技术
技术栈Kubernetes、Golang、Python、Linux、MySQL、Shell、AIOps、Docker
业务类型ambiguous

工作生活

40较低

仅现场办公,JD未提及弹性工作或WLB相关信息,可能面临较大工作强度,生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI芯片行业高速增长,虽然JD未明确社会使命,但技术本身具有推动智能化发展的意义,意义感动机中等偏上。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs