
长江存储
AI平台架构师(J14573)
AI平台架构师(J14573)
发布于 大约 1 小时前普通员工/个人贡献者
武汉市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Cuda
Finops
Go
Gpu
Hpc
Mlops
Npu
Rdma
Rocev2
AI 估算 · 25k–45k
5年以上AI平台架构经验,K8s/GPU集群等硬核技能,武汉薪资水平中等偏高。
职位详情
关于这个职位
这是一个面向AI基础设施的架构师岗位,核心工作是搭建基于Kubernetes的算力调度平台,管理大规模GPU/NPU集群,并构建云原生MLOps体系
你将负责千卡/万卡级分布式训练环境的稳定性和性能优化,同时实现算力资源的成本管控
最低要求
教育背景:计算机、通信、电子工程等相关专业本科及以上学历
经验要求:
年以上云计算、基础架构或 HPC 相关开发经验
必须具备大型 GPU 集群(100+ 卡规模)的运维、调度或AI平台建设经验
精通 Kubernetes 架构,熟悉 Docker/Containerd
熟悉 NVIDIA GPU 架构,精通 CUDA 基础、GPU 虚拟化技术
高性能网络与存储:熟悉 RDMA、RoCEv2 网络配置与调优
熟悉并行文件系统在 AI 场景的应用
编程语言:精通 Go 或 C++等,熟悉 Python 脚本
工作职责
负责基于 Kubernetes 的 AI 算力调度平台建设,实现 GPU/NPU 等异构算力的统一纳管、池化与弹性调度
大规模分布式训练基础设施:构建支持千卡/万卡集群的稳定环境,优化高性能网络
云原生 MLOps 体系构建:打造基于云原生的模型开发、训练、部署全流程平台:实现算力资源的计量计费、多租户隔离、配额管理及成本优化(FinOps)
负责智算集群的监控告警、故障自愈及性能调优
保障任务的高可用性(SLA)
优先资格
熟悉国产算力芯片的适配与优化经验
有智算或超算中心建设或运维经验
AI 洞察
优缺点分析
优点
- 接触最前沿的AI基础设施技术栈(K8s+GPU+高性能网络),技术深度高
- 长江存储作为半导体大厂,平台稳定,项目规模大,能积累稀缺的大集群经验
- 涉及MLOps和FinOps等新兴领域,职业发展空间广阔
- 武汉生活成本相对一线城市低,薪资在当地有竞争力
- 岗位对综合能力要求极高,需同时精通K8s、GPU、网络、存储等多个领域
- 半导体行业对信息安全要求严格,工作环境可能较为封闭
- 适合有5年以上云计算/HPC经验、对AI基础设施充满热情、愿意深入钻研技术细节的资深工程师
缺点 / 挑战
- 大规模集群的稳定性保障和故障排查压力较大,可能需要on-call
角色解读
- 成为AI基础设施领域的专家,主导超大规模算力平台架构设计
- 向技术管理路线发展,带领团队负责智算中心的整体规划与建设
- 横向拓展至MLOps、AI平台产品化等方向,成为技术+产品的复合型人才
- 设计和建设基于Kubernetes的AI算力调度平台,实现GPU/NPU等异构资源的统一管理和弹性调度
- 搭建并优化支持千卡/万卡集群的分布式训练基础设施,包括高性能网络和并行存储
- 构建云原生MLOps体系,覆盖模型开发、训练、部署全流程,并实现算力计量计费、多租户隔离和成本优化
- 负责智算集群的监控告警、故障自愈和性能调优,保障服务高可用性
- 精通Kubernetes架构和Docker/Containerd容器技术,具备大规模集群运维经验
- 熟悉NVIDIA GPU架构、CUDA编程及GPU虚拟化技术,有100+卡集群实战经验
- 掌握高性能网络(RDMA/RoCEv2)和并行文件系统(如Lustre/GPFS)的配置与调优
- 精通Go或C++,熟悉Python脚本,具备系统级编程能力
申请策略
- 研究长江存储的AI业务方向,在面试中结合其半导体制造场景提出算力平台建议
- 准备一个完整的AI平台架构设计方案(从资源调度到MLOps流程),展示系统思维
- 突出GPU集群(100+卡)的实际运维或调度经验,用具体数据和案例说明
- 强调对Kubernetes架构的深入理解,如有开源贡献或二次开发经历更佳
- 展示高性能网络(RDMA/RoCEv2)和并行存储的调优成果,例如提升训练效率的百分比
- 如果熟悉国产算力芯片(如昇腾、寒武纪),务必在简历中突出
- 深入学习Kubernetes调度器原理和自定义调度器开发
- 补充MLOps工具链(如Kubeflow、MLflow、Argo Workflows)的实践经验
面试指南
- 技术问题:先讲原理和选型考虑,再结合实战案例说明遇到的问题和解决方案,最后总结最佳实践
- 设计问题:采用分层架构思路,从资源层、调度层、平台层到业务层逐步阐述,突出关键设计决策
- 故障排查:按“监控告警→日志分析→复现问题→根因定位→修复验证”的步骤回答
- 请描述你参与过的最大的GPU集群规模?如何解决通信瓶颈和资源碎片问题?
- Kubernetes调度器如何实现GPU资源的拓扑感知调度?请讲一下原理和实现
- RDMA和RoCEv2在分布式训练中如何配置和优化?遇到过哪些问题?
- 如何设计一个多租户隔离的MLOps平台?包括资源配额、数据隔离和权限管理
- 如果集群中某个训练任务一直失败,你会如何排查和定位问题?
职位点评
69
综合评分
技术前沿、发展空间大,但薪资未明、WLB不确定,适合追求技术深度的资深工程师。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合技术驱动型求职者,尤其重视技能成长和前沿技术探索,对薪资透明度要求不高。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利60
成长发展85
工作生活60
使命价值75
薪资福利
60中等
薪资未在JD中披露,但长江存储为大型半导体企业,稳定性较好;福利相关信息缺失,整体补偿性动机满足度一般。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
85较高
岗位技术栈前沿,涉及K8s、GPU、MLOps等新兴领域,能积累大规模集群经验,但JD未明确提及晋升或培训体系,发展性动机满足度较高。
技术前沿前沿/新兴技术
技术栈Kubernetes、GPU、NPU、CUDA、RDMA、RoCEv2、MLOps、FinOps
业务类型ambiguous
工作生活
60中等
工作地点武汉,仅现场办公,未提及弹性工作或加班情况;生活成本较低,但办公灵活性和WLB信息不明确。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
AI算力基础设施属于高速增长赛道,岗位具有较高技术价值和行业影响力,但JD未提及社会使命相关表述。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
长江存储 的其他在招职位
相似职位推荐
Watch Jobs