Nvidia logo
英伟达
Senior Software Engineer, Automation Infrastructure

Senior Software Engineer, Automation Infrastructure

发布于 大约 1 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
平台工程
Automation
Gpu

AI 估算 · 45k–75k

NVIDIA资深基础设施工程师,AI行业头部公司,薪资竞争力强,结合上海市场和6年以上经验,月薪4.5-7.5万合理。

职位详情

关于这个职位

该职位位于英伟达性能实验室(PerfLab),负责构建和优化AI与加速计算工作负载的自动化基准测试基础设施

你将主导平台架构设计、跨层问题诊断和全球团队协作,将复杂实验转化为可靠、可复现的工作流,直接影响公司对前沿AI技术的评估与决策
适合具备深厚系统软件背景、热爱基础设施自动化和技术领导力的资深工程师

最低要求

计算机科学、计算机工程、电子工程或相关领域的学士或硕士学位,或同等实践经验

具有6年以上系统软件、基础设施、开发者平台、分布式系统或生产自动化方面的相关软件工程经验
具备较强的Python编程和软件工程能力,有构建和运维生产级工具、服务或自动化框架的成功记录
对Linux及系统级概念(如进程、并发、网络、存储、资源管理、故障处理)有深入理解
在容器和工作负载编排、调度或分布式计算平台方面具有丰富经验,包括设计具有清晰接口、测试、可观测性和恢复行为的可靠系统
了解机器学习、AI或加速计算工作负载,并能推理其性能、质量和运营权衡
在复杂的跨职能项目中表现出技术领导力,包括定义架构、管理技术风险、解决模糊性,并推动解决方案落地和采用
具备优秀的分析和解决问题的能力,能够有效确定优先级,管理多个项目,并在不断变化的动态环境中适应
具有出色的沟通、组织和影响力技能,能够协调全球分布的协作者并推动决策
有指导工程师、提升工程质量并帮助团队做出更好技术决策的经验

工作职责

定义PerfLab基准测试基础设施主要领域的技术方向和架构,将不断演进的业务和工程需求转化为清晰的路线图和可扩展的平台能力

主导可复用软件、服务和工作的设计与实现,自动化基准定义、执行、结果收集、验证和报告,覆盖本地、集群和云原生环境
保持对性能测试和分析的实践参与,深入理解现有工作流,并利用这些知识指导平台投资和技术决策
建立提高大型基准测试活动的可靠性、可扩展性、可观测性、可维护性和可复现性的工程方法
领导跨层复杂问题的诊断,涵盖应用程序、Linux系统、容器、分布式作业、计算资源、网络和存储
与性能工程师、QA团队、产品团队及其他客户建立牢固的合作伙伴关系,在组织间建立共识,推动高影响力的想法和项目从概念走向采用
通过架构和代码评审、清晰的决策、高工程标准和指导其他工程师来提供技术领导力
识别新兴技术(包括AI辅助自动化),并确定其在基准创建、故障分类、数据分析或工程效率方面带来有意义改进的领域
为内部和开源基础设施项目的战略和发展做出贡献,并帮助扩大其在团队中的采用

优先资格

在GPU或AI基础设施、分布式训练或推理、模型评估或性能基准测试方面有主导大型项目的经验

拥有架构化工作流引擎、调度器、实验平台、测试框架或开发者基础设施并被多个团队使用的经验
有操作大规模分布式或云原生系统的经验,包括性能剖析、容量分析、资源调度或多节点工作负载
有建立AI代理、工具调用或编码代理策略并改善团队或组织规模工程流程的实际经验
有将松散定义的跨组织问题转化为持久平台或项目并产生可量化工程影响力的成功记录

AI 洞察

优缺点分析

优点

  • 身处AI基础设施前沿,能接触最顶级的GPU和AI相关工作负载
  • 拥有自主决策和项目所有权,技术影响力大
  • 与全球顶尖工程师协作,职业平台和视野开阔
  • 在跨国协作中需适应不同时区和沟通方式
  • 适合具有强烈的系统底层兴趣、喜欢解决复杂问题、并能在高不确定性环境中自驱推进的资深工程师

缺点 / 挑战

  • 要求横跨系统、分布式、AI等多领域知识,持续学习压力大
  • 作为基础设施,需要应对复杂场景和跨团队协调的挑战

角色解读

  • 技术深度上可发展为平台架构师或基础设施技术专家
  • 管理路径上可逐步承担技术负责人或团队管理职责
  • 横向可拓展至AI基础设施、模型评估或开发者平台等方向
  • 负责性能基准测试基础设施的架构设计与开发,涵盖自动化框架、工作流编排和数据报告
  • 主导复杂系统问题的诊断,涵盖Linux、容器、分布式任务、存储和网络
  • 与全球团队协作,推动技术方案从概念到落地的全流程
  • 评估和引入新兴技术(如AI辅助自动化)以提升工程效率
  • 精通Python和系统软件工程,能构建生产级工具和服务
  • 深入理解Linux系统原理,包括进程、并发、网络和存储
  • 熟悉容器和编排平台(如Kubernetes)及分布式计算
  • 具备机器学习/AI/加速计算的基本认知,能分析其性能特征

申请策略

  • 在简历和面试中多讲“解决问题”的案例,展现你对复杂系统的驾驭力
  • 主动了解PerfLab的定位和NVIDIA的测试基础设施,思考你如何能带来改进
  • 突出你设计和搭建过的自动化测试框架或平台,展示架构决策和落地效果
  • 强调分布式系统、容器编排和性能调优的实际项目经验
  • 如有AI/GPU相关经历,重点说明你在机器学习框架或模型推理优化中的贡献
  • 展示技术领导力:例如主导跨团队项目、指导初级工程师、维护开源项目等
  • 熟悉NVIDIA生态工具(如CUDA、Nsight、Triton)和GPU性能分析
  • 了解大语言模型评测、AI Agent工作流等前沿领域

面试指南

  • 使用STAR方法(情境-任务-行动-结果)回答项目经验问题,突出技术决策和影响
  • 对于系统设计题,先明确需求边界,再逐步分解模块,考虑可靠性、扩展性和可维护性
  • 对于领导力问题,强调你的影响力、沟通策略和结果导向
  • 请描述一个你设计的自动化基础设施,它的架构和关键权衡是什么?
  • 你如何诊断一个涉及多个容器的分布式系统的性能瓶颈?
  • 如何设计一个可扩展的基准测试平台,以支持不同种类的AI模型评估?
  • 你如何在一个跨时区、跨职能的团队中推动技术方案的落地?
  • 你对GPU加速计算和AI工作负载的性能评估有哪些经验?

职位点评

75
综合评分

NVIDIA上海资深基础设施工程师,前沿AI技术栈,高薪资高挑战,现场办公。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术挑战和前沿领域、对工作生活平衡要求不高的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活55
使命价值70

薪资福利

80较高

该职位在AI头部公司,薪资通常具有竞争力,但JD未明确具体薪资范围。福利信息未披露。

薪资信号未披露(AI估算:45K-75K/月)

成长发展

85较高

前沿AI技术栈和基础设施挑战,提供深度的技术成长空间,同时兼有技术领导力锻炼。

技术前沿前沿/新兴技术
技术栈Python、Linux、Kubernetes、Distributed Systems、AI、GPU、Benchmarking、Automation
成长机会mentoring
业务类型cost_center

工作生活

55较低

JD未提及远程或弹性工作安排,工作地点在上海,可能需要现场办公。没有关于加班的明确信息,但通常基础设施岗位可能有一定压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施是高速增长赛道,对行业发展有积极影响,但作为内部性能实验室,直接社会价值表现中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs