
英伟达
Senior Software Engineer, Automation Infrastructure
Senior Software Engineer, Automation Infrastructure
发布于 大约 1 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
软件工程
Ai/Ml
CI/CD
分布式系统
加速计算
性能测试
自动化
AI 估算 · 35k–55k
NVIDIA全球巨头,上海资深系统工程师,AI基础设施领域需求旺盛,薪资竞争力强,综合市场水平估算。
职位详情
关于这个职位
该职位负责构建英伟达性能实验室(PerfLab)的下一代基准测试基础设施,专注于自动化测试、性能分析和AI工作负载评估
你将独立负责平台组件,从问题发现、技术设计到生产部署和维护,并与全球团队合作
适合具备深厚系统软件功底、热爱解决复杂工程问题、对AI加速计算充满热情的工程师
最低要求
计算机科学、计算机工程、电气工程或相关领域的学士或硕士学位,或同等的实践经验
年以上系统软件、基础设施、开发者平台、分布式系统或生产自动化方面的相关软件工程经验
扎实的Python编程和软件工程技能,具备构建生产级工具、服务或自动化框架的经验
对Linux和系统级概念(如进程、并发、网络、存储、资源管理、故障处理)有深入理解
具有容器和至少一种工作负载编排、调度或分布式计算平台的实际操作经验,以及设计具有清晰接口、测试、可观测性和恢复行为的可靠系统或管线的经验
对机器学习、AI或加速计算工作负载有基本了解,并对其性能和质量的评估方法感兴趣
强大的分析和解决问题的能力,能够有效管理多个优先级,适应快速变化的环境
高度自驱,能够识别有价值的问题,将模糊需求转化为清晰的技术计划,并推动项目落地和采纳
优秀的沟通和组织能力,能够协调跨职能干系人,与全球分布式团队合作,推动新想法落地
工作职责
设计、构建和维护可复用的软件、服务和工作流,实现基准定义、执行、结果收集、验证和报告的自动化,覆盖本地、集群和云原生环境
按需执行性能测试和分析,深入理解现有性能工作流和基础设施,将实际需求转化为可扩展、用户友好的解决方案
提高大规模基准测试活动的可靠性、可扩展性、可观测性和可复现性
诊断跨应用、Linux系统、容器、分布式作业、计算资源、网络和存储的复杂问题
与性能工程师、质保团队、产品团队及其他客户建立牢固伙伴关系,共同设定目标、组织执行,推动新想法从概念到落地
为技术设计、代码评审、文档以及内部或开源基础设施项目做出贡献
应用AI辅助自动化,在基准创建、故障分类、数据分析或工程生产力提升方面带来有意义改进
优先资格
具有GPU或AI基础设施、分布式训练或推理、模型评估或性能基准测试的经验
具有构建工作流引擎、调度器、实验平台、测试框架或开发者基础设施的经验
具有在生产环境中运维分布式或云原生系统的经验,包括性能分析、容量分析、资源调度或多节点工作负载
实际使用AI代理、工具调用或编码代理来自动化工程工作流的经验
对开源基础设施或开发者工具有贡献,或有发起自动化项目减少人工工作、提高可靠性或帮助团队加速的经验
AI 洞察
优缺点分析
优点
- 平台顶尖,能接触NVIDIA全球核心AI技术栈
- 涉及前沿领域(LLM、Agentic AI),技术成长空间大
- 公司品牌和薪酬福利在行业内有竞争力
- 对系统底层能力要求高,需要处理复杂分布式问题
- 工作节奏可能较快,多项任务并行,需较强抗压能力
- 适合热爱系统软件和基础设施、喜欢解决复杂技术问题、具备高度自驱力和协作能力,并对AI技术有浓厚兴趣的资深工程师
缺点 / 挑战
- 工作内容有挑战性和自主性,能独立负责重要组件
- 基础设施类岗位需要与服务方和多方协调,沟通成本较高
角色解读
- 可向技术专家或架构师方向发展,深耕AI基础设施开发
- 有机会主导跨团队项目,逐步承担技术领导职责
- 可转移至AI平台、云原生基础设施等前沿领域
- 构建和优化自动化基准测试平台,涵盖定义、执行、数据收集与报告
- 参与性能分析与诊断,定位跨系统、容器和分布式环境的问题
- 推动平台组件从设计到落地,并与全球团队协作
- 应用AI辅助工具提升工程效率,如自动化故障分类和数据解析
- 扎实的Python编程能力,能构建生产级工具和服务
- 深入理解Linux系统和分布式系统原理
- 熟悉容器和编排平台(如Kubernetes)
- 具备AI/ML或加速计算的基础知识,了解性能评估方法
申请策略
- 研究NVIDIA PerfLab的公开资料,了解其基准测试技术栈
- 在简历中突出你推动项目落地的能力,用故事体现自驱和影响力
- 突出你在生产环境构建自动化系统的具体项目,量化效果(如性能提升、效率提高)
- 强调Python和分布式系统的深度经验,展示复杂故障排查案例
- 体现你在容器/Kubernetes上的实际运维或开发经验
- 如有AI/ML相关背景或高性能计算经验,务必重点提及
- 补充Kubernetes和云原生生态的实战经验
- 了解GPU编程或AI加速原理(如CUDA、TensorRT)
面试指南
- 采用STAR法则:情境-任务-行动-结果,突出个人贡献和量化结果
- 对技术问题,先理清问题边界,再结合系统原理分层分析,最后给出可验证的解决方案
- 对AI应用问题,强调问题识别、工具选型和实际效果,避免泛泛而谈
- 请描述你设计过的一个自动化基础设施系统,包括架构和权衡
- 如何诊断一个跨容器和分布式环境的性能瓶颈?
- 你如何设计一个可靠且可扩展的基准测试流水线?
- 讲讲你在Kubernetes上部署和编排工作负载的经验
- 如何利用AI自动化提升工程效率?举例说明
职位点评
77
综合评分
AI基础设施领域的前沿技术岗,薪资优厚,发展空间大,但工作节奏和WLB存在不确定性。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合以快速成长和前沿技术为核心驱动力,能够适应一定工作压力、追求职业发展的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活60
使命价值80
薪资福利
80较高
薪资未在JD中透露,但英伟达作为行业巨头,薪酬和福利处于市场领先水平,加上上海的高薪科技行业,补偿性动机总体较强。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
85较高
职位涉及前沿AI基础设施和大语言模型等新兴技术栈,能提供丰富技术成长机会,属于高发展性岗位。
技术前沿前沿/新兴技术
技术栈Python、Linux、Kubernetes、分布式系统、GPU、AI/ML、加速计算、性能测试
业务类型cost_center
工作生活
60中等
JD未提及远程或灵活办公,工作地点在上海,生活便利度不错,但加班情况不明,生活方式保障中等。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
公司处于AI高速增长赛道,工作直接影响AI计算效率,社会价值较高,能带来较强的使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
英伟达 的其他在招职位
相似职位推荐
Watch Jobs