Tencent logo
腾讯
边缘基础设施运维工程师

边缘基础设施运维工程师

发布于 大约 6 小时前

普通员工/个人贡献者

深圳市
中级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Gpu
硬件故障诊断
网络运维
边缘计算
Nvidia A100

AI 估算 · 25k–45k

腾讯大厂中高级运维岗位,GPU/K8s硬技能稀缺,薪资竞争力强,16薪合理。

职位详情

关于这个职位

作为腾讯边缘基础设施运维工程师,你将负责GPU服务器、网络设备和Kubernetes集群的全生命周期管理,保障边缘算力平台的高可用与高效交付

该岗位需要扎实的硬件故障处理、网络协议和云原生运维技能,适合有志于在云计算和边缘计算领域深耕的技术人才

最低要求

硬性条件

学历:计算机、通信、电子信息等相关专业本科及以上学历
经验:3 年以上运维/DevOps/SRE 相关工作经验,其中至少 1 年 Kubernetes 生产环境运维经验
硬件能力:熟悉 x86 服务器硬件架构,具备 GPU 服务器运维经验,能独立完成硬件故障诊断和更换
网络能力:理解 TCP/IP 协议栈、VLAN/VXLAN、BGP/OSPF 等路由协议,有交换机 CLI 配置经验
持有 CCNA/HCIA 或以上认证者优先
云原生能力:
熟练使用 Docker/containerd 等容器运行时
熟练掌握 Kubernetes 核心原理与运维,有大规模集群管理经验(50+ 节点)
了解 GPU Operator、NVIDIA Device Plugin、GPU 调度方案
编码能力:熟练使用至少一种脚本语言(Python/Go/Shell),具备自动化工具开发能力
监控与可观测性:熟悉 Prometheus、Grafana监控体系搭建和使用
Linux:深入理解 Linux 操作系统,熟练掌握常用命令、性能分析工具(top/sar/perf/strace 等)和系统调优

工作职责

物理基础设施纳管

负责边缘机房 GPU 服务器(NVIDIA A100/H100/L40S 等)、CPU 服务器、存储节点等物理设备的全生命周期管理,包括上架验收、固件/驱动升级、故障诊断与硬件替换
建立和维护硬件资产台账与自动化纳管流程,保障设备信息准确、可追溯
制定并执行硬件巡检计划,定期输出设备健康度报告,对硬件 EOL/EOS 风险进行预警和替换规划
边缘网络与机房运维
负责边缘机房网络设备(交换机、路由器、防火墙等)的标准化配置、日常监控和故障处理,确保边缘节点到中心管控面的网络连通性与低延迟
维护机房网络拓扑文档,参与带宽规划、链路冗余设计和网络割接
与 IDC/运营商对接,处理机房环境(电力、制冷、机架空间)相关事宜,保障基础设施 SLA
容器化平台与云原生运维
管理和维护基于 Kubernetes 的边缘容器平台,负责集群部署、版本升级、节点扩缩容和资源调度策略优化
实现 GPU 资源的容器化纳管:包括 GPU 驱动兼容性管理、GPU Operator 部署、MIG(多实例 GPU)配置、GPU 共享与隔离策略
建设面向外部客户的算力交付流水线:容器镜像管理、Helm Chart 标准化、命名空间/租户隔离、配额管理、监控告警接入
维护平台核心组件(包括但不限于 GPU Operator、Prometheus/Grafana 监控栈、Loki/ELK 日志系统、分布式存储 CSI 插件、Ingress Controller、Service Mesh 等)
服务保障与持续优化
建立并维护 SLO/SLI/SLA 指标体系,保障服务的可用性、性能和容量
编写运维自动化脚本和工具,推动运维操作代码化(Infrastructure as Code),减少人工操作
参与 on-call 轮值,及时响应和处理生产环境故障,输出故障复盘报告
持续关注云原生和边缘计算社区技术动态,推动基础设施架构演进

优先资格

加分项

有边缘计算场景(Edge Computing)或分布式云平台的运维经验
有 Terraform/Ansible/SaltStack 等 IaC 工具实践经验
了解 GPU 算力切分方案(MIG/vGPU/时分复用等),有 GPU 资源池化运营经验
有面向外部客户(toB)的平台运维或技术支持经验
熟悉国内主流 GPU 硬件(昇腾、寒武纪、海光等)生态者优先

AI 洞察

优缺点分析

优点

  • 腾讯平台资源丰富,接触前沿 GPU 和云原生技术
  • 边缘计算是未来趋势,岗位成长空间大
  • 薪资福利优厚,大厂背书为职业发展加分
  • 技术要求全面,硬件、网络、云原生均需深入掌握
  • 适合热爱基础设施运维、喜欢解决复杂问题、对云原生和 GPU 技术有浓厚兴趣的工程师

缺点 / 挑战

  • 需参与 on-call 轮值,生产环境故障处理压力较大

角色解读

  • 可向 SRE 架构师或边缘计算平台专家方向发展
  • 有机会参与大规模分布式系统设计,晋升技术专家或团队 leader
  • 管理 GPU/CPU 服务器、网络设备和 Kubernetes 集群,保障边缘基础设施稳定运行
  • 处理硬件故障、网络问题,并推动自动化运维工具建设
  • 面向客户交付算力平台,持续优化资源调度和运维效率
  • 扎实的 Linux 和网络基础,能独立配置交换机、诊断网络问题
  • 熟练 Kubernetes 生产运维,有大规模集群管理经验
  • 掌握至少一门脚本语言(Python/Go/Shell),能开发自动化工具

申请策略

  • 了解腾讯边缘计算业务(如云游戏、CDN),面试时展现对业务的思考
  • 突出 Kubernetes 生产环境运维经验(如集群规模、故障处理案例)
  • 强调 GPU 服务器运维和硬件故障处理经历
  • 展示自动化脚本开发成果(如 Prometheus 监控、自动巡检工具)
  • 若缺乏边缘计算经验,可学习相关概念或搭建小型边缘集群
  • 补充 GPU 虚拟化技术(MIG/vGPU)知识

面试指南

  • 使用 STAR 法则:描述情境、任务、行动和结果
  • 注重故障恢复时间(MTTR)和自动化改进
  • 展示系统化思维和预防措施
  • 描述一次你在生产环境中遇到的 Kubernetes 集群故障及其解决过程
  • 如何设计一个边缘节点的 GPU 资源调度方案?
  • 在硬件故障导致服务不可用时,你的应急响应流程是什么?
  • 你如何监控和优化边缘节点的网络延迟?
  • 讲一个你通过自动化工具提升运维效率的案例

职位点评

75
综合评分

腾讯大厂边缘基础设施岗,前沿技术栈、薪资优厚,但需现场办公和on-call。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、愿意接受挑战、对薪资有较高期望的资深运维工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活40
使命价值70

薪资福利

85较高

腾讯大厂提供具有竞争力的薪资和福利,薪资信号偏高,福利如五险一金、补充医疗等虽未在JD明确但默认存在。整体补偿性动机满足度高。

薪资信号偏高 (25K-45K/月)

成长发展

90较高

该岗位涉及GPU、Kubernetes、边缘计算等前沿技术,成长信号明显,JD虽未明确提及晋升通道,但腾讯内部有完善的技术职级体系。发展性动机满足度高。

技术前沿前沿/新兴技术
技术栈Kubernetes、GPU、边缘计算、NVIDIA A100、Prometheus、Grafana、Docker、MIG
业务类型ambiguous

工作生活

40较低

JD未明确工作模式,但腾讯核心岗位通常要求现场办公;需参与on-call轮值,加班压力可能较大。生活化动机满足度一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况明确要求弹性/高强度

使命价值

70中等

边缘计算和GPU算力平台属于高速增长赛道,对社会数字化有正向推动作用,但JD未突出使命感。意义感动机中等偏上。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs