
腾讯
边缘基础设施运维工程师
边缘基础设施运维工程师
发布于 大约 6 小时前普通员工/个人贡献者
深圳市
中级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Gpu
硬件故障诊断
网络运维
边缘计算
Nvidia A100
AI 估算 · 25k–45k
腾讯大厂中高级运维岗位,GPU/K8s硬技能稀缺,薪资竞争力强,16薪合理。
职位详情
关于这个职位
作为腾讯边缘基础设施运维工程师,你将负责GPU服务器、网络设备和Kubernetes集群的全生命周期管理,保障边缘算力平台的高可用与高效交付
该岗位需要扎实的硬件故障处理、网络协议和云原生运维技能,适合有志于在云计算和边缘计算领域深耕的技术人才
最低要求
硬性条件
学历:计算机、通信、电子信息等相关专业本科及以上学历
经验:3 年以上运维/DevOps/SRE 相关工作经验,其中至少 1 年 Kubernetes 生产环境运维经验
硬件能力:熟悉 x86 服务器硬件架构,具备 GPU 服务器运维经验,能独立完成硬件故障诊断和更换
网络能力:理解 TCP/IP 协议栈、VLAN/VXLAN、BGP/OSPF 等路由协议,有交换机 CLI 配置经验
持有 CCNA/HCIA 或以上认证者优先
云原生能力:
熟练使用 Docker/containerd 等容器运行时
熟练掌握 Kubernetes 核心原理与运维,有大规模集群管理经验(50+ 节点)
了解 GPU Operator、NVIDIA Device Plugin、GPU 调度方案
编码能力:熟练使用至少一种脚本语言(Python/Go/Shell),具备自动化工具开发能力
监控与可观测性:熟悉 Prometheus、Grafana监控体系搭建和使用
Linux:深入理解 Linux 操作系统,熟练掌握常用命令、性能分析工具(top/sar/perf/strace 等)和系统调优
工作职责
物理基础设施纳管
负责边缘机房 GPU 服务器(NVIDIA A100/H100/L40S 等)、CPU 服务器、存储节点等物理设备的全生命周期管理,包括上架验收、固件/驱动升级、故障诊断与硬件替换
建立和维护硬件资产台账与自动化纳管流程,保障设备信息准确、可追溯
制定并执行硬件巡检计划,定期输出设备健康度报告,对硬件 EOL/EOS 风险进行预警和替换规划
边缘网络与机房运维
负责边缘机房网络设备(交换机、路由器、防火墙等)的标准化配置、日常监控和故障处理,确保边缘节点到中心管控面的网络连通性与低延迟
维护机房网络拓扑文档,参与带宽规划、链路冗余设计和网络割接
与 IDC/运营商对接,处理机房环境(电力、制冷、机架空间)相关事宜,保障基础设施 SLA
容器化平台与云原生运维
管理和维护基于 Kubernetes 的边缘容器平台,负责集群部署、版本升级、节点扩缩容和资源调度策略优化
实现 GPU 资源的容器化纳管:包括 GPU 驱动兼容性管理、GPU Operator 部署、MIG(多实例 GPU)配置、GPU 共享与隔离策略
建设面向外部客户的算力交付流水线:容器镜像管理、Helm Chart 标准化、命名空间/租户隔离、配额管理、监控告警接入
维护平台核心组件(包括但不限于 GPU Operator、Prometheus/Grafana 监控栈、Loki/ELK 日志系统、分布式存储 CSI 插件、Ingress Controller、Service Mesh 等)
服务保障与持续优化
建立并维护 SLO/SLI/SLA 指标体系,保障服务的可用性、性能和容量
编写运维自动化脚本和工具,推动运维操作代码化(Infrastructure as Code),减少人工操作
参与 on-call 轮值,及时响应和处理生产环境故障,输出故障复盘报告
持续关注云原生和边缘计算社区技术动态,推动基础设施架构演进
优先资格
加分项
有边缘计算场景(Edge Computing)或分布式云平台的运维经验
有 Terraform/Ansible/SaltStack 等 IaC 工具实践经验
了解 GPU 算力切分方案(MIG/vGPU/时分复用等),有 GPU 资源池化运营经验
有面向外部客户(toB)的平台运维或技术支持经验
熟悉国内主流 GPU 硬件(昇腾、寒武纪、海光等)生态者优先
AI 洞察
优缺点分析
优点
- 腾讯平台资源丰富,接触前沿 GPU 和云原生技术
- 边缘计算是未来趋势,岗位成长空间大
- 薪资福利优厚,大厂背书为职业发展加分
- 技术要求全面,硬件、网络、云原生均需深入掌握
- 适合热爱基础设施运维、喜欢解决复杂问题、对云原生和 GPU 技术有浓厚兴趣的工程师
缺点 / 挑战
- 需参与 on-call 轮值,生产环境故障处理压力较大
角色解读
- 可向 SRE 架构师或边缘计算平台专家方向发展
- 有机会参与大规模分布式系统设计,晋升技术专家或团队 leader
- 管理 GPU/CPU 服务器、网络设备和 Kubernetes 集群,保障边缘基础设施稳定运行
- 处理硬件故障、网络问题,并推动自动化运维工具建设
- 面向客户交付算力平台,持续优化资源调度和运维效率
- 扎实的 Linux 和网络基础,能独立配置交换机、诊断网络问题
- 熟练 Kubernetes 生产运维,有大规模集群管理经验
- 掌握至少一门脚本语言(Python/Go/Shell),能开发自动化工具
申请策略
- 了解腾讯边缘计算业务(如云游戏、CDN),面试时展现对业务的思考
- 突出 Kubernetes 生产环境运维经验(如集群规模、故障处理案例)
- 强调 GPU 服务器运维和硬件故障处理经历
- 展示自动化脚本开发成果(如 Prometheus 监控、自动巡检工具)
- 若缺乏边缘计算经验,可学习相关概念或搭建小型边缘集群
- 补充 GPU 虚拟化技术(MIG/vGPU)知识
面试指南
- 使用 STAR 法则:描述情境、任务、行动和结果
- 注重故障恢复时间(MTTR)和自动化改进
- 展示系统化思维和预防措施
- 描述一次你在生产环境中遇到的 Kubernetes 集群故障及其解决过程
- 如何设计一个边缘节点的 GPU 资源调度方案?
- 在硬件故障导致服务不可用时,你的应急响应流程是什么?
- 你如何监控和优化边缘节点的网络延迟?
- 讲一个你通过自动化工具提升运维效率的案例
职位点评
75
综合评分
腾讯大厂边缘基础设施岗,前沿技术栈、薪资优厚,但需现场办公和on-call。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、愿意接受挑战、对薪资有较高期望的资深运维工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活40
使命价值70
薪资福利
85较高
腾讯大厂提供具有竞争力的薪资和福利,薪资信号偏高,福利如五险一金、补充医疗等虽未在JD明确但默认存在。整体补偿性动机满足度高。
薪资信号偏高 (25K-45K/月)
成长发展
90较高
该岗位涉及GPU、Kubernetes、边缘计算等前沿技术,成长信号明显,JD虽未明确提及晋升通道,但腾讯内部有完善的技术职级体系。发展性动机满足度高。
技术前沿前沿/新兴技术
技术栈Kubernetes、GPU、边缘计算、NVIDIA A100、Prometheus、Grafana、Docker、MIG
业务类型ambiguous
工作生活
40较低
JD未明确工作模式,但腾讯核心岗位通常要求现场办公;需参与on-call轮值,加班压力可能较大。生活化动机满足度一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况明确要求弹性/高强度
使命价值
70中等
边缘计算和GPU算力平台属于高速增长赛道,对社会数字化有正向推动作用,但JD未突出使命感。意义感动机中等偏上。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs