Tencent logo
腾讯
微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)

微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)

发布于 大约 8 小时前

普通员工/个人贡献者

深圳市 / 上海市
中级经验
全职员工
仅现场办公
学历未注明
平台工程
Gpu集群
任务调度
分布式系统
可观测性
大模型训练
容器
强化学习
推理
沙箱

AI 估算 · 25k–50k

腾讯大厂高级技术岗,深圳/上海/广州薪资水平高,涉及大模型基础设施,技能稀缺,月薪中位数3万+,16薪。

职位详情

关于这个职位

作为腾讯大模型研发基础设施工程师,你将负责建设和优化支撑WeLM等前沿模型研发的算力与工具平台,包括GPU/Kubernetes集群、模型评估沙箱、任务调度和可观测性系统

这个岗位直接影响大模型的数据、评估和训练迭代效率,适合对MLOps和分布式系统有深入理解的技术专家

最低要求

具备扎实的分布式系统或 ML Systems 经验,能够设计和维护持续运行的大规模生产系统

熟悉任务调度、工作流系统、容器或沙箱、Kubernetes、存储、消息系统以及可观测性中的一个或多个领域
对大模型训练、推理、评测、合成数据或强化学习 Rollout 有实际经验或强烈兴趣
能够同时关注系统可靠性与研究正确性,理解“系统成功运行”和“产生可信模型结论”之间的差异
乐于深入模型研发现场,理解研究工作流,并将快速变化的实验需求抽象为可靠、可复用的系统能力
希望自己的系统工作直接影响前沿模型的数据、评估和训练迭代,而不仅仅是优化一般软件开发流程

工作职责

面向研发迭代过程中的典型负载优化调度、路由、部署策略,优化系统吞吐和稳定性

建设并运营面向模型研发的沙箱 CPU 集群与工具执行环境,负责环境隔离、任务编排、资源调度与运行治理,保障评估和实验任务稳定执行
建设并运营 GPU 集群、Kubernetes 和数据系统,提升资源利用率、任务吞吐和端到端研发效率
负责研发生产系统的 SLA、可观测性与故障恢复,定位性能瓶颈和异常波动,保障关键任务与评估结果稳定、可复现、可诊断
与算法、评估和推理基础设施团队共同定义真实研发负载,持续演进面向前沿模型迭代的系统能力

AI 洞察

优缺点分析

优点

  • 腾讯核心业务方向,大模型基础设施属于前沿技术领域,技术含量高
  • 能接触大规模GPU集群、Kubernetes等顶尖技术栈,技能积累快
  • 团队成员优秀,与算法、推理等团队协作,学习机会多
  • 平台影响力大,工作成果直接影响前沿模型的迭代效率
  • 对综合能力要求高,需要同时掌握分布式系统、ML领域知识
  • 研发效能方向需要频繁响应算法团队的需求,工作节奏可能较快
  • 多城市办公地点(深圳/上海/广州),可能涉及一定程度的协作和沟通成本

缺点 / 挑战

  • 适合对大规模基础设施有热情、愿意深入研究大模型研发流程,并喜欢解决复杂系统挑战的技术工程师

角色解读

  • 在技术深度上,可向MLOps专家或分布式系统架构师方向发展
  • 在业务理解上,可深入大模型研发流程,成为连接算法与工程的桥梁
  • 在团队内可晋升为技术Leader,负责更大规模的平台建设与团队管理
  • 设计和维护面向大模型研发的大规模算力平台,包括GPU集群和Kubernetes环境
  • 优化任务调度、资源路由和部署策略,提升系统吞吐和稳定性
  • 建设模型评估沙箱和工具链,确保实验任务可复现、可诊断
  • 与算法团队紧密协作,将研发负载抽象为可靠的基础设施能力
  • 扎实的分布式系统设计能力,熟悉高可用生产系统架构
  • 深入理解Kubernetes、容器、任务调度、可观测性等基础设施技术
  • 对大模型训练、推理、评测等流程有一定认知,能理解研发痛点
  • 具备系统可靠性与研究正确性双重视角,关注数据质量和实验可信度

申请策略

  • 提前了解腾讯的大模型布局和WeLM项目,展示对业务背景的认知
  • 准备1-2个关于系统调优或故障恢复的详细项目案例,用STAR法则讲述
  • 突出分布式系统或ML Systems的实战经验,如设计过大规模集群、调度系统等
  • 强调对Kubernetes、容器、可观测性等技术的深入理解,并给出落地案例
  • 如有大模型训练、推理或评测相关的经验,务必重点展示
  • 强调解决复杂问题和高可用系统故障的案例,体现系统级思考能力
  • 补习MLOps和大模型训练的基础知识,如模型并行、数据并行、Rollout概念
  • 加深Kubernetes和容器网络的底层原理,学习GPU调度(如NVIDIA device plugin)

面试指南

  • 对系统设计问题,采用'场景-方案-权衡'的结构:先说明业务场景和挑战,再给出你的设计思路,最后讨论取舍和优化
  • 对优化类问题,用数据说话:明确性能指标,分析瓶颈,提出并可落地改进措施
  • 对协作类问题,强调迭代思维:理解需求本质,抽象通用能力,与团队共同定义负载
  • 请描述你设计或维护过的一个大规模分布式系统,如何保证高可用和稳定性?
  • 如何优化Kubernetes集群的资源利用率?请具体谈谈调度策略
  • 你如何理解模型研发中的可观测性?如何确保实验结果可复现?
  • 当算法团队提出新的实验需求时,你如何将其转化为系统功能?
  • 谈谈你对大模型训练基础设施的了解,比如GPU集群的瓶颈和优化方案

职位点评

72
综合评分

腾讯大模型基础设施工程师,前沿技术栈,成长空间大,但工作强度和不确定性较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合技术追求强烈、希望在AI基础设施领域深入发展,并愿意接受一定工作压力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活50
使命价值70

薪资福利

70中等

腾讯薪酬体系在行业内具有较强竞争力,虽然JD未披露具体薪资,但大厂技术岗位通常提供有吸引力的总包。

薪资信号未披露(AI估算:25K-50K/月)

成长发展

90较高

该岗位直接面向大模型基础设施,技术栈前沿,涉及Kubernetes、GPU集群等领域,成长空间巨大。

技术前沿前沿/新兴技术
技术栈分布式系统、ML Systems、Kubernetes、GPU集群、大模型、调度、可观测性
业务类型cost_center

工作生活

50较低

JD未提及工作生活平衡或弹性工作信息,腾讯整体工作节奏偏快,多城市办公可能带来一定流动性。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

工作内容直接推动前沿大模型研发,对AI技术发展有显著贡献,使命感和行业影响力较强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs