
腾讯
微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)
微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)
发布于 大约 8 小时前普通员工/个人贡献者
深圳市 / 上海市
中级经验
全职员工
仅现场办公
学历未注明
平台工程
Gpu集群
任务调度
分布式系统
可观测性
大模型训练
容器
强化学习
推理
沙箱
AI 估算 · 25k–50k
腾讯大厂高级技术岗,深圳/上海/广州薪资水平高,涉及大模型基础设施,技能稀缺,月薪中位数3万+,16薪。
职位详情
关于这个职位
作为腾讯大模型研发基础设施工程师,你将负责建设和优化支撑WeLM等前沿模型研发的算力与工具平台,包括GPU/Kubernetes集群、模型评估沙箱、任务调度和可观测性系统
这个岗位直接影响大模型的数据、评估和训练迭代效率,适合对MLOps和分布式系统有深入理解的技术专家
最低要求
具备扎实的分布式系统或 ML Systems 经验,能够设计和维护持续运行的大规模生产系统
熟悉任务调度、工作流系统、容器或沙箱、Kubernetes、存储、消息系统以及可观测性中的一个或多个领域
对大模型训练、推理、评测、合成数据或强化学习 Rollout 有实际经验或强烈兴趣
能够同时关注系统可靠性与研究正确性,理解“系统成功运行”和“产生可信模型结论”之间的差异
乐于深入模型研发现场,理解研究工作流,并将快速变化的实验需求抽象为可靠、可复用的系统能力
希望自己的系统工作直接影响前沿模型的数据、评估和训练迭代,而不仅仅是优化一般软件开发流程
工作职责
面向研发迭代过程中的典型负载优化调度、路由、部署策略,优化系统吞吐和稳定性
建设并运营面向模型研发的沙箱 CPU 集群与工具执行环境,负责环境隔离、任务编排、资源调度与运行治理,保障评估和实验任务稳定执行
建设并运营 GPU 集群、Kubernetes 和数据系统,提升资源利用率、任务吞吐和端到端研发效率
负责研发生产系统的 SLA、可观测性与故障恢复,定位性能瓶颈和异常波动,保障关键任务与评估结果稳定、可复现、可诊断
与算法、评估和推理基础设施团队共同定义真实研发负载,持续演进面向前沿模型迭代的系统能力
AI 洞察
优缺点分析
优点
- 腾讯核心业务方向,大模型基础设施属于前沿技术领域,技术含量高
- 能接触大规模GPU集群、Kubernetes等顶尖技术栈,技能积累快
- 团队成员优秀,与算法、推理等团队协作,学习机会多
- 平台影响力大,工作成果直接影响前沿模型的迭代效率
- 对综合能力要求高,需要同时掌握分布式系统、ML领域知识
- 研发效能方向需要频繁响应算法团队的需求,工作节奏可能较快
- 多城市办公地点(深圳/上海/广州),可能涉及一定程度的协作和沟通成本
缺点 / 挑战
- 适合对大规模基础设施有热情、愿意深入研究大模型研发流程,并喜欢解决复杂系统挑战的技术工程师
角色解读
- 在技术深度上,可向MLOps专家或分布式系统架构师方向发展
- 在业务理解上,可深入大模型研发流程,成为连接算法与工程的桥梁
- 在团队内可晋升为技术Leader,负责更大规模的平台建设与团队管理
- 设计和维护面向大模型研发的大规模算力平台,包括GPU集群和Kubernetes环境
- 优化任务调度、资源路由和部署策略,提升系统吞吐和稳定性
- 建设模型评估沙箱和工具链,确保实验任务可复现、可诊断
- 与算法团队紧密协作,将研发负载抽象为可靠的基础设施能力
- 扎实的分布式系统设计能力,熟悉高可用生产系统架构
- 深入理解Kubernetes、容器、任务调度、可观测性等基础设施技术
- 对大模型训练、推理、评测等流程有一定认知,能理解研发痛点
- 具备系统可靠性与研究正确性双重视角,关注数据质量和实验可信度
申请策略
- 提前了解腾讯的大模型布局和WeLM项目,展示对业务背景的认知
- 准备1-2个关于系统调优或故障恢复的详细项目案例,用STAR法则讲述
- 突出分布式系统或ML Systems的实战经验,如设计过大规模集群、调度系统等
- 强调对Kubernetes、容器、可观测性等技术的深入理解,并给出落地案例
- 如有大模型训练、推理或评测相关的经验,务必重点展示
- 强调解决复杂问题和高可用系统故障的案例,体现系统级思考能力
- 补习MLOps和大模型训练的基础知识,如模型并行、数据并行、Rollout概念
- 加深Kubernetes和容器网络的底层原理,学习GPU调度(如NVIDIA device plugin)
面试指南
- 对系统设计问题,采用'场景-方案-权衡'的结构:先说明业务场景和挑战,再给出你的设计思路,最后讨论取舍和优化
- 对优化类问题,用数据说话:明确性能指标,分析瓶颈,提出并可落地改进措施
- 对协作类问题,强调迭代思维:理解需求本质,抽象通用能力,与团队共同定义负载
- 请描述你设计或维护过的一个大规模分布式系统,如何保证高可用和稳定性?
- 如何优化Kubernetes集群的资源利用率?请具体谈谈调度策略
- 你如何理解模型研发中的可观测性?如何确保实验结果可复现?
- 当算法团队提出新的实验需求时,你如何将其转化为系统功能?
- 谈谈你对大模型训练基础设施的了解,比如GPU集群的瓶颈和优化方案
职位点评
72
综合评分
腾讯大模型基础设施工程师,前沿技术栈,成长空间大,但工作强度和不确定性较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合技术追求强烈、希望在AI基础设施领域深入发展,并愿意接受一定工作压力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活50
使命价值70
薪资福利
70中等
腾讯薪酬体系在行业内具有较强竞争力,虽然JD未披露具体薪资,但大厂技术岗位通常提供有吸引力的总包。
薪资信号未披露(AI估算:25K-50K/月)
成长发展
90较高
该岗位直接面向大模型基础设施,技术栈前沿,涉及Kubernetes、GPU集群等领域,成长空间巨大。
技术前沿前沿/新兴技术
技术栈分布式系统、ML Systems、Kubernetes、GPU集群、大模型、调度、可观测性
业务类型cost_center
工作生活
50较低
JD未提及工作生活平衡或弹性工作信息,腾讯整体工作节奏偏快,多城市办公可能带来一定流动性。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
工作内容直接推动前沿大模型研发,对AI技术发展有显著贡献,使命感和行业影响力较强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
AI Infrastructure Software Engineer — CosmosLab
英伟达 · 上海市AI 估算 · 40k-70k【星火X计划】面向超大尺寸通用LLM的预训练Infra工程(J13799)
科大讯飞 · 合肥市AI 估算 · 20k-40k【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13988)
科大讯飞 · 合肥市AI 估算 · 3k-6k【星火X计划】大规模集群下超大尺寸模型推理性能极致优化(J13985)
科大讯飞 · 合肥市AI 估算 · 25k-50k千问事业部-大模型训推平台开发工程师-广州/杭州
阿里巴巴 · 杭州市AI 估算 · 20k-40k
Watch Jobs