Tencent logo
腾讯
AI大模型架构师

AI大模型架构师

发布于 大约 14 小时前

普通员工/个人贡献者

深圳市
高级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
3D并行
Ai芯片
Deepspeed
Llm
Megatron
Moe
Pytorch
Vllm
Zero

AI 估算 · 50k–80k

高级大模型架构师岗位,技术稀缺,腾讯薪资体系完善,参考市场水平估算。

职位详情

关于这个职位

作为腾讯AI大模型架构师,你将负责千亿/万亿参数级大模型的训练与推理架构规划与优化

需要深入掌握分布式训练框架、并行策略和推理部署技术,解决大规模集群训练中的稳定性与效率问题
这是一个技术专家岗,聚焦AI基础设施和前沿算法工程化

最低要求

年以上AI相关开发经验,包括不限于搜索、推荐、CV等

年以上专注于大模型(GPT、Llama、Qwen、DeepSeek等系列)领域工作经验
深入理解Pytorch、Megatron、DeepSpeed等分布式训练框架,有千卡以上集群训练实战经验优先,有强化训练实战经验优先
熟悉千亿模型训练工程化相关技术,3D并行、ZeRO、混合精度、Overlapping等
熟悉主流大模型算法,Transformer、MoE、MLA等
熟悉后训练算法,SFT、DPO、GPRO等
了解大模型推理部署框架和工程化,vLLM框架、KV Cache优化等
关注当前最新LLM最新技术发展

工作职责

负责公司大模型(LLM/VLM/MoE等)的整体技术架构规划,参与千亿/万亿参数级别大模型的训练、推理全流程架构优化

优化大规模分布式训练系统(3D并行、ZeRO优化等),参与解决断点续训、通信瓶颈、显存优化等技术难题,提升稳定性和降低成本
规划公司AI基础设施,包括AI芯片、存储、通信等
参与大模型训练的全流程规划(数据处理、预训练、精调、强化、后训练等)
参与大模型推理的全流程规划(改写、压缩、多轮对话、Agent等)

AI 洞察

优缺点分析

优点

  • 腾讯拥有丰富的GPU资源和海量业务场景,能接触真正千亿参数大模型的工程实践
  • 大模型领域正处于高速发展期,跳槽或内部晋升前景广阔
  • 技术迭代极快,需要持续学习最新框架和论文,保持竞争力
  • 对系统底层和算法理解要求都很高,入门门槛高
  • 适合有多年AI工程经验、热爱钻研分布式系统优化、愿意深耕大模型基础设施的技术专家

缺点 / 挑战

  • 岗位技术挑战大,能深度参与前沿AI基础设施创新,积累稀缺经验
  • 工作强度较高,大模型训练周期长、问题排查复杂,有时需要on-call

角色解读

  • 技术纵深发展:成为AI基础设施领域的首席架构师或技术专家
  • 横向拓展:从训练优化延伸到推理、部署、芯片协同设计等多个方向
  • 管理晋升:可转向技术管理岗位,带领团队负责大规模AI系统
  • 规划大模型训练与推理的整体技术架构,包括千亿/万亿参数模型的分布式优化
  • 解决大规模集群训练中的断点续训、通信瓶颈、显存优化等工程难题
  • 参与AI基础设施建设,涉及芯片、存储、通信等选型与规划
  • 覆盖训练全流程(数据处理、预训练、微调、强化学习)和推理全流程(压缩、部署、Agent)
  • 精通PyTorch、Megatron、DeepSpeed等分布式训练框架,具备千卡集群实战经验
  • 深入理解3D并行、ZeRO、混合精度等训练优化技术
  • 熟悉主流大模型架构(Transformer、MoE、MLA)和后训练算法(SFT、DPO、GRPO)
  • 了解vLLM、KV Cache等推理优化技术,跟踪LLM前沿发展

申请策略

  • 面试前深入了解腾讯混元大模型的技术栈和公开资料
  • 准备一个完整的大模型训练或推理优化案例,从问题提出到方案落地
  • 突出大模型训练/推理的实战项目,重点描述集群规模、优化技术、性能提升数据
  • 强调对分布式框架(Megatron、DeepSpeed)的源码级理解或二次开发经历
  • 展示解决具体工程难题的案例,如断点续训、显存优化、通信拓扑改进等
  • 如有强化学习或RLHF相关经验,务必提及
  • 补齐vLLM、TensorRT-LLM等推理框架的工程实践
  • 阅读Megatron和DeepSpeed源码,理解并行策略实现

面试指南

  • 对于工程类问题,采用STAR法则(情境、任务、行动、结果),量化指标
  • 对于架构设计问题,先分析痛点,再比较不同方案优劣,给出推荐方案及理由
  • 前沿技术问题,展示跟踪热点的能力,同时结合自身实践理解
  • 请介绍你参与过的大规模分布式训练项目,如何实现3D并行流水线?
  • 训练千亿参数模型时,如何解决显存不足和通信瓶颈问题?
  • 你如何优化训练稳定性?断点续训的实现细节是怎样的?
  • 对比vLLM和TensorRT-LLM在推理优化上的异同
  • 如何评估一个AI芯片(如H100、昇腾)是否适合大模型训练?

职位点评

76
综合评分

腾讯大模型架构师,前沿技术栈、高薪资,但工作强度大、WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合技术驱动型求职者,追求前沿技术成长和职业发展,能接受高强度工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值70

薪资福利

85较高

腾讯作为头部互联网公司,薪资福利极具竞争力,该岗位属于顶尖技术岗,薪资有较大吸引力,但JD未明确福利细节。

薪资信号偏高 (50K-80K/月)

成长发展

95较高

岗位涉及最前沿的大模型技术,能深度参与千亿参数模型的工程优化,技术成长空间巨大,但JD未提及晋升通道。

技术前沿前沿/新兴技术
技术栈LLM、VLM、MoE、3D并行、ZeRO、Megatron、DeepSpeed、vLLM
业务类型profit_center

工作生活

40较低

深圳办公室,未提及远程或弹性办公,大模型训练岗通常加班较多,工作生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型是当前科技发展的重要方向,腾讯的布局对产业有影响力,但岗位更偏工程实现,直接社会价值感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs