Ant Group logo
蚂蚁集团
蚂蚁集团-大模型推理与服务框架工程师-杭州/北京

蚂蚁集团-大模型推理与服务框架工程师-杭州/北京

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Gpu
Sglang
Tensorrt-Llm
Vllm
分布式系统
大模型推理

AI 估算 · 40k–70k

大模型推理工程师为高需求技术岗,蚂蚁集团平台大,薪资竞争力强,结合北京/杭州一线城市水平,月薪中位数约5.5万。

职位详情

关于这个职位

作为蚂蚁集团的大模型推理与服务框架工程师,你将专注于大模型推理框架的设计与研发,优化推理性能与资源利用率,并建设在线推理服务框架

你将与业界前沿技术接轨,参与开源社区,推动先进方案落地
该职位要求扎实的计算机基础和丰富的系统开发经验,适合对高性能计算和AI基础设施充满热情的技术专家

最低要求

● 计算机基础扎实,熟悉 Linux 环境下的系统开发、性能分析和问题定位

● 熟练使用 Python,并掌握 C++/Rust 等高性能编程语言,能够完成生产级系统的设计、开发和维护
● 在大模型推理框架或高性能在线服务至少一个方向具备扎实的实践经验:熟悉 SGLang、vLLM、TensorRT-LLM 等推理框架,或具备高并发服务端、异步编程、RPC、请求调度等系统开发经验
对另一个方向有基本理解,并愿意深入完整的推理系统链路
● 理解大模型推理的基本机制,包括 Batching、KV Cache、并行策略、请求调度和分布式通信等,能够从端到端视角分析系统问题
● 自驱、结果导向,具备良好的协作和沟通能力,能够将技术方案落地为稳定、可维护的工程产物

工作职责

● 参与大模型推理框架的设计与研发,支持业界开源、蚂蚁内部大模型以及多模态模型的高效推理

● 开展端到端性能分析与优化,覆盖推理调度、并行策略、KV Cache、量化、算子优化等,持续改善吞吐、时延和资源利用率
● 参与在线推理服务框架的设计与演进,建设模型部署、服务编排、流量治理和多模型、多模态服务能力
● 设计并优化在线请求调度、RPC 通信和端到端数据通路,在高并发和强 SLA 场景下平衡吞吐、时延与资源隔离
● 建设推理服务的可观测性和容错能力,完善监控、诊断、限流、降级与故障恢复机制,提高系统稳定性和工程质量
● 跟进 SGLang、vLLM、TensorRT-LLM、FlashInfer、Triton Inference Server 等推理框架和基础组件,推动先进方案在内部系统及开源社区落地

优先资格

● 有大规模在线推理系统的建设或优化经验,熟悉 Triton Inference Server、NVIDIA Dynamo、Ray Serve、Seldon 等推理服务或编排框架

● 参与过 SGLang、vLLM、Triton Inference Server 等相关开源项目
● 理解 GPU 或其他 AI 加速芯片架构,熟悉 CUDA、Triton、CUTLASS 、NCCL,或具备算子、图编译及代码生成相关经验
● 有多机多卡推理、PD 分离、量化、投机采样或多模态推理的落地经验

AI 洞察

优缺点分析

优点

  • 大模型推理是当前AI核心赛道,技能积累价值高
  • 有机会参与开源项目,提升个人技术影响力
  • 薪资待遇优厚,福利完善
  • 技术难度大,需要深入理解底层系统和高性能编程
  • 技术迭代快,需要持续学习新框架和优化技术
  • 适合对系统性能优化有热情、具备扎实底层功底、愿意深入AI基础设施领域的工程师

缺点 / 挑战

  • 蚂蚁集团平台大,技术挑战高,能接触大规模真实业务场景
  • 工作强度可能较高,需要应对高并发和强SLA要求

角色解读

  • 在AI基础设施领域深耕,成为推理性能优化专家
  • 向技术管理方向发展,带领团队建设大规模推理平台
  • 参与开源社区,提升行业影响力,可转向研究或架构师方向
  • 设计并优化大模型推理框架,提升推理性能与资源利用率
  • 参与在线推理服务框架建设,包括模型部署、服务编排和流量治理
  • 优化请求调度、RPC通信和数据通路,保障高并发下的稳定性
  • 跟进业界前沿推理框架,推动技术落地和开源贡献
  • 扎实的计算机基础,熟悉Linux系统开发和性能分析
  • 精通Python,并掌握C++/Rust等高性能语言
  • 熟悉SGLang、vLLM等推理框架或高并发服务端开发经验
  • 理解大模型推理机制,包括Batching、KV Cache、并行策略等

申请策略

  • 关注蚂蚁集团AI基础设施团队的技术博客,了解业务方向
  • 准备一个推理优化案例,展示问题分析和解决能力
  • 突出大模型推理或高性能服务开发的项目经验,量化性能提升成果
  • 强调对SGLang、vLLM等框架的熟悉程度,如有开源贡献需重点提及
  • 展示C++/Rust和Python的实战能力,以及系统性能分析经验
  • 提及分布式系统、GPU编程等技能,体现技术深度
  • 深入学习vLLM或SGLang源码,理解推理优化细节
  • 补充CUDA编程和GPU架构知识,提升算子优化能力

面试指南

  • 结合具体项目,从问题背景、分析过程、解决方案和效果量化四方面回答
  • 强调端到端视角,从系统层面分析性能瓶颈
  • 展示对前沿技术的了解,并联系实际应用
  • 请解释vLLM中的PagedAttention原理及优势
  • 如何优化大模型推理的吞吐和时延?
  • 描述一次你优化高并发服务性能的经历
  • 如何设计一个在线推理服务框架?
  • 你对KV Cache和量化技术有何理解?

职位点评

74
综合评分

前沿技术、高薪,但工作强度大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、对AI基础设施充满热情、能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活40
使命价值70

薪资福利

80较高

薪资水平高,福利完善,但具体薪资未披露,需面议。

薪资信号面议 (40K-70K/月)

成长发展

95较高

职位涉及前沿大模型推理技术,技能成长空间大,有开源社区参与机会。

技术前沿前沿/新兴技术
技术栈SGLang、vLLM、TensorRT-LLM、CUDA、GPU、量化
成长机会跟进业界前沿框架、推动先进方案落地
业务类型profit_center

工作生活

40较低

工作地点为北京/杭州,需现场办公,未提及弹性工作,可能工作强度较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施对行业有积极影响,但社会价值感知一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs