DiDi logo
滴滴出行
AI Infra研发专家

AI Infra研发专家

发布于 大约 2 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
平台工程
Ai Gateway
Gpu调度
Mcp
Sglang
Tensorrt-Llm
Vllm

AI 估算 · 40k–70k

AI Infra专家岗位,技术门槛高,大厂薪资水平,结合北京市场行情,月薪中位数约5.5万。

职位详情

关于这个职位

作为滴滴出行Fintech部门的AI Infra研发专家,您将负责Agent Sandbox组件、模型服务网关和GPU容器调度等核心系统的研发,确保大规模AI推理场景的稳定性与高效运行

该职位深度参与AI基础设施的架构设计与优化,是技术深耕与业务赋能的理想结合

最低要求

本科及以上学历,计算机相关专业

年以上稳定性工作经验
能熟练使用一种编程语言,包括不限于Python/Shell/Golang/C++/C
熟悉大模型推理服务化(vLLM / SGLang / TensorRT-LLM 等推理引擎),熟悉 Agent 技术栈(Agent 框架Function Calling、MCP 协议等)
熟悉K8S:CRD/Operator 开发、容器运行时、网络策略,扎实的分布式系统功底,有网关、限流、鉴权类组件或 PaaS 平台的开发经验

工作职责

Agent Sandbox 组件研发:负责 Sandbox SDK 与沙箱运行时和控制面的开发,包括Session 生命周期管理、调用边界网络策略、多租户隔离、容器加固、高密资源治理、Platform Runtime等

打通"可观测 → 可归因 → 自动优化 → 自动上线"的 Agent 进化闭环
模型服务网关研发:负责 AI Gateway 核心组件的架构设计与开发——模型路由、鉴权、分布式限流、Token 级计量与成本控制、多租户隔离、审计日志、降级策略、API 协议适配
对接集团 TokenService 与自建推理集群,让业务 Agent 的 LLM 与 Tool 调用快且稳
容器调度:负责 GPU 容器的调度与资源管理,基于 kube-scheduler/volcano/koordinator 等实现排队、优先级、LLM 槽位预留、PD 分离节点的独立扩缩容,支撑算力池化与在离线混布
稳定性:负责Fintech大规模AI推理场景下稳定性技术体系的设计与迭代,负责AI Infra稳定性相关工具链的开发、稳定性工作流的构建与建立,包括但不限于:E2E可观测性与告警,SLA 体系,变更以及研发流程,容灾,故障处理,容量评估与压测等

AI 洞察

优缺点分析

优点

  • AI Infra是当前热门方向,技能积累具有长期价值,职业前景广阔
  • 工作内容涉及多个核心组件,能快速提升系统设计与架构能力
  • 对技术深度和广度要求高,需要持续学习大模型与云原生技术
  • 跨团队协作频繁,需要良好的沟通与协调能力
  • 适合对AI基础设施有浓厚兴趣,具备扎实分布式系统功底,并希望在技术深度上持续突破的工程师

缺点 / 挑战

  • 滴滴出行作为大型互联网公司,平台稳定,技术挑战大,能接触前沿AI基础设施
  • 大规模AI场景的稳定性保障压力大,可能需要应对高并发和复杂故障

角色解读

  • 在AI Infra领域深耕,成为技术专家,主导核心组件架构演进
  • 向技术管理方向发展,带领团队负责AI基础设施的整体规划与实施
  • 横向拓展至云原生、大数据等相邻领域,提升综合技术影响力
  • 负责Agent Sandbox组件的开发,包括SDK、运行时和控制面,确保多租户隔离与安全
  • 设计并开发AI Gateway核心组件,实现模型路由、鉴权、限流与成本控制
  • 负责GPU容器的调度与资源管理,优化算力池化与在离线混布
  • 构建AI Infra稳定性体系,包括可观测性、告警、SLA、容灾与故障处理
  • 精通Python、Golang、C++等至少一种编程语言,具备扎实的编码能力
  • 熟悉Kubernetes,包括CRD/Operator开发、容器运行时和网络策略
  • 了解大模型推理引擎(如vLLM、SGLang、TensorRT-LLM)及Agent技术栈
  • 具备分布式系统开发经验,熟悉网关、限流、鉴权等组件

申请策略

  • 在申请时,强调对AI Infra稳定性的理解,并准备相关案例
  • 关注滴滴Fintech业务方向,了解其AI应用场景,在面试中展现业务敏感度
  • 突出在AI推理、GPU调度或相关领域的项目经验,特别是涉及vLLM、K8s等技术的实践
  • 强调在稳定性、性能优化或故障处理方面的具体成果,用数据量化
  • 展示对Agent技术栈(如Function Calling、MCP)的理解或应用
  • 提及参与开源项目或技术社区贡献,体现技术热情
  • 深入学习Kubernetes的调度与网络原理,尝试编写CRD或Operator
  • 熟悉主流推理引擎的架构与优化方法,了解其性能瓶颈

面试指南

  • 从需求出发,先明确目标与约束,再设计架构,最后考虑扩展性与容错
  • 结合具体项目经验,用STAR法则(情境、任务、行动、结果)来阐述
  • 强调数据驱动,用指标(如延迟、吞吐、可用性)来量化效果
  • 请描述你如何设计一个高可用的AI推理网关,包括限流、鉴权与降级策略
  • 在Kubernetes中,如何实现GPU资源的高效调度与隔离?
  • 如何监控和优化大规模AI推理服务的性能与稳定性?
  • 请谈谈你对Agent技术栈(如Function Calling、MCP)的理解
  • 在稳定性保障中,如何设计SLA体系并确保其达成?

职位点评

75
综合评分

AI Infra专家,技术前沿,成长空间大,但工作强度与办公灵活性未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度与前沿发展,对AI基础设施有热情,能接受现场办公的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值70

薪资福利

80较高

滴滴作为上市公司,薪资福利有竞争力,但具体薪资未在JD中披露。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

AI Infra是前沿技术领域,岗位涉及多个核心组件,技术成长空间大。

技术前沿前沿/新兴技术
技术栈vLLM、SGLang、TensorRT-LLM、Kubernetes、Agent、MCP
业务类型profit_center

工作生活

50较低

工作地点在北京,JD未提及远程或弹性办公,可能需现场办公。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施对业务赋能价值高,但JD未强调社会价值或使命。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs