DiDi logo
滴滴出行
AI Infra资深研发工程师

AI Infra资深研发工程师

发布于 大约 2 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
平台工程
Ai Gateway
Gpu调度
Mcp
Sglang
Tensorrt-Llm
Vllm

AI 估算 · 40k–70k

AI Infra资深岗位,技术栈前沿,市场需求大,滴滴平台提供有竞争力薪资,结合北京水平,月薪4-7万合理。

职位详情

关于这个职位

作为滴滴Fintech部门的AI Infra资深研发工程师,您将负责Agent Sandbox组件、模型服务网关和GPU容器调度等核心系统的研发,确保大规模AI推理场景的稳定性和效率

您将参与构建可观测、可归因、自动优化的Agent进化闭环,支撑业务Agent的LLM与Tool调用,是AI基础设施的关键角色

最低要求

本科及以上学历,计算机相关专业

年以上稳定性工作经验
能熟练使用一种编程语言,包括不限于Python/Shell/Golang/C++/C
熟悉大模型推理服务化(vLLM / SGLang / TensorRT-LLM 等推理引擎),熟悉 Agent 技术栈(Agent 框架Function Calling、MCP 协议等)
熟悉K8S:CRD/Operator 开发、容器运行时、网络策略,扎实的分布式系统功底,有网关、限流、鉴权类组件或 PaaS 平台的开发经验

工作职责

Agent Sandbox 组件研发:负责 Sandbox SDK 与沙箱运行时和控制面的开发,包括Session 生命周期管理、调用边界网络策略、多租户隔离、容器加固、高密资源治理、Platform Runtime等

打通"可观测 → 可归因 → 自动优化 → 自动上线"的 Agent 进化闭环
模型服务网关研发:负责 AI Gateway 核心组件的架构设计与开发——模型路由、鉴权、分布式限流、Token 级计量与成本控制、多租户隔离、审计日志、降级策略、API 协议适配
对接集团 TokenService 与自建推理集群,让业务 Agent 的 LLM 与 Tool 调用快且稳
容器调度:负责 GPU 容器的调度与资源管理,基于 kube-scheduler/volcano/koordinator 等实现排队、优先级、LLM 槽位预留、PD 分离节点的独立扩缩容,支撑算力池化与在离线混布
稳定性:负责Fintech大规模AI推理场景下稳定性技术体系的设计与迭代,负责AI Infra稳定性相关工具链的开发、稳定性工作流的构建与建立,包括但不限于:E2E可观测性与告警,SLA 体系,变更以及研发流程,容灾,故障处理,容量评估与压测等
让 Fintech 业务 Agent 稳定运行在 AI Infra 之上

AI 洞察

优缺点分析

优点

  • 处于AI基础设施前沿,接触最新的大模型推理和Agent技术,技术成长快
  • 薪资待遇优厚,且公司已上市,稳定性较好
  • AI领域变化快,需要不断适应新技术,保持竞争力
  • 涉及稳定性工作,可能面临紧急故障处理,需要一定的抗压能力

缺点 / 挑战

  • 滴滴作为大平台,提供丰富的业务场景和资源,技术挑战大,能积累高价值经验
  • 技术复杂度高,需要持续学习,工作压力可能较大
  • 适合对AI基础设施有热情、技术功底扎实、喜欢挑战复杂系统问题的资深工程师

角色解读

  • 在AI Infra领域深耕,成为技术专家,负责更核心的AI基础设施架构设计
  • 向技术管理方向发展,带领团队负责AI基础设施的规划和落地
  • 横向扩展至其他基础设施领域,如云原生、大数据平台,或深入AI应用层
  • 负责Agent Sandbox组件的研发,包括SDK、运行时和控制面,管理Session生命周期、网络策略、多租户隔离等,确保Agent运行的安全和隔离
  • 设计并开发AI Gateway核心组件,处理模型路由、鉴权、限流、Token计量和成本控制,保证LLM和Tool调用的稳定性和效率
  • 参与GPU容器调度和资源管理,基于Kubernetes生态实现排队、优先级、槽位预留,支撑算力池化和在离线混布
  • 构建AI推理场景的稳定性体系,包括可观测性、告警、SLA、容灾、故障处理和容量评估,确保业务Agent稳定运行
  • 精通至少一种编程语言,如Python、Golang、C++或C,能够进行系统级开发
  • 熟悉大模型推理引擎(如vLLM、SGLang、TensorRT-LLM)和Agent技术栈(如Function Calling、MCP协议)
  • 深入理解Kubernetes,包括CRD/Operator开发、容器运行时和网络策略,具备分布式系统开发经验
  • 有网关、限流、鉴权组件或PaaS平台开发经验,熟悉稳定性工程实践

申请策略

  • 了解滴滴Fintech的业务方向,思考AI Infra如何支撑金融场景
  • 在面试中展示对系统稳定性和性能优化的深入理解
  • 突出在Kubernetes、容器调度、网关开发方面的项目经验,特别是涉及AI推理场景的
  • 强调对大模型推理引擎和Agent框架的实际使用和优化经验
  • 展示在稳定性工程方面的成果,如SLA提升、故障处理案例
  • 如果有开源项目或技术博客,可以提及,体现技术影响力
  • 深入学习vLLM、SGLang等推理引擎的架构和优化技术
  • 熟悉Kubernetes Operator开发模式,了解GPU调度和资源管理

面试指南

  • 使用STAR法则回答行为问题,突出情境、任务、行动和结果
  • 对于系统设计问题,从需求分析、架构设计、技术选型、权衡和扩展性等方面回答
  • 强调实际经验,结合具体技术细节和量化结果
  • 如何设计一个高可用的AI Gateway,确保低延迟和高吞吐?
  • 在Kubernetes中如何实现GPU资源的调度和隔离?
  • 如何保证Agent沙箱的安全性和隔离性?
  • 如何构建AI推理服务的可观测性和告警体系?
  • 请描述一次你处理过的分布式系统稳定性问题

职位点评

72
综合评分

前沿AI基础设施岗位,技术成长空间大,薪资面议,但工作强度可能较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、愿意接受挑战的工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值60

薪资福利

75中等

薪资水平较高,公司为上市大厂,福利稳定,但具体薪资未披露,需面议。

薪资信号面议 (40K-70K/月)

成长发展

90较高

职位涉及AI前沿技术,如大模型推理、Agent、GPU调度,技术成长空间大,且公司提供大平台。

技术前沿前沿/新兴技术
技术栈vLLM、SGLang、TensorRT-LLM、Agent、MCP、Kubernetes、GPU调度
业务类型ambiguous

工作生活

50较低

工作地点在北京,未提及远程或弹性办公,可能需现场办公,工作强度可能较高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

AI基础设施对业务有支撑作用,但社会影响力一般,行业处于高速增长期。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs