
滴滴出行
AI Infra研发专家
AI Infra研发专家
发布于 大约 2 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
本科
平台工程
Ai Gateway
Gpu调度
Mcp
Sglang
Tensorrt-Llm
Vllm
AI 估算 · 40k–70k
AI Infra专家岗位,技术门槛高,大厂薪资水平,结合北京市场行情,月薪中位数约5.5万。
职位详情
关于这个职位
作为滴滴出行Fintech部门的AI Infra研发专家,您将负责Agent Sandbox组件、模型服务网关和GPU容器调度等核心系统的研发,确保大规模AI推理场景的稳定性与高效运行
该职位深度参与AI基础设施的架构设计与优化,是技术深耕与业务赋能的理想结合
最低要求
本科及以上学历,计算机相关专业
年以上稳定性工作经验
能熟练使用一种编程语言,包括不限于Python/Shell/Golang/C++/C
熟悉大模型推理服务化(vLLM / SGLang / TensorRT-LLM 等推理引擎),熟悉 Agent 技术栈(Agent 框架Function Calling、MCP 协议等)
熟悉K8S:CRD/Operator 开发、容器运行时、网络策略,扎实的分布式系统功底,有网关、限流、鉴权类组件或 PaaS 平台的开发经验
工作职责
Agent Sandbox 组件研发:负责 Sandbox SDK 与沙箱运行时和控制面的开发,包括Session 生命周期管理、调用边界网络策略、多租户隔离、容器加固、高密资源治理、Platform Runtime等
打通"可观测 → 可归因 → 自动优化 → 自动上线"的 Agent 进化闭环
模型服务网关研发:负责 AI Gateway 核心组件的架构设计与开发——模型路由、鉴权、分布式限流、Token 级计量与成本控制、多租户隔离、审计日志、降级策略、API 协议适配
对接集团 TokenService 与自建推理集群,让业务 Agent 的 LLM 与 Tool 调用快且稳
容器调度:负责 GPU 容器的调度与资源管理,基于 kube-scheduler/volcano/koordinator 等实现排队、优先级、LLM 槽位预留、PD 分离节点的独立扩缩容,支撑算力池化与在离线混布
稳定性:负责Fintech大规模AI推理场景下稳定性技术体系的设计与迭代,负责AI Infra稳定性相关工具链的开发、稳定性工作流的构建与建立,包括但不限于:E2E可观测性与告警,SLA 体系,变更以及研发流程,容灾,故障处理,容量评估与压测等
AI 洞察
优缺点分析
优点
- AI Infra是当前热门方向,技能积累具有长期价值,职业前景广阔
- 工作内容涉及多个核心组件,能快速提升系统设计与架构能力
- 对技术深度和广度要求高,需要持续学习大模型与云原生技术
- 跨团队协作频繁,需要良好的沟通与协调能力
- 适合对AI基础设施有浓厚兴趣,具备扎实分布式系统功底,并希望在技术深度上持续突破的工程师
缺点 / 挑战
- 滴滴出行作为大型互联网公司,平台稳定,技术挑战大,能接触前沿AI基础设施
- 大规模AI场景的稳定性保障压力大,可能需要应对高并发和复杂故障
角色解读
- 在AI Infra领域深耕,成为技术专家,主导核心组件架构演进
- 向技术管理方向发展,带领团队负责AI基础设施的整体规划与实施
- 横向拓展至云原生、大数据等相邻领域,提升综合技术影响力
- 负责Agent Sandbox组件的开发,包括SDK、运行时和控制面,确保多租户隔离与安全
- 设计并开发AI Gateway核心组件,实现模型路由、鉴权、限流与成本控制
- 负责GPU容器的调度与资源管理,优化算力池化与在离线混布
- 构建AI Infra稳定性体系,包括可观测性、告警、SLA、容灾与故障处理
- 精通Python、Golang、C++等至少一种编程语言,具备扎实的编码能力
- 熟悉Kubernetes,包括CRD/Operator开发、容器运行时和网络策略
- 了解大模型推理引擎(如vLLM、SGLang、TensorRT-LLM)及Agent技术栈
- 具备分布式系统开发经验,熟悉网关、限流、鉴权等组件
申请策略
- 在申请时,强调对AI Infra稳定性的理解,并准备相关案例
- 关注滴滴Fintech业务方向,了解其AI应用场景,在面试中展现业务敏感度
- 突出在AI推理、GPU调度或相关领域的项目经验,特别是涉及vLLM、K8s等技术的实践
- 强调在稳定性、性能优化或故障处理方面的具体成果,用数据量化
- 展示对Agent技术栈(如Function Calling、MCP)的理解或应用
- 提及参与开源项目或技术社区贡献,体现技术热情
- 深入学习Kubernetes的调度与网络原理,尝试编写CRD或Operator
- 熟悉主流推理引擎的架构与优化方法,了解其性能瓶颈
面试指南
- 从需求出发,先明确目标与约束,再设计架构,最后考虑扩展性与容错
- 结合具体项目经验,用STAR法则(情境、任务、行动、结果)来阐述
- 强调数据驱动,用指标(如延迟、吞吐、可用性)来量化效果
- 请描述你如何设计一个高可用的AI推理网关,包括限流、鉴权与降级策略
- 在Kubernetes中,如何实现GPU资源的高效调度与隔离?
- 如何监控和优化大规模AI推理服务的性能与稳定性?
- 请谈谈你对Agent技术栈(如Function Calling、MCP)的理解
- 在稳定性保障中,如何设计SLA体系并确保其达成?
职位点评
75
综合评分
AI Infra专家,技术前沿,成长空间大,但工作强度与办公灵活性未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度与前沿发展,对AI基础设施有热情,能接受现场办公的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值70
薪资福利
80较高
滴滴作为上市公司,薪资福利有竞争力,但具体薪资未在JD中披露。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
AI Infra是前沿技术领域,岗位涉及多个核心组件,技术成长空间大。
技术前沿前沿/新兴技术
技术栈vLLM、SGLang、TensorRT-LLM、Kubernetes、Agent、MCP
业务类型profit_center
工作生活
50较低
工作地点在北京,JD未提及远程或弹性办公,可能需现场办公。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI基础设施对业务赋能价值高,但JD未强调社会价值或使命。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Watch Jobs