DiDi logo
滴滴出行
资深研发工程师Agent-BOSS

资深研发工程师Agent-BOSS

发布于 大约 7 小时前

普通员工/个人贡献者

杭州市
高级经验
全职员工
仅现场办公
本科
后端开发
Ai Coding
Llm-As-Judge
Rag
大模型
自动化测试
评测平台

AI 估算 · 25k–45k

资深后端+AI平台,杭州互联网薪资中上水平,上市大厂福利稳定。

职位详情

关于这个职位

这是一个参与滴滴Fintech技术部Agent评测平台研发的资深后端岗位

你将负责设计并搭建自动化评测体系,运用大模型、RAG、LLM-as-Judge等前沿技术,保障Agent的质量与安全,并与产品运营协作推动效果优化
适合对AI Agent领域有热情、追求技术深度和平台影响力的研发工程师

最低要求

本科及以上学历,计算机相关专业,3 年以上后端 / 平台研发经验

熟练掌握 Python/Java 等至少一种编程语言,具备扎实的编码能力,能独立完成平台核心模块的设计与开发
熟悉大模型、Agent、RAG 等 AI 技术,具备 AI Coding 研发经验,能够将AI应用于日常研发及系统建设中
逻辑清晰,具备较强的自驱力与跨团队沟通协作能力,能在业务快速迭代的环境下把握重点

工作职责

负责 Agent 评测平台的整体架构设计与研发,构建覆盖对话质量、任务完成度、工具调用准确性、安全合规等维度的自动化评测能力

设计并落地评测指标体系与评测集,结合业务场景持续扩充与迭代高质量测试数据,保障评测结果的科学性与可复现性
探索并应用 LLM-as-Judge、多轮对话仿真、用户模拟器等评测技术,提升评测效率与准确度,减少人工标注依赖
建设自动化回归测试与线上质量监控能力,快速发现 Agent 效果劣化、幻觉、越权调用等问题,推动问题闭环
与产品、运营团队紧密协作,将评测结果转化为可执行的优化建议,驱动 Agent 效果持续提升

优先资格

了解 LLM-as-Judge、对话仿真、用户模拟器等评测方法及有评测相关开发经验者优先

AI 洞察

优缺点分析

优点

  • 前沿技术栈:深度接触大模型、Agent、RAG等热门AI领域,技术含金量高
  • 平台价值高:评测是Agent落地关键环节,工作成果直接驱动业务效果,影响力大
  • 大厂平台:滴滴上市巨头,资源丰富,稳定性好,薪资福利有竞争力
  • 业务前景好:Fintech领域AI应用持续增长,赛道处于高速发展期
  • 技术复杂度高:需同时掌握后端工程与AI模型评测方法,学习曲线较陡
  • 评测标准不成熟:Agent评测行业尚在探索,需要较强的创新和落地能力
  • 适合对AI技术有强烈兴趣、乐于解决复杂系统问题、追求技术深度和业务影响力,且能适应快节奏工作的研发工程师

缺点 / 挑战

  • 业务迭代快:需快速响应业务变化,可能面临一定的加班压力

角色解读

  • 在AI评测垂直领域深耕,成为Agent质量保障专家
  • 向技术专家或架构师方向发展,主导评测平台的技术演进
  • 有机会横向拓展至大模型应用研发、AI平台建设等方向,具备复合型竞争力
  • 设计并开发Agent评测平台,涵盖架构、指标体系、自动化评测能力,负责核心模块的落地
  • 构建评测集和高质量测试数据,结合业务场景持续扩充,并探索LLM-as-Judge等新评测技术提升效率和准确性
  • 建设自动化回归测试和线上监控,快速定位Agent质量问题(如幻觉、越权调用)并推动闭环解决
  • 与产品和运营团队协作,将评测结果转化为优化建议,驱动Agent效果持续迭代
  • 扎实的编程能力(Python/Java),能独立完成平台模块设计和开发,具备大规模后端系统经验
  • 熟悉大模型、Agent、RAG等AI技术,并能将AI应用于日常研发和系统建设
  • 了解评测方法论(如LLM-as-Judge、对话仿真),有评测相关开发经验更佳
  • 逻辑清晰,自驱力强,能够跨团队沟通并在快速迭代中聚焦重点

申请策略

  • 提前了解滴滴Fintech的业务方向以及Agent在金融场景的应用,面试中展现对业务的理解
  • 准备一个与评测或AI平台相关的项目复盘,用STAR法则清晰阐述你的价值和思考
  • 突出后端架构设计能力:用具体项目展示你如何设计高扩展性平台,解决复杂业务问题
  • 强调AI相关背景:如有大模型、Agent、RAG等项目经验,务必详细描述你贡献的技术环节
  • 体现质量意识:凸显自动化测试、评测体系搭建经验,尤其是涉及AI质量保障的项目
  • 量化成果:用数据说明你优化的系统性能、降低的标注成本或提升的评测准确度
  • 补齐AI评测方法:学习LLM-as-Judge、对话仿真、RAG评估的常用技术,并动手实践
  • 熟悉主流大模型API:OpenAI、Anthropic或国产模型的使用,了解Agent框架(如LangChain)

面试指南

  • 对于系统设计题,先明确需求和目标,再拆解核心模块(如评测执行、数据管理、结果分析),最后说明技术选型和扩展性考虑
  • 对于评测方法题,可先分定性(对话质量、安全性)和定量(成功率、准确率),再介绍LLM-as-Judge的实现和校准方法,最后强调结合人工抽检保证可信度
  • 对于项目经验题,使用STAR(情境、任务、行动、结果)框架,突出你的具体贡献、技术难点和量化收益
  • 如何设计一个Agent评测平台?你会考虑哪些维度和架构?
  • 你如何评估一个RAG系统或Agent的效果?具体用什么指标和方法?
  • 有使用LLM-as-Judge的经验吗?如何避免评测偏差?
  • 如果Agent出现效果劣化,你如何快速定位并解决?
  • 请介绍一个你主导的复杂后端项目,遇到的最大技术挑战是什么?

职位点评

76
综合评分

大厂AI平台,前沿技术栈,薪资有竞争力,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长、渴望在大模型与Agent领域深入发展的求职者,同时能接受现场办公和一定工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活60
使命价值70

薪资福利

75中等

上市大厂,薪资福利有竞争力,但具体薪资未在JD中披露,存在一定不确定性。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

技术前沿,深度涉及大模型、Agent、RAG,并有平台架构挑战,成长空间大,但成长信号未在JD中明确说明。

技术前沿前沿/新兴技术
技术栈Python、Java、大模型、Agent、RAG、LLM-as-Judge
业务类型ambiguous

工作生活

60中等

办公地点需现场,未明确WLB,但作为大厂技术岗可能面临一定加班压力,整体灵活性一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI赛道高速增长,评测平台对Agent质量有重要社会价值,但JD未强调使命感,整体意义感中等偏上。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs