
滴滴出行
资深研发工程师Agent-BOSS
资深研发工程师Agent-BOSS
发布于 大约 1 小时前普通员工/个人贡献者
杭州市
高级经验
全职员工
仅现场办公
本科
后端开发
Llm-As-Judge
Rag
回归测试
大模型
自动化评测
质量监控
AI 估算 · 25k–45k
该职位涉及大模型等前沿技术,市场需求大,滴滴平台稳定,结合杭州薪资水平,月薪25-45K合理。
职位详情
关于这个职位
该职位主要负责构建Agent评测平台,围绕大模型驱动的智能体应用,设计并落地自动化评测体系,覆盖对话质量、任务完成度、工具调用准确性等维度
你将与产品、运营团队协作,把评测结果转化为优化建议,持续提升Agent效果
适合对AI质量保障、大模型应用落地有热情的资深后端工程师
最低要求
本科及以上学历,计算机相关专业,3 年以上后端 / 平台研发经验
熟练掌握 Python/Java 等至少一种编程语言,具备扎实的编码能力,能独立完成平台核心模块的设计与开发
熟悉大模型、Agent、RAG 等 AI 技术,具备 AI Coding 研发经验,能够将AI应用于日常研发及系统建设中
逻辑清晰,具备较强的自驱力与跨团队沟通协作能力,能在业务快速迭代的环境下把握重点
工作职责
负责 Agent 评测平台的整体架构设计与研发,构建覆盖对话质量、任务完成度、工具调用准确性、安全合规等维度的自动化评测能力
设计并落地评测指标体系与评测集,结合业务场景持续扩充与迭代高质量测试数据,保障评测结果的科学性与可复现性
探索并应用 LLM-as-Judge、多轮对话仿真、用户模拟器等评测技术,提升评测效率与准确度,减少人工标注依赖
建设自动化回归测试与线上质量监控能力,快速发现 Agent 效果劣化、幻觉、越权调用等问题,推动问题闭环
与产品、运营团队紧密协作,将评测结果转化为可执行的优化建议,驱动 Agent 效果持续提升
优先资格
了解 LLM-as-Judge、对话仿真、用户模拟器等评测方法及有评测相关开发经验者优先
AI 洞察
优缺点分析
优点
- 大模型与Agent是当前最热门的赛道,技术前沿,个人成长空间大
- 滴滴作为上市大厂,平台稳定,能接触真实业务场景和丰富数据
- 评测平台处于早期建设阶段,有从0到1的主导机会,技术影响力强
- 与产品、运营紧密协作,能锻炼跨团队沟通能力和业务敏感度
- 业务迭代快,可能需要应对高强度的工作节奏,保证高质量交付
- 适合对AI技术有热情、喜欢解决复杂问题、并在快速迭代环境中自我驱动的资深工程师
缺点 / 挑战
- Agent评测领域尚不成熟,需要大量探索和创新,存在技术挑战和不确定性
- 需要同时掌握后端开发、AI技术和评测方法论,要求较高,学习压力大
角色解读
- 纵向晋升为技术专家或架构师,在AI评测领域深耕,成为该方向的技术带头人
- 横向拓展至AI基础设施、大模型应用研发等方向,参与更核心的Agent能力建设
- 随着大模型评测重要性提升,有机会成长为质量保障体系的负责人或AI平台负责人
- 负责Agent评测平台的整体架构设计与研发,构建自动化评测能力,覆盖对话质量、任务完成度、工具调用准确性等维度
- 设计评测指标体系与评测集,持续迭代高质量测试数据,确保评测结果的科学性与可复现性
- 探索并应用LLM-as-Judge、多轮对话仿真、用户模拟器等评测技术,提升评测效率,减少人工标注
- 建设自动化回归测试与线上质量监控,快速发现Agent效果劣化、幻觉、越权调用等问题,并推动闭环解决
- 扎实的后端开发能力,精通Python或Java,能独立完成核心模块设计开发
- 熟悉大模型、Agent、RAG等AI技术,具备AI Coding实际经验
- 了解LLM-as-Judge、对话仿真、用户模拟器等评测方法,有评测系统开发经验更佳
- 具备较强的自驱力与跨团队协作能力,适应快节奏业务迭代
申请策略
- 了解滴滴金融科技业务背景,尤其是Agent在金融场景的应用,面试时展现业务理解
- 准备一个完整的项目案例,讲述如何设计评测体系并解决实际问题
- 突出后端平台开发经验,尤其是核心模块架构设计案例
- 强调大模型、Agent、RAG相关项目实践,如基于LLM的应用开发或AI Coding经历
- 如有评测相关经验,如LLM-as-Judge、自动化测试平台建设,务必重点呈现
- 展示跨团队协作和推动项目落地的成果,用数据量化效果
- 补充学习LLM-as-Judge、对话仿真等评测方法,可阅读相关论文或开源项目
- 熟悉主流Agent框架(如LangChain、AutoGen)和RAG技术原理,并动手实践
面试指南
- 采用“评价维度-指标体系-评测集-评测方式”的结构化框架,先拆解质量维度,再定义可量化指标,然后构建测试集,最后选择合适的评测方式(如模型评分、规则校验)
- 强调数据驱动和闭环思维,例如通过小样本校准、人机对比校验LLM-as-Judge,并用线上监控反馈持续迭代
- 结合具体项目经验,用STAR法则描述场景、任务、行动、结果,突出量化成果
- 如何设计一个覆盖多维度的Agent评测平台?谈谈你的架构思路
- 你如何评估LLM-as-Judge的准确性和可靠性?如果遇到不一致怎么办?
- 在大模型应用中,如何检测和处理幻觉问题?你有相关经验吗?
- 如何设计自动化回归测试来应对Agent效果的持续迭代?
- 当评测结果与业务预期不符时,你会如何推动优化落地?
职位点评
66
综合评分
前沿大模型评测方向,技术成长空间大,但工作生活平衡可能一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和前沿领域探索的工程师,能够接受互联网工作节奏,希望在大厂平台获得挑战性机会。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展85
工作生活40
使命价值70
薪资福利
65中等
薪资未在JD中披露,但滴滴作为上市大厂通常提供有竞争力的薪酬和福利,稳定性较好。只是因为信息缺失,综合评分中等偏上。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
85较高
职位涉及大模型、Agent、RAG等前沿技术,且有从0到1搭建评测平台的机会,技术成长和职业发展空间很大。
技术前沿前沿/新兴技术
技术栈大模型、Agent、RAG、LLM-as-Judge、对话仿真、用户模拟器
业务类型ambiguous
工作生活
40较低
JD未提远程或弹性工作,且互联网公司普遍节奏较快,工作与生活平衡可能较难保证。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
Agent评测对AI安全可信落地有积极意义,符合行业发展趋势,但社会直接影响力一般。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Backend Developer - AI & Agentic Applications
思爱普 · 上海市AI 估算 · 25k-45kSAP China iXp Interns - Backend Software Development Intern
思爱普 · 上海市AI 估算 · 3k-6kSenior Web Software Engineer, AI Infrastructure
英伟达 · 上海市AI 估算 · 45k-65kSoftware Engineer
汇丰 · 广州市AI 估算 · 25k-45kSenior Software Engineer
汇丰 · 西安市AI 估算 · 20k-35k
Watch Jobs