
小红书
AI评测平台架构师
AI评测平台架构师
发布于 大约 15 小时前普通员工/个人贡献者
北京市 / 上海市
高级经验
全职员工
仅现场办公
本科
软件工程
Go
Llm
Prompt Engineering
Rag
Sql
分布式系统
评测平台
AI 估算 · 50k–80k
AI架构师稀缺,小红书作为超大型互联网公司,薪资竞争力强,结合架构师级别和市场行情,月薪50-80K,16薪。
职位详情
关于这个职位
作为小红书AI评测平台架构师,你将主导构建统一、可扩展的AI评测基础设施,覆盖大模型、Agent、RAG、Tool等AI应用的质量评估
你需要设计评测数据资产体系、自动化执行引擎、评审Agent能力及线上质量闭环,推动AI质量的持续提升
这是一个技术深度与广度兼具的架构岗位,适合有分布式系统和大模型评测经验的后端或平台架构师
最低要求
本科及以上学历,计算机、软件工程、人工智能、数据科学等相关专业,具备5年以上后端、数据平台、质量平台或分布式系统研发经验
主导或深度参与过评测平台、实验平台、数据平台、质量平台或大规模任务执行系统的架构设计
熟练掌握 Python、Java、Go 中至少一种编程语言,具备良好的 SQL、数据处理及后端工程能力
熟悉大模型和 AI Agent 应用链路,理解 Prompt、RAG、Tool Calling、ReAct、上下文工程及多轮对话等核心概念
理解模型评测、Agent 评测、过程评测和端到端评测的差异,能够针对不同评测对象设计数据、指标、规则和执行方式
熟悉 LLM-as-a-Judge、人工标注、人机一致率、评审偏差、基准测试和回归评测等方法
具备数据资产与数据治理能力,熟悉评测集版本、数据血缘、质量校验、权限控制及敏感数据处理
具备分布式任务执行系统设计能力,熟悉任务调度、并行计算、失败重试、幂等、限流、缓存及成本治理
具备统计与实验分析能力,理解抽样、显著性、置信区间、A/B 实验,以及线上指标与离线指标的相关性验证
具备评测指标和质量标准设计能力,能够平衡客观指标、人工判断、模型评审和业务结果之间的关系
能够将评测结果转化为可执行的产品、模型、Prompt、上下文、知识、工具和工程优化建议,而非仅提供评测分数
具备较强的跨团队推动能力,能够协调产品、算法、工程、数据和标注团队建立统一质量标准
工作职责
主导 AI 评测平台总体架构设计,建设统一、可扩展的评测基础设施,支持大模型、Agent、RAG、Tool及端到端 AI 应用的质量评估
建立分层评测体系,覆盖模型能力评测、Agent 推理过程评测、工具调用评测、上下文与记忆评测、RAG 评测及端到端体验评测
设计评测数据资产体系,统一管理评测集、线上采样、Bad Case、人工标注、合成数据和竞品数据,支持数据清洗、去重、分层、版本、血缘及权限治理
建设评测集持续演进机制,将新业务场景、线上问题、模型升级和产品变化转化为新增评测样本,保持评测覆盖度、区分度和时效性
设计统一的评测指标与规则体系,支持客观指标、规则评测、模型评审和人工评审,并建立指标版本、规则版本和场景适用范围的管理机制
设计自动化评测执行引擎,支持模型与 Prompt 矩阵、并行批跑、任务调度、失败重试、断点恢复、结果复用及大规模评测的成本控制
建设 LLM-as-a-Judge 与评审 Agent 能力,包括评审 Prompt、评分标准、证据引用、多评审器仲裁,以及人机一致率、评审稳定性和偏差校准
建设 Agent 过程评测能力,基于执行轨迹评估任务规划、推理步骤、上下文使用、工具选择、参数生成、工具结果利用和最终答案质量
建立线上质量闭环,打通用户反馈、业务指标、线上 Trace、异常日志和离线评测,通过自动归因和 Case 聚类持续发现质量问题
建设回归评测与发布门禁机制,对模型、Prompt、知识库、工具及 Agent 流程变更进行版本对比、基线回归、劣化检测和发布准入
建设评测分析与归因平台,从模型、Prompt、Context、RAG、Tool及工程链路等维度定位问题,推动优化建议进入产品、算法和研发流程
探索基于评测信号的 Agent 自进化能力,将线上反馈、执行轨迹、评测结果和归因结论转化为可验证的 Prompt、Context、Tool、知识及流程优化建议,并建立自动生成、沙箱验证、回归评测和人工确认机制
制定 AI 评测数据、指标、协议和平台接入标准,推动不同业务场景复用统一评测能力,同时保留业务自定义指标与规则的扩展空间
优先资格
加分项:
有大型 AI 评测平台、Agent Eval、LLM-as-a-Judge、评审 Agent 或自动归因系统建设经验
有实验平台、标注平台、数据闭环平台或质量门禁系统建设经验
有 Agent 轨迹评测、RAG 评测、事实性评测、工具调用评测或多轮对话评测经验
有搜索、推荐、知识问答或复杂任务型 AI 应用的评测体系建设经验
有基于线上反馈和评测信号推动 Agent 自动归因、策略优化或自进化的探索经验
有开源评测框架贡献、Benchmark 建设或跨团队质量标准制定经验
AI 洞察
优缺点分析
优点
- 站在AI技术前沿,接触大模型、Agent等最新领域,技术成长快
- 职位影响力大,将主导公司级AI评测基础设施,成果可复用至全公司
- 薪资待遇丰厚,作为高级架构师薪酬具有竞争力
- 技术复杂度高,需要同时掌握分布式系统、AI链路、数据治理等多方面知识
- 跨团队协调工作量大,需推动产品、算法、工程等多方统一质量标准
- 适合有深厚后端和平台架构经验、对AI评测有浓厚兴趣、喜欢系统性解决复杂问题的技术专家
缺点 / 挑战
- 小红书平台数据量大、业务场景丰富,有大量实际问题和挑战
- AI领域变化快,评测体系需持续迭代,工作压力较大
角色解读
- 技术纵深:从评测平台架构师成长为AI基础设施或AI平台方向的技术专家
- 横向拓展:深入理解AI应用全链路,转型为AI系统架构师或AI产品技术负责人
- 管理路径:带领评测平台团队,逐步成为AI质量与基础设施的团队负责人或总监
- 设计并搭建小红书AI评测平台的整体架构,支撑大模型、Agent、RAG等人工智能应用的质量评估
- 建立分层评测体系、数据资产体系和自动化执行引擎,实现评测的高效和可扩展
- 建设LLM-as-a-Judge等评审能力,推动线上质量闭环和回归评测机制
- 与产品、算法、工程等多团队协作,将评测结论转化为优化建议,牵引AI产品质量提升
- 精通Python/Java/Go中至少一种,具备扎实的后端工程能力和分布式系统设计经验
- 深入理解大模型和AI Agent链路,如Prompt、RAG、Tool Calling、ReAct等
- 熟悉模型评测、Agent评测、数据治理及分布式任务调度技术
- 具备统计与实验分析能力,能够设计评测指标并平衡客观与主观评估
申请策略
- 在简历中具体化你的架构设计方案,最好有量化成果
- 了解小红书目前AI应用场景(如搜索、推荐、内容理解),思考如何用评测平台赋能
- 突出主导或深度参与的评测平台、实验平台或质量平台架构设计经历
- 强调大模型、Agent、RAG等AI相关项目的实战经验
- 展示分布式系统设计能力,如任务调度、数据治理、高并发等
- 提及跨团队协作推动技术标准或质量体系建设的成果
- 补充LLM-as-a-Judge、Agent评测等前沿知识,可阅读相关论文或开源项目
- 加深对数据治理和统计学知识的理解,特别是评测指标设计与实验方法
面试指南
- 对于架构设计类问题:先明确需求边界,然后分层讲述(数据层、执行层、指标层等),强调扩展性和复用性
- 对于评测质量问题:从数据、指标、流程三个维度分析,结合具体案例展示解决思路
- 对于跨团队协作类问题:突出沟通策略、标准制定和迭代优化的能力
- 请描述你主导设计的评测平台或类似系统的架构,以及设计决策背后的思考
- 如何设计一个可支持多种AI应用(如Agent、RAG)的通用评测框架?
- 如何平衡评测的准确性和效率?请举例说明
- 如何设计评审Agent来保持人机一致率?遇到过哪些挑战?
- 当线上反馈与离线评测结果不一致时,你会如何排查和解决?
职位点评
72
综合评分
小红书AI评测架构师,前沿技术栈,高薪但高强度,适合技术极客。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和发展机会的求职者,对WLB要求不高,愿意投入高挑战项目。
表现最好
成长发展
相对薄弱
工作生活
薪资福利78
成长发展92
工作生活40
使命价值65
薪资福利
78中等
该职位薪资属于市场高端水平(架构师级别),且小红书福利完善,但未在JD中明确列出具体福利项,补偿性动机满足较好。
薪资信号市场水准 (50K-80K/月)
成长发展
92较高
职位技术栈前沿(LLM、Agent等),具备极强的发展性和成长空间,JD中提及大量成长相关要素,但未明确晋升通道。
技术前沿前沿/新兴技术
技术栈LLM、Agent、RAG、Prompt、分布式系统、数据治理
成长机会体系、架构设计、建设、探索
业务类型profit_center
工作生活
40较低
职位要求现场办公,且AI平台建设任务重,未提及WLB或弹性工作,可能加班较多。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
65中等
职位赋能AI质量提升,属于推动技术进步的岗位,但未明确社会价值导向,意义感中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小红书 的其他在招职位
相似职位推荐
Watch Jobs