
中国平安
AI智能体评测工程师
AI智能体评测工程师
发布于 大约 1 小时前普通员工/个人贡献者
深圳市
中级经验
全职员工
仅现场办公
本科
测试开发
Llm
Nlp
Pytest
多模态
安全合规
智能体
红队对抗
自动化测试
AI 估算 · 25k–40k
年包超过30万,且属于AI前沿方向,相关经验稀缺,薪资竞争力强。综合评估月薪2.5-4万。
职位详情
关于这个职位
该职位负责搭建大模型及智能体的自动化评估体系,涵盖多模态、多任务场景的标准化性能指标定义与测试
同时深入安全合规与红蓝对抗,通过红队演练识别模型漏洞,并参与AI自动化评测平台研发
适合对LLM、Agent安全评估有浓厚兴趣的技术人才
最低要求
教育背景与经验
(1)计算机、人工智能、软件工程、数学或相关专业本科及以上学历
(2)3年以上软件测试/QA经验,其中至少 1-2年 专注于 LLM、NLP 或智能体(Agent)评测领域
(3)具备极强的合规意识
硬核技术技能 (Hard Skills)
(1)编程与自动化: 精通 Python,具备扎实的自动化测试框架开发能力(Pytest)
具备 Java 代码阅读能力,能与后端研发无缝协作
(2)LLM 原理与架构: 深入理解 Transformer 架构、预训练/微调(Pre-training/Fine-tuning)、上下文学习(In-Context Learning)及推理优化机制
熟悉主流大模型 API 特性及局限性
(3)智能体技术栈: 深刻理解 Agent 工作流(ReAct, Chain-of-Thought),熟悉任务规划、工具调用(Tool Calling)、记忆机制及多步推理逻辑
(4)安全攻防知识: 熟悉常见大模型攻击向量
工作职责
岗位职责:
构建智能化全维评估体系
(1)体系设计: 主导搭建面向多任务、多模态(文本/视觉/代码)的大模型及智能体自动化评估框架,定义标准化的性能指标(如准确性、鲁棒性、响应延迟、资源消耗)
(2)场景覆盖: 深度覆盖逻辑推理、长文本摘要、复杂指令遵循、多轮对话保持等核心场景,通过量化数据精准刻画模型能力边界
深化安全合规与红蓝对抗 (Security & Red Teaming)
(1)主动防御: 建立金融级 AI 安全合规基线,实施全周期的内容风控测试,精准识别偏见歧视、幻觉生成、敏感数据泄露及隐私侵犯风险
(2)对抗演练: 主导红队演练(Red Teaming)与对抗样本攻击测试,模拟极端恶意输入,挖掘模型潜在漏洞,提升系统在复杂对抗环境下的鲁棒性与内容可控性
研发 AI 效能引擎与自动化平台 (AI Efficiency Engine)
(1)平台构建: 主导/参与 AI 自动化评测平台的研发,探索“以 AI 评测 AI”的创新模式,利用大模型生成测试用例、自动打分及反馈报告,实现评测闭环
优先资格
有金融、风控、安全领域 AI 项目落地经验者优先
AI 洞察
优缺点分析
优点
- 处于AI安全评测的前沿领域,个人技能成长迅速,市场稀缺性强
- 工作内容涉及评估框架、平台研发和红队对抗,综合性强,有利于建立多维能力
- 需要同时掌握测试、安全、大模型原理等多领域知识,学习曲线陡峭
- 涉及金融级合规要求,工作严谨性高,容错空间小
缺点 / 挑战
- 依托平安的金融科技场景,接触真实复杂的业务需求,技术挑战大
- 行业迭代快,需持续跟进最新攻击手段和模型演进,压力较大
- 适合对LLM、Agent安全有强烈兴趣,喜欢技术研究与对抗挑战,且能适应快节奏的工程师
角色解读
- 可向AI评测专家或质量保障负责人发展,主导企业级评测体系建设
- 有机会深入大模型安全与对齐领域,成为AI红队核心成员
- 可横向转型为AI产品经理或AI研发工程师,拓展职业宽度
- 设计并落地自动化评测框架,覆盖文本、视觉、代码等多模态大模型任务,定义准确性、鲁棒性等指标
- 实施金融级安全合规测试,通过红队演练和对抗样本挖掘模型在偏见、幻觉、数据泄露等方面的漏洞
- 参与“以AI评测AI”的效能引擎研发,利用大模型自动生成测试用例、打分并生成反馈报告
- 精通Python与Pytest,能编写自动化测试框架,并具备Java代码阅读能力
- 深入理解Transformer架构、LLM预训练/微调、上下文学习及推理优化,熟悉主流大模型API
- 掌握Agent工作流(ReAct、Chain-of-Thought)、任务规划、工具调用和记忆机制
- 了解大模型常见攻击向量,具备安全攻防知识与合规意识
申请策略
- 面试前了解公司AI战略和金融场景,准备相关项目故事
- 可主动提供一个小型评测demo或演示脚本,展现动手能力
- 突出大模型评测或NLP测试项目的量化成果,如准确率提升、漏洞发现数量等
- 展示自动化测试平台的设计与实现经验,体现工程能力
- 如果有金融行业AI风控或安全合规背景,务必强调
- 列出熟悉的安全攻防案例,如提示注入、越狱攻击等
- 可深入学习LangChain、LlamaIndex等Agent框架,理解工具调用细节
- 了解主流大模型API和评测基准(如MMLU、HELM、BIG-Bench),并实践红队工具
面试指南
- 对于评测设计题,可从指标定义、场景选取、数据构建、结果分析和迭代闭环五个维度回答
- 对于安全类问题,可围绕风险识别、攻击模拟、漏洞验证、修复建议和回归测试的流程展开
- 对于原理类问题,先简述概念,再结合实际项目说明应用,突出你的理解深度
- 如何设计一个针对多轮对话能力的大模型自动评估方案?
- 请举例说明你如何识别和修复一个模型安全漏洞
- 你如何平衡评测准确性与测试效率?
- 请解释ReAct框架的工作原理及其在评测中的应用
- 如何看待大模型在金融领域的内容风控挑战?
职位点评
76
综合评分
高薪前沿AI评测岗,技术含量高,但工作强度可能较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、对AI安全感兴趣,且能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展88
工作生活50
使命价值78
薪资福利
80较高
职位提供超过30万的年薪,且公司为上市企业,薪资待遇和稳定性较好。
薪资信号偏高 (25K-40K/月)
成长发展
88较高
岗位涉及前沿AI技术,工作内容具有较高技术挑战,能显著提升个人在大模型评测与安全领域的专业能力。
技术前沿前沿/新兴技术
技术栈Python、Pytest、LLM、Agent、Transformer、ReAct、Red Teaming
业务类型cost_center
工作生活
50较低
工作地点在深圳,JD未说明弹性办公或远程,推测以现场办公为主,且高压任务较多。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
78中等
岗位聚焦AI安全与合规,有助于提升大模型应用的可靠性,具备一定的社会价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号安全合规、内容风控
创新程度积极采用新技术
中国平安 的其他在招职位
相似职位推荐
Watch Jobs