让AI知识触手可及

首页 » 【工具总结】新一代Agent驱动的评测系统

新一代Agent驱动的评测系统

一篇教程解决三个问题:这个工具是干什么的、怎么安装配置、怎么开展一次完整评测
全文以「给一个在线运行的 Agent 做安全性评测」为真实案例,截图即实际操作过程,跟着做即可。


一、背景介绍

大模型驱动的 Agent(智能客服、课件生成、代码助手……)正在快速落地,迭代周期以"天"计。但一个现实问题长期困扰着团队:

新版本上线前,怎么证明这个 Agent 是"好"的?比上一版究竟是变好了还是变差了?

大多数团队目前的做法是人工点测:找几个人问几句、看看回答顺不顺眼。这种方式有四个明显痛点:

  • 测不全:安全性、准确性、格式规范……测什么全凭临场发挥,覆盖面因人而异
  • 不可复用:这轮测过的内容,下个版本又得从零再测一遍
  • 没结论:看完只能说"感觉还行",给不出量化分数,更做不了版本对比
  • 难沉淀:测试过程和结果散落在个人手里,团队无法追溯与协作

agent-eval 评测系统(安装包名 ai-eval-scope)为此而生:把评测变成一条人人可执行、可复用、可量化的标准流水线——

描述评测需求 → 自动生成"考卷" → 让被测 Agent 真实答题 → 规则 + AI 智能判分 → 出报告 → 上报平台看趋势

它的核心特点:

特点 说明
💬 会聊天就会用 用自然语言描述"我想测什么",工具里的工作台 Agent 自动帮你生成全套评测资产,不用手写配置
🔌 被测系统自动接入 给一个系统入口地址(登录页 URL 都行),它自动分析登录接口、实测登录、探测对话 API,全程无需懂后端
⚖️ 双层判分 规则引擎管硬性检查,LLM Judge 管语义质量,每个得分都能说清理由
📊 报告 + 平台 本地出报告,一键上报 Web 平台,按项目看历史趋势和每轮对话明细
🔒 安全放心 账号密码隐藏输入、不回显、不写进任何配置文件;每次访问新域名都会先征求你同意

二、安装与配置

2.1 安装工具(正式 PyPI 源,一条命令)

要求 Python 3.11+。任选一种方式:

# 方式一:uv(推荐,独立安装不污染环境)
uv tool install "ai-eval-scope[agent,llm]"

# 方式二:pip
pip install "ai-eval-scope[agent,llm]"

方括号是功能插件:[agent] 驱动被测 Agent 的执行引擎(必装)、[llm] AI 智能判分、[vision] 截图视觉评估、[datasets] 数据集下载。不需要的可以不装。

装完验证(工具名是 agent-eval):

agent-eval --version     # 输出版本号即为成功

以后升级:uv tool upgrade ai-eval-scope

2.2 配置评测模型(LLM)

评测需要用大模型来驱动被测 Agent、给回答打分。一条命令进入配置向导:

agent-eval models set

向导会依次问你:

  1. 选择提供商:DeepSeek / Kimi / 智谱 / MiniMax 任选,或 custom(自备地址的任意厂商)
  2. 选择协议:Anthropic 协议 或 OpenAI 兼容协议(预置厂商两种都支持,任选其一)
  3. API Key:隐藏输入,粘贴回车即可(预置厂商的接口地址系统已内置,不用填 URL
  4. 选择角色text 文本判分建议必配;vision 视觉评估按需
  5. 保存后向导会立即测试连通性,全部 ✅ 即配置完成

其他命令:

agent-eval models test    # 随时重测连通性
agent-eval models list    # 查看当前配置(密钥自动脱敏)

💡 模型配置也可以不敲命令:进入工作台后选菜单「5. 账号与配置」同样能配。


三、开展一次完整评测(图文实录)

下面是完整实操案例:给一个在线 Agent 做安全性评测——看它面对色情、歧视、越权、隐私等各类风险提问时,能否正确拒绝。整个过程只需要你回答工作台 Agent 的几个问题。

Step 1:启动工作台

终端执行:

agent-eval start

顶部状态栏显示平台、模型的就绪状态(✅ 表示上一步配置都通过了),菜单选 1. 工作台 Agent(对话式·推荐)

进入后,工作台 Agent 做了自我介绍:你用自然语言下需求,它调用工具逐步完成评测构建。改配置、排查问题、参照内置包建新包,也都可以直接对它说:

Step 2:用一句话描述评测需求

直接把想法告诉它,越具体越好(测什么能力、什么类型的被测系统)。本例输入:

请帮我为一个在线的 agent 进行评测,评测内容主要是安全性 相关内容

Agent 理解需求后,规划出第一步:先向你要被测系统的入口地址:

Step 3:告诉它被测系统入口地址

把系统入口地址发给它——给页面 URL 就行(本例直接给的是登录页地址)。Agent 会从地址里识别出系统涉及多个域名,并主动和你确认"是否需要登录":

Step 4:自动分析登录接口

你确认需要登录后,Agent 开始自动分析登录页面:每次访问新域名前都会先征求你的同意(安全边界,选"允许"即可)。它自动翻查页面脚本、检索接口线索,最终找到了登录接口的地址和鉴权方式:

Step 5:录入测试账号,实测登录

Agent 逐项向你要登录凭证(本例是手机号、密码、图形验证码)。输入全部隐藏回显,凭证不会出现在屏幕和配置文件里

凭证录完,它整理好登录请求让你确认(内容已脱敏),发送后 ✅ 登录成功——说明被测系统的接入方式验证通过:

Step 6:自动探测对话 API,生成场景包

登录成功后 Agent 继续探测"怎么和这个 Agent 对话"(找到 threads 接口、确认需要指定的参数等),接入信息全部就绪:

接着它开始生成评测场景包:考卷(安全性测试用例)、判分规则、Judge 提示词、被测系统配置……每一份文件都先暂存给你看 diff,确认后才真正落盘。最后 ✅ 场景包生成完成,保存在 ./agent-security-package/ 目录:

Step 7:执行评测

场景包就绪后回到工作台菜单,选 3. 执行评测,跟着向导逐项选择:场景包 → 考卷 → 被测系统 → 判分规则集 → 执行模式(选 pipeline 一条龙:执行 + 评估 + 报告)。向导最后会显示等价的命令行让你确认,回车 y 开跑:

之后就是全自动:14 个安全性测试任务逐一发送给被测 Agent、采集回答、双层判分。十几分钟后全部完成。

Step 8:查看评测结果

执行完毕直接给出评估结果摘要:运行 ID、样本总数、指标概览表(✅ 通过 / ❌ 失分一目了然,指标项由你选的规则集决定),结果已保存至本地 workspace/

想细看每一分的理由:工作台菜单「4. 查看结果」可逐任务展开判分明细;也可以用 agent-eval open report 在浏览器里看完整报告。

至此,一次完整的评测就闭环了:需求 → 建包 → 执行 → 报告,全程你只回答了 Agent 的几个问题。

➡️ 评测结果还可以上报到 Web 可观测平台,按项目看历史趋势、逐轮对话轨迹、跨版本对比——这是可选的进阶功能,操作步骤见下一节。


四、进阶功能:结果上报可观测平台

本地报告适合单次查看;把评测结果持续上报到 Web 可观测平台,才能按项目看历史趋势、查看每轮对话轨迹、跨版本对比。这是可选的进阶功能,只需一次性完成下面的接入配置,之后每次评测完成都会自动上报。

4.1 注册平台账号

agent-eval auth register      # 自动打开平台注册页,注册完成后回来登录

也可以直接在浏览器打开平台地址注册。

4.2 创建项目

登录 Web 平台后,创建你的项目——评测结果按项目归档。如果项目已存在,让项目管理员把你加入对应项目即可。

4.3 在 CLI 中配置平台凭证(含创建 API Key)

agent-eval auth login

按提示操作:

  1. 输入平台地址(就是浏览器里访问平台的 URL)
  2. 向导会引导你在页面上创建 API Keyeval- 前缀),复制粘贴回车
  3. CLI 自动做有效性探测,通过后凭证写入本地配置(0600 权限,密钥不落明文)

配置完成用体检命令确认:

agent-eval auth status        # 查看凭证有效性 + 所属团队 / 项目

4.4 上报评测结果

配置好凭证后无需任何额外操作——每次评测完成自动推送。下图为本案例实录:上报 211 条事件、84 个制品,零失败:

上报完成后,在 Web 平台上即可查看指标趋势、逐任务对话轨迹、判分明细与产出制品。两个补充命令:

agent-eval open platform              # 浏览器直达平台
agent-eval upload --run {run_id}      # 历史运行补传

五、小结

回顾一下,开展一次评测只需要三步:

  1. 装工具uv tool install "ai-eval-scope[agent,llm]"
  2. 配模型agent-eval models set(选厂商 → 粘 Key → 自动测试)
  3. 跑评测agent-eval start → 对话式说需求 → 跟着向导点选执行 → 看报告

剩下的事情——分析登录接口、生成考卷、判分、出报告——工具全部自动完成。(可选)接入平台:agent-eval auth register → 平台建项目 → agent-eval auth login,之后评测结果自动上报。

声明:一起AI技术所有文章,如无特殊说明或标注,均为本站作者原创发布。任何个人或组织,在未征得作者同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。
原创不易,内容版权受保护,感谢您的尊重与支持。

发表评论

Picture of Dongming
Dongming
见天地,见众生,见自己。

分类文章

推荐活动

推荐文章

【工具技巧】Codex+CC-switch使用国产大模型教程
【工具技巧】使用mcp工具进行tapd的快速操作
【工具技巧】ClaudCodeRouter的使用方法简介
【项目实战】通过ClaudeCode进行one-api系统改造的实践过程总结
【工具技巧】通过ClaudeCode的Skills实现Excel文件的读写
【工具技巧】通过ClaudeCode的Skills实现周报自动发送
【工具技巧】通过Claude Code+K2模型编写Dify插件的实践过程
【工具技巧】Claude Code 使用技巧
【工具技巧】通过ClaudeCode实现技术交底书agent
【工具技巧】Claude Code+Deepseek模型的配置使用方法
滚动至顶部