十篇指南 · 阅读顺序

01什么是 AI 智能体 02AI 智能体的类型 03AI 智能体评估 04构建流程与顺序 05智能体记忆 06工具调用与 MCP 07多智能体系统 08智能体失效模式 09运行智能体的成本 10智能体框架

智能体专题

网络上的 AI 智能体 智能体即服务

模型对比

AI 智能体对比 — 即将上线

新闻

全球 AI 智能体新闻 新加坡智能体新闻

评估

快速就绪自测

AiAgentNook

AiAgentNook 是做什么的 指南是如何写成的

AI 智能体评估:如何知道它真的有效

简要回答

要测试 AI 智能体,就给它一些你能核对结果的真实任务,数一数它成功的次数。这个数字就是任务成功率。同时也要关注智能体是否稳定、够不够快、花多少钱。SWE-bench、GAIA、τ-bench、OSWorld 这类公开测试用来比较模型;你自己准备的 20–50 个真实案例才能测试你的智能体。

演示只能说明智能体能成功一次。评估问的才是真正重要的问题:它多久成功一次?花多少钱?又是怎么失败的?

图 03 — 一次成功是演示;成功率才是评估

关键数字是任务成功率。挑一组你能核对结果的真实任务, 让智能体去跑,数一数它赢了多少次。公开基准测试——任何人都能运行的 共享测试——原理相同。SWE-bench Verified 用真实的 GitHub 缺陷报告 测试编程智能体,由每个项目自带的测试来判分 [1]。 GAIA 测试通用助手,题目需要用工具、走好几步才能答出来 [2]。 τ-bench 让客服智能体与模拟客户对话,并设有不能违反的规则 [3]。 OSWorld 则在真实的桌面任务上测试操控电脑的智能体 [4]

基准测试能帮你选模型,但它们说明不了你的任务。要测你的任务, 就得搭建自己的测试集。哪怕只有 20–50 个真实案例、配上清晰的通过标准, 也比凭感觉强。每次改动提示词、工具或模型,都用同样的方式给这套测试集打分 [5]。 有些结果没法自动核对。常见的做法是让另一个 AI 模型按照清单给答案打分—— 大家称之为“LLM 评审”(LLM-as-judge)。在信任它之前,先抽样比对它的 评分和人工评分。

一次成功是演示。成功才是评估。

成功率掩盖了什么

两个平均分相同的智能体,行为可能截然不同。τ-bench 有一个叫 pass^k 的指标能揭示这一点。它问的是:同一个任务运行 k 次,智能体是否 每一次都成功?随着 k 增大,即使很强的智能体也会大幅下滑 [3]。 同时也要跟踪每个任务的成本和速度——智能体走的每一步都要花钱, 不只是最后那个答案。还要阅读失败的运行记录。智能体错在哪里, 比错得多频繁更重要。选错工具、无视工具的输出、不知道何时停手, 是三种不同的问题,解决办法也不同。只有读运行记录才能把它们分清。

安装在管道与阀门之间的压力表
图版 03 — 信任需要仪表:先测量,再相信 摄影 — Anton Savinov,Unsplash

资料来源

  1. Jimenez et al. — SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, arXiv 2310.06770, Oct 2023
  2. Mialon et al. — GAIA: A Benchmark for General AI Assistants, arXiv 2311.12983, Nov 2023
  3. Yao et al. (Sierra) — τ-bench: A Benchmark for Tool-Agent-User Interaction, arXiv 2406.12045, Jun 2024
  4. Xie et al. — OSWorld: Benchmarking Multimodal Agents in Real Computer Environments, arXiv 2404.07972, Apr 2024
  5. Claude docs — Define success criteria and build evaluations (platform.claude.com)

常见问题

如何衡量一个 AI 智能体是否有效?

给智能体一组你能核对结果的真实任务。数一数它成功的次数——这就是任务成功率。然后重复运行,看它是否稳定;跟踪每个任务的成本和速度;并阅读失败的运行记录,看智能体错在哪里。

AI 智能体有哪些基准测试?

SWE-bench Verified 用真实的 GitHub 缺陷报告来测试编程智能体。GAIA 用需要工具、多个步骤才能回答的问题来测试通用助手。τ-bench 让客服智能体在既定规则下与模拟客户对话来测试它们。OSWorld 用真实的桌面任务来测试操控电脑的智能体。基准测试帮你挑模型;你自己的测试集才能检验你的智能体。

什么是 pass^k?

这是 τ-bench 提出的可靠性指标。它衡量的是:同一个任务重复运行 k 次,智能体每一次都成功的概率,而不只是成功一次。随着 k 增大,即使很强的智能体也会大幅下滑。这就是为什么一个平均成功率可能掩盖真实的不稳定。