AI 智能体评估:如何知道它真的有效
要测试 AI 智能体,就给它一些你能核对结果的真实任务,数一数它成功的次数。这个数字就是任务成功率。同时也要关注智能体是否稳定、够不够快、花多少钱。SWE-bench、GAIA、τ-bench、OSWorld 这类公开测试用来比较模型;你自己准备的 20–50 个真实案例才能测试你的智能体。
演示只能说明智能体能成功一次。评估问的才是真正重要的问题:它多久成功一次?花多少钱?又是怎么失败的?
关键数字是任务成功率。挑一组你能核对结果的真实任务, 让智能体去跑,数一数它赢了多少次。公开基准测试——任何人都能运行的 共享测试——原理相同。SWE-bench Verified 用真实的 GitHub 缺陷报告 测试编程智能体,由每个项目自带的测试来判分 [1]。 GAIA 测试通用助手,题目需要用工具、走好几步才能答出来 [2]。 τ-bench 让客服智能体与模拟客户对话,并设有不能违反的规则 [3]。 OSWorld 则在真实的桌面任务上测试操控电脑的智能体 [4]。
基准测试能帮你选模型,但它们说明不了你的任务。要测你的任务, 就得搭建自己的测试集。哪怕只有 20–50 个真实案例、配上清晰的通过标准, 也比凭感觉强。每次改动提示词、工具或模型,都用同样的方式给这套测试集打分 [5]。 有些结果没法自动核对。常见的做法是让另一个 AI 模型按照清单给答案打分—— 大家称之为“LLM 评审”(LLM-as-judge)。在信任它之前,先抽样比对它的 评分和人工评分。
一次成功是演示。成功率才是评估。
成功率掩盖了什么
两个平均分相同的智能体,行为可能截然不同。τ-bench 有一个叫 pass^k 的指标能揭示这一点。它问的是:同一个任务运行 k 次,智能体是否 每一次都成功?随着 k 增大,即使很强的智能体也会大幅下滑 [3]。 同时也要跟踪每个任务的成本和速度——智能体走的每一步都要花钱, 不只是最后那个答案。还要阅读失败的运行记录。智能体错在哪里, 比错得多频繁更重要。选错工具、无视工具的输出、不知道何时停手, 是三种不同的问题,解决办法也不同。只有读运行记录才能把它们分清。

资料来源
- Jimenez et al. — SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, arXiv 2310.06770, Oct 2023
- Mialon et al. — GAIA: A Benchmark for General AI Assistants, arXiv 2311.12983, Nov 2023
- Yao et al. (Sierra) — τ-bench: A Benchmark for Tool-Agent-User Interaction, arXiv 2406.12045, Jun 2024
- Xie et al. — OSWorld: Benchmarking Multimodal Agents in Real Computer Environments, arXiv 2404.07972, Apr 2024
- Claude docs — Define success criteria and build evaluations (platform.claude.com)
常见问题
如何衡量一个 AI 智能体是否有效?
给智能体一组你能核对结果的真实任务。数一数它成功的次数——这就是任务成功率。然后重复运行,看它是否稳定;跟踪每个任务的成本和速度;并阅读失败的运行记录,看智能体错在哪里。
AI 智能体有哪些基准测试?
SWE-bench Verified 用真实的 GitHub 缺陷报告来测试编程智能体。GAIA 用需要工具、多个步骤才能回答的问题来测试通用助手。τ-bench 让客服智能体在既定规则下与模拟客户对话来测试它们。OSWorld 用真实的桌面任务来测试操控电脑的智能体。基准测试帮你挑模型;你自己的测试集才能检验你的智能体。
什么是 pass^k?
这是 τ-bench 提出的可靠性指标。它衡量的是:同一个任务重复运行 k 次,智能体每一次都成功的概率,而不只是成功一次。随着 k 增大,即使很强的智能体也会大幅下滑。这就是为什么一个平均成功率可能掩盖真实的不稳定。