十篇指南 · 阅读顺序

01什么是 AI 智能体 02AI 智能体的类型 03AI 智能体评估 04构建流程与顺序 05智能体记忆 06工具调用与 MCP 07多智能体系统 08智能体失效模式 09运行智能体的成本 10智能体框架

智能体专题

网络上的 AI 智能体 智能体即服务

模型对比

AI 智能体对比 — 即将上线

新闻

全球 AI 智能体新闻 新加坡智能体新闻

评估

快速就绪自测

AiAgentNook

AiAgentNook 是做什么的 指南是如何写成的

运行智能体的成本

简要回答

智能体不是按答案收费,而是按步骤收费。每一步都会把智能体到目前为止读过、做过的一切重新发送一遍。所以一个智能体任务的花费是聊天的好几倍:单个智能体大约 4 倍,一组智能体大约 15 倍。而且模型账单只是你能看见的那部分。

一次聊天就是对 AI 模型的一次调用。智能体则会一次又一次地调用模型——而且每次调用都要重新读一遍此前的全部内容。看懂这一点,账单就说得通了。

图 09 —— 智能体按循环计费,而不是按答案计费

先看计费表怎么走。AI 模型按词元(token)收费——词元是文本的小块, 进和出都要计数。智能体按步骤工作。每一步都会把此前的全部内容重新发送一遍: 它的指令、对话内容和每一个工具结果。走十步, 就要为开头那段文本付十次钱。这就是为什么 Anthropic 的真实数据落在那个区间:单个智能体大约用掉普通聊天 4 倍的词元,一组智能体大约是 15 倍 [1]

那么,怎么省钱?提示缓存帮助最大。缓存的意思是, 模型把它反复重读的文本保存起来,之后以正常输入价格约十分之一的价钱 读取保存的副本。当同一段开场文本每一步都要重发时, 这一点非常重要 [2]。 还有两个手段:把简单、常规的步骤交给更小、更便宜的模型; 把你已经清楚的步骤改成固定的工作流,而不是放任自由循环。 两者都能让每一步更短或更便宜——还是那条老规矩: 挑最简单可行的方案 [3]

按每完成一个任务算成本,而不是按词元。

你看不见的成本

词元账单是最容易的部分——你可以截个图。其余的成本都更安静。 得有人检查智能体的工作。智能体用到的每一个工具, 都会变成你从此要维护的东西。而当一次失败的运行 已经在现实世界里改动了东西,收拾残局的花费会超过词元本身。 诚实的数字要把这些都算进去——按每个成功完成的任务算成本, 失败的运行也包括在内。 这也是为什么你的测试 应当在成功率旁边同时记录成本和速度。

带机械计数表盘的燃气表
图版 09 —— 不管你看不看,表都在走 摄影 —— Arthur Lambillotte,Unsplash

资料来源

  1. Anthropic — How we built our multi-agent research system,2025 年 6 月 13 日(词元倍数)
  2. Claude docs — Prompt caching(platform.claude.com;缓存读取按基础输入价格的 0.1 倍计费)
  3. Anthropic — Building effective agents,2024 年 12 月 19 日(最简单方案优先)

常见问题

运行一个 AI 智能体要花多少钱?

花多少钱取决于智能体走了多少步,而不是它给出多少个答案。每一步都会把此前的全部内容重新发送一遍。根据 Anthropic 的真实数据,单个智能体大约用掉聊天 4 倍的词元,一组智能体大约是 15 倍。要按每完成一个任务来衡量成本,失败的运行也要算进去。

我该怎么降低 AI 智能体的成本?

有四个手段。使用提示缓存,让模型以大约十分之一的正常价格重新读取已保存的文本。把简单的步骤交给更小、更便宜的模型。把你已经清楚的步骤改成固定的工作流,而不是放任智能体自由循环。再给步数和花费设上限,让失败的运行尽早停下,而不是一直烧钱。

AI 智能体为什么会用掉这么多词元?

词元(token)是模型计费用的文本小块。智能体每走一步,都会把此前的全部内容重新发送一遍——它的指令、历史记录和之前所有的工具结果——再加上它的新输出。调用十次工具,就要为开头那段文本付十次钱。历史越长、工具结果越啰嗦,情况就越糟。