运行智能体的成本
智能体不是按答案收费,而是按步骤收费。每一步都会把智能体到目前为止读过、做过的一切重新发送一遍。所以一个智能体任务的花费是聊天的好几倍:单个智能体大约 4 倍,一组智能体大约 15 倍。而且模型账单只是你能看见的那部分。
一次聊天就是对 AI 模型的一次调用。智能体则会一次又一次地调用模型——而且每次调用都要重新读一遍此前的全部内容。看懂这一点,账单就说得通了。
先看计费表怎么走。AI 模型按词元(token)收费——词元是文本的小块, 进和出都要计数。智能体按步骤工作。每一步都会把此前的全部内容重新发送一遍: 它的指令、对话内容和每一个工具结果。走十步, 就要为开头那段文本付十次钱。这就是为什么 Anthropic 的真实数据落在那个区间:单个智能体大约用掉普通聊天 4 倍的词元,一组智能体大约是 15 倍 [1]。
那么,怎么省钱?提示缓存帮助最大。缓存的意思是, 模型把它反复重读的文本保存起来,之后以正常输入价格约十分之一的价钱 读取保存的副本。当同一段开场文本每一步都要重发时, 这一点非常重要 [2]。 还有两个手段:把简单、常规的步骤交给更小、更便宜的模型; 把你已经清楚的步骤改成固定的工作流,而不是放任自由循环。 两者都能让每一步更短或更便宜——还是那条老规矩: 挑最简单可行的方案 [3]。
按每完成一个任务算成本,而不是按词元。
你看不见的成本
词元账单是最容易的部分——你可以截个图。其余的成本都更安静。 得有人检查智能体的工作。智能体用到的每一个工具, 都会变成你从此要维护的东西。而当一次失败的运行 已经在现实世界里改动了东西,收拾残局的花费会超过词元本身。 诚实的数字要把这些都算进去——按每个成功完成的任务算成本, 失败的运行也包括在内。 这也是为什么你的测试 应当在成功率旁边同时记录成本和速度。

资料来源
- Anthropic — How we built our multi-agent research system,2025 年 6 月 13 日(词元倍数)
- Claude docs — Prompt caching(platform.claude.com;缓存读取按基础输入价格的 0.1 倍计费)
- Anthropic — Building effective agents,2024 年 12 月 19 日(最简单方案优先)
常见问题
运行一个 AI 智能体要花多少钱?
花多少钱取决于智能体走了多少步,而不是它给出多少个答案。每一步都会把此前的全部内容重新发送一遍。根据 Anthropic 的真实数据,单个智能体大约用掉聊天 4 倍的词元,一组智能体大约是 15 倍。要按每完成一个任务来衡量成本,失败的运行也要算进去。
我该怎么降低 AI 智能体的成本?
有四个手段。使用提示缓存,让模型以大约十分之一的正常价格重新读取已保存的文本。把简单的步骤交给更小、更便宜的模型。把你已经清楚的步骤改成固定的工作流,而不是放任智能体自由循环。再给步数和花费设上限,让失败的运行尽早停下,而不是一直烧钱。
AI 智能体为什么会用掉这么多词元?
词元(token)是模型计费用的文本小块。智能体每走一步,都会把此前的全部内容重新发送一遍——它的指令、历史记录和之前所有的工具结果——再加上它的新输出。调用十次工具,就要为开头那段文本付十次钱。历史越长、工具结果越啰嗦,情况就越糟。