十篇指南 · 阅读顺序

01什么是 AI 智能体 02AI 智能体的类型 03AI 智能体评估 04构建流程与顺序 05智能体记忆 06工具调用与 MCP 07多智能体系统 08智能体失效模式 09运行智能体的成本 10智能体框架

智能体专题

网络上的 AI 智能体 智能体即服务

模型对比

AI 智能体对比 — 即将上线

新闻

全球 AI 智能体新闻 新加坡智能体新闻

评估

快速就绪自测

AiAgentNook

AiAgentNook 是做什么的 指南是如何写成的

智能体失效模式:提示注入、失控循环与静默漂移

简要回答

AI 智能体常见的失败方式就那么几种。提示注入是指隐藏指令混进智能体读取的内容里——而智能体照做了。“致命三要素”——私密数据、不可信内容,以及向外发送消息的渠道——让数据被盗成为可能。循环也可能失控,质量还可能在没人察觉时悄悄下滑。每个问题都有已知的解法。

本指南里的每一种失败,都在真实运行智能体的团队身上发生过。根本原因始终相同:语言模型会执行它读到的任何指令——不管是谁写的。

图 08 — 注入:智能体读到的内容变成了它执行的指令

提示注入是指隐藏指令偷偷混进智能体读取的内容——而智能体照做了。直接注入是用户当面把智能体劝得违背自己的规则。更危险的间接注入把指令藏在智能体读取的内容里——一个网页、一封邮件、一份文档——模型会把它们当成真实输入照做。为软件安全风险排名的非营利组织 OWASP 把它列为 LLM 应用的第一大风险 [1]。目前还没有彻底的解法。团队能做的是限制智能体能做的事、检查它的输出,并在它真被骗到时把损失控制到最小。

所以最好的防御是限制智能体能接触什么。Simon Willison 把其中一种组合称作“致命三要素”——三种能力凑在一起就可能造成数据被盗:能访问私密数据、会接触不可信内容、有向外发送消息的渠道。三样俱全的智能体可能被诱骗窃取数据并把它发出去。去掉任意一样,这条路就被堵死——这是一个设计选择,而不是靠更聪明的模型 [2]

根本问题:智能体会照做它读到的一切。

更安静的失败

失控循环是最日常的失败。一个不知道自己已经完成、或对着坏掉的工具反复重试的智能体,会白白烧钱——还可能一次又一次地对现实世界动手。解法是简单的限制:限定它最多能走多少步、设定花费预算,并在任何无法撤销的操作前加一道人工确认。这些正是构建流程与顺序里讲过的那套护栏。静默漂移更安静:同一个智能体做同一件任务,每次跑出来的结果都不一样。有一个基准测试 τ-bench 用 pass^k 来度量这一点——即智能体是否每一次都成功,而不只是成功过一次——结果显示,随着重复运行次数增加,即使很强的智能体,可靠性也会急剧下降 [3]。解法是一套评估测试集——一组自动化测试——每次改动都跑一遍,让漂移出现在仪表盘上,而不是出现在客户投诉里。

一盏老旧的铁路信号灯亮着红灯
图版 08 — 能预见的失败,才是代价最小的失败 摄影:José Maria Martins,Unsplash

资料来源

  1. OWASP GenAI Security Project — LLM01:2025 Prompt Injection
  2. Simon Willison — The lethal trifecta for AI agents, 16 Jun 2025
  3. Yao et al. (Sierra) — τ-bench, arXiv 2406.12045, Jun 2024 (pass^k reliability)

常见问题

什么是提示注入?

一种把隐藏指令混进 AI 所读内容里的手法。直接注入是用户自己输入这些指令。间接注入则把指令藏在智能体读取的网页、邮件或文档里——模型会把它们当成真实输入照做。软件安全领域的非营利组织 OWASP 把它列为 LLM 应用的第一大风险。

什么是“致命三要素”?

这是 Simon Willison 给三种能力起的名字——它们凑在一起就可能造成数据被盗:能访问私密数据、会接触不可信内容、有向外发送消息的渠道。三样俱全的智能体可能被诱骗泄露数据。去掉任意一样,这条路就被堵死。

如何让 AI 智能体变得可靠?

设置硬性限制——限定它最多能走多少步、设定花费预算,并在任何无法撤销的操作前加一道人工确认。然后去度量它:每次改动都跑一遍测试集,并追踪它是否每一次都成功(这个指标叫 pass^k),而不只是看平均值。可靠性是构建出来的,不是在提示词里要求出来的。