智能体失效模式:提示注入、失控循环与静默漂移
AI 智能体常见的失败方式就那么几种。提示注入是指隐藏指令混进智能体读取的内容里——而智能体照做了。“致命三要素”——私密数据、不可信内容,以及向外发送消息的渠道——让数据被盗成为可能。循环也可能失控,质量还可能在没人察觉时悄悄下滑。每个问题都有已知的解法。
本指南里的每一种失败,都在真实运行智能体的团队身上发生过。根本原因始终相同:语言模型会执行它读到的任何指令——不管是谁写的。
提示注入是指隐藏指令偷偷混进智能体读取的内容——而智能体照做了。直接注入是用户当面把智能体劝得违背自己的规则。更危险的间接注入把指令藏在智能体读取的内容里——一个网页、一封邮件、一份文档——模型会把它们当成真实输入照做。为软件安全风险排名的非营利组织 OWASP 把它列为 LLM 应用的第一大风险 [1]。目前还没有彻底的解法。团队能做的是限制智能体能做的事、检查它的输出,并在它真被骗到时把损失控制到最小。
所以最好的防御是限制智能体能接触什么。Simon Willison 把其中一种组合称作“致命三要素”——三种能力凑在一起就可能造成数据被盗:能访问私密数据、会接触不可信内容、有向外发送消息的渠道。三样俱全的智能体可能被诱骗窃取数据并把它发出去。去掉任意一样,这条路就被堵死——这是一个设计选择,而不是靠更聪明的模型 [2]。
根本问题:智能体会照做它读到的一切。
更安静的失败
失控循环是最日常的失败。一个不知道自己已经完成、或对着坏掉的工具反复重试的智能体,会白白烧钱——还可能一次又一次地对现实世界动手。解法是简单的限制:限定它最多能走多少步、设定花费预算,并在任何无法撤销的操作前加一道人工确认。这些正是构建流程与顺序里讲过的那套护栏。静默漂移更安静:同一个智能体做同一件任务,每次跑出来的结果都不一样。有一个基准测试 τ-bench 用 pass^k 来度量这一点——即智能体是否每一次都成功,而不只是成功过一次——结果显示,随着重复运行次数增加,即使很强的智能体,可靠性也会急剧下降 [3]。解法是一套评估测试集——一组自动化测试——每次改动都跑一遍,让漂移出现在仪表盘上,而不是出现在客户投诉里。

资料来源
- OWASP GenAI Security Project — LLM01:2025 Prompt Injection
- Simon Willison — The lethal trifecta for AI agents, 16 Jun 2025
- Yao et al. (Sierra) — τ-bench, arXiv 2406.12045, Jun 2024 (pass^k reliability)
常见问题
什么是提示注入?
一种把隐藏指令混进 AI 所读内容里的手法。直接注入是用户自己输入这些指令。间接注入则把指令藏在智能体读取的网页、邮件或文档里——模型会把它们当成真实输入照做。软件安全领域的非营利组织 OWASP 把它列为 LLM 应用的第一大风险。
什么是“致命三要素”?
这是 Simon Willison 给三种能力起的名字——它们凑在一起就可能造成数据被盗:能访问私密数据、会接触不可信内容、有向外发送消息的渠道。三样俱全的智能体可能被诱骗泄露数据。去掉任意一样,这条路就被堵死。
如何让 AI 智能体变得可靠?
设置硬性限制——限定它最多能走多少步、设定花费预算,并在任何无法撤销的操作前加一道人工确认。然后去度量它:每次改动都跑一遍测试集,并追踪它是否每一次都成功(这个指标叫 pass^k),而不只是看平均值。可靠性是构建出来的,不是在提示词里要求出来的。