Las diez guías · orden de lectura

01Qué es un agente de IA 02Tipos de agentes de IA 03Evaluación de agentes de IA 04Flujo y orden de construcción 05Memoria del agente 06Uso de herramientas y MCP 07Sistemas multiagente 08Modos de fallo de los agentes 09Costo de ejecutar agentes 10Frameworks de agentes

Temas de agentes

Agentes de IA ya en la web Agente como servicio

Comparativas de modelos

Comparativa de agentes de IA — próximamente

Noticias

Noticias globales de agentes de IA Noticias de agentes en Singapur

Evaluación

Chequeo rápido de preparación

AiAgentNook

Para qué existe AiAgentNook Cómo se hacen las guías

Modos de fallo de los agentes: inyección de prompts, bucles descontrolados, deriva silenciosa

En resumen

Los agentes de IA fallan de unas pocas maneras comunes. La inyección de prompts ocurre cuando instrucciones ocultas viajan dentro de algo que el agente lee — y el agente las sigue. La «trifecta letal» — datos privados, contenido no confiable y una vía para enviar mensajes hacia fuera — hace posible el robo de datos. Los bucles también pueden descontrolarse, o la calidad puede degradarse sin que nadie lo note. Cada problema tiene una solución conocida.

Cada fallo de esta guía le ha ocurrido a un equipo real que ejecuta agentes. La causa raíz es siempre la misma: un modelo de lenguaje sigue las instrucciones de todo lo que lee — sin importar quién las escribió.

Fig. 08 — inyección: el contenido que lee el agente se convierte en instrucciones que sigue

La inyección de prompts significa que instrucciones ocultas se cuelan en lo que lee un agente — y el agente las obedece. La variante directa es un usuario que convence al agente de saltarse sus reglas. La variante indirecta, más peligrosa, esconde instrucciones dentro del contenido que el agente lee — una página web, un correo, un documento — y el modelo las sigue como si fueran una entrada real. OWASP, una organización sin fines de lucro que clasifica riesgos de seguridad del software, la sitúa como el riesgo n.º 1 para las aplicaciones con LLM [1]. Todavía no existe una solución completa. Los equipos limitan lo que el agente puede hacer, revisan sus salidas y mantienen pequeño el daño si llega a ser engañado.

Por eso la mejor defensa es limitar lo que el agente puede tocar. Simon Willison llama a una combinación la «trifecta letal» — tres capacidades que, juntas, hacen posible el robo de datos: acceso a datos privados, contacto con contenido no confiable y una vía para enviar mensajes hacia fuera. Un agente con las tres puede ser engañado para robar datos y enviarlos lejos. Elimina cualquiera de las tres y ese camino se cierra — una decisión de diseño, no un modelo más inteligente [2].

El problema de raíz: un agente obedece todo lo que lee.

Los fallos más silenciosos

Los bucles descontrolados son el fallo de cada día. Un agente que no sabe cuándo ha terminado, o que reintenta una y otra vez una herramienta rota, quema dinero — y puede actuar sobre el mundo una y otra vez. La solución son límites simples: topes al número de pasos que puede dar, presupuestos de gasto y una revisión humana antes de cualquier cosa que no puedas deshacer. Son las mismas barreras de protección del flujo y orden de construcción. La deriva silenciosa es más discreta: el mismo agente, en la misma tarea, da resultados distintos de una ejecución a otra. Un benchmark, τ-bench, mide esto con pass^k — con qué frecuencia un agente acierta todas las veces, no solo una — y muestra que la fiabilidad cae en picado a medida que se repiten las ejecuciones, incluso en agentes fuertes [3]. La solución es una batería de evaluación — un conjunto de pruebas automatizadas — que se ejecuta con cada cambio, para que la deriva aparezca en un panel y no en la queja de un cliente.

Lámpara de señal ferroviaria desgastada mostrando luz roja
Placa 08 — el fallo que ves venir es el más barato Foto: José Maria Martins, Unsplash

Fuentes

  1. OWASP GenAI Security Project — LLM01:2025 Prompt Injection
  2. Simon Willison — The lethal trifecta for AI agents, 16 Jun 2025
  3. Yao et al. (Sierra) — τ-bench, arXiv 2406.12045, Jun 2024 (pass^k reliability)

Preguntas frecuentes

¿Qué es la inyección de prompts?

Un truco en el que instrucciones ocultas viajan dentro del contenido que lee una IA. La inyección directa viene del usuario que las escribe. La indirecta las esconde en una página web, un correo o un documento que lee el agente — y el modelo las sigue como si fueran una entrada real. OWASP, una organización sin fines de lucro de seguridad del software, la clasifica como el riesgo n.º 1 para las aplicaciones con LLM.

¿Qué es la trifecta letal?

El nombre que da Simon Willison a tres capacidades que, juntas, hacen posible el robo de datos: acceso a datos privados, contacto con contenido no confiable y una vía para enviar mensajes hacia fuera. Un agente con las tres puede ser engañado para filtrar datos. Elimina cualquiera de ellas y el camino se cierra.

¿Cómo se hace fiable un agente de IA?

Pon límites duros — topes al número de pasos que puede dar, presupuestos de gasto y una revisión humana antes de cualquier cosa que no puedas deshacer. Luego mídelo: ejecuta una batería de pruebas con cada cambio y registra si acierta todas las veces (una métrica llamada pass^k), no solo en promedio. La fiabilidad se construye, no se pide en el prompt.