Las diez guías · orden de lectura

01Qué es un agente de IA 02Tipos de agentes de IA 03Evaluación de agentes de IA 04Flujo y orden de construcción 05Memoria del agente 06Uso de herramientas y MCP 07Sistemas multiagente 08Modos de fallo de los agentes 09Costo de ejecutar agentes 10Frameworks de agentes

Temas de agentes

Agentes de IA ya en la web Agente como servicio

Comparativas de modelos

Comparativa de agentes de IA — próximamente

Noticias

Noticias globales de agentes de IA Noticias de agentes en Singapur

Evaluación

Chequeo rápido de preparación

AiAgentNook

Para qué existe AiAgentNook Cómo se hacen las guías

Memoria del agente: ventanas de contexto, RAG y estado a largo plazo

En resumen

La memoria de trabajo de un agente es la ventana de contexto del modelo: el texto que puede ver ahora mismo. Es limitada y empieza vacía en cada sesión. La memoria más larga se construye encima: la recuperación (RAG) trae conocimiento cuando hace falta, y los almacenes externos en los que el agente puede escribir guardan cosas para después.

Los modelos de IA olvidan todo entre llamadas. Lo que un agente “sabe” ahora mismo está en su ventana de contexto o fue traído a ella. Así que la memoria es algo que los constructores añaden, no algo que el modelo tiene.

Fig. 05 — la memoria de trabajo lee; la memoria a largo plazo lee y escribe

Empieza por el límite. La ventana de contexto es todo el texto que un modelo puede ver mientras escribe una respuesta: su memoria de trabajo. Las instrucciones, la conversación, cada resultado de herramienta y la propia respuesta ocupan espacio en ella. Y más no siempre es mejor: a medida que la ventana se llena, el modelo pierde precisión al recordar lo que contiene. Así que elegir qué entra importa tanto como cuánto cabe [1].

Una forma común de describir esto toma prestado de la memoria humana. La memoria a corto plazo es lo que está dentro de la ventana. La memoria a largo plazo es un almacén externo que el agente consulta cuando necesita algo [2]. RAG (generación aumentada por recuperación: traer documentos útiles a la ventana cuando se necesitan) es la mitad de solo lectura. Divides tus documentos en fragmentos pequeños y luego traes los relevantes para cada tarea. Pero dividir sin cuidado pierde significado. Por eso la recuperación contextual de Anthropic, que añade una breve nota de contexto a cada fragmento antes de indexarlo, redujo las recuperaciones fallidas en un 49% [3].

La ventana de contexto es la memoria de trabajo; todo lo que vive más tiempo es una herramienta.

Memoria en la que el agente puede escribir

La mitad de lectura y escritura es más nueva. Aquí el agente recibe un almacén en el que puede decidir escribir —notas, preferencias, avance de tareas— y volver a leer en sesiones posteriores. Un proyecto de investigación llamado MemGPT comparó esto con cómo funciona el sistema operativo de una computadora: tratar la ventana de contexto como memoria principal rápida pero pequeña, y dejar que el modelo mueva por sí mismo la información hacia y desde un almacenamiento externo más grande [4]. La misma idea ya llega como herramientas de memoria en productos de agentes reales.

¿Cuándo vale la pena cada capa?

Añádelas en este orden. Una ventana de contexto bien elegida cubre por sí sola la mayoría de las tareas que caben en una sesión. Añade recuperación cuando el agente necesite más conocimiento del que la ventana debería cargar. Añade memoria a largo plazo con escritura solo cuando las tareas realmente se extiendan entre sesiones. Trae una nueva forma de fallar —los recuerdos obsoletos o erróneos se acumulan—, así que añádela después de que exista la evaluación, no antes.

Pasillo de biblioteca entre altas estanterías de libros catalogados
Lámina 05 — la memoria que funciona se archiva, no se amontona Foto — Zetong Li, Unsplash

Fuentes

  1. Claude docs — Context windows (platform.claude.com)
  2. Lilian Weng — LLM Powered Autonomous Agents, 23 Jun 2023
  3. Anthropic — Introducing Contextual Retrieval, 19 Sep 2024
  4. Packer et al. — MemGPT: Towards LLMs as Operating Systems, arXiv 2310.08560, Oct 2023

Preguntas frecuentes

¿Cómo recuerdan las cosas los agentes de IA?

Dentro de una sesión, todo vive en la ventana de contexto del modelo: su memoria de trabajo. Entre sesiones, los agentes usan recuperación (traer documentos útiles a la ventana) y almacenes externos en los que el propio agente escribe. El modelo no guarda nada entre llamadas. La memoria se construye alrededor del modelo, no dentro de él.

¿Cuál es la diferencia entre RAG y la memoria del agente?

RAG es de solo lectura: busca en un conjunto fijo de documentos y trae las partes útiles a la ventana cuando llega una pregunta. La memoria del agente es de lectura y escritura: el agente elige qué guardar —notas, preferencias, avance de tareas— y lo vuelve a leer en sesiones posteriores. La mayoría de los agentes reales usan ambas.

¿Qué es una ventana de contexto?

Todo el texto que un modelo puede ver mientras escribe una respuesta: sus instrucciones, la conversación, los resultados de herramientas y la propia respuesta. Tiene un tamaño fijo, y el modelo pierde precisión a medida que se llena. Así que lo que pones dentro importa tanto como el tamaño de la ventana.