Las diez guías · orden de lectura

01Qué es un agente de IA 02Tipos de agentes de IA 03Evaluación de agentes de IA 04Flujo y orden de construcción 05Memoria del agente 06Uso de herramientas y MCP 07Sistemas multiagente 08Modos de fallo de los agentes 09Costo de ejecutar agentes 10Frameworks de agentes

Temas de agentes

Agentes de IA ya en la web Agente como servicio

Comparativas de modelos

Comparativa de agentes de IA — próximamente

Noticias

Noticias globales de agentes de IA Noticias de agentes en Singapur

Evaluación

Chequeo rápido de preparación

AiAgentNook

Para qué existe AiAgentNook Cómo se hacen las guías

Costo de ejecutar agentes

En resumen

Los agentes no cobran por respuesta: cobran por paso. Cada paso reenvía todo lo que el agente ha leído y hecho hasta ese momento. Por eso una tarea de agente cuesta varias veces más que un chat: unas 4× con un agente y unas 15× con un equipo de agentes. Y la factura del modelo es solo la parte que puedes ver.

Un chat es una sola llamada al modelo de IA. Un agente llama al modelo una y otra vez, y cada llamada relee todo lo anterior. Cuando ves eso, la factura tiene sentido.

Fig. 09 — los agentes cobran por el bucle, no por la respuesta

Empieza por cómo funciona el contador. Los modelos de IA cobran por tokens: pequeños trozos de texto que se cuentan al entrar y al salir. Un agente trabaja por pasos. Cada paso reenvía todo lo anterior: sus instrucciones, la conversación y cada resultado de herramienta. Diez pasos significan pagar diez veces por el texto inicial. Por eso los números reales de Anthropic caen donde caen: un agente usa unas 4× los tokens de un chat normal, y un equipo de agentes unas 15× [1].

¿Y cómo se recorta la factura? La caché de prompts es lo que más ayuda. La caché significa que el modelo guarda el texto que relee todo el tiempo y vuelve a leer la copia guardada a una décima parte del precio normal de entrada. Eso importa mucho cuando el mismo texto inicial se reenvía en cada paso [2]. Dos palancas más: envía los pasos simples y rutinarios a modelos más pequeños y baratos, y convierte los pasos que ya conoces en un flujo de trabajo fijo en lugar de un bucle libre. Ambas hacen cada paso más corto o más barato: la vieja regla de elegir lo más simple que funcione [3].

Cuenta el costo por tarea terminada, no por token.

Los costos que no ves

La factura de tokens es la parte fácil: puedes hacerle una captura de pantalla. El resto es más silencioso. Alguien tiene que revisar el trabajo del agente. Cada herramienta que usa el agente se convierte en algo que ahora tienes que mantener funcionando. Y cuando una ejecución fallida ya cambió cosas en el mundo real, la limpieza cuesta más que los tokens. El número honesto lo incluye todo: costo por tarea terminada con éxito, ejecuciones fallidas incluidas. Por eso tus pruebas deberían medir costo y velocidad junto a la tasa de éxito.

Medidor de gas con un contador mecánico
Placa 09 — el contador corre aunque no lo mires Foto — Arthur Lambillotte, Unsplash

Fuentes

  1. Anthropic — How we built our multi-agent research system, 13 de junio de 2025 (múltiplos de tokens)
  2. Claude docs — Prompt caching (platform.claude.com; lecturas de caché a 0.1× el precio base de entrada)
  3. Anthropic — Building effective agents, 19 de diciembre de 2024 (la solución más simple primero)

Preguntas frecuentes

¿Cuánto cuesta ejecutar un agente de IA?

Depende de cuántos pasos da el agente, no de cuántas respuestas entrega. Cada paso reenvía todo lo anterior. Los datos reales de Anthropic sitúan a un agente en unas 4× los tokens de un chat, y a un equipo de agentes en unas 15×. Mide el costo por tarea terminada y cuenta también las ejecuciones fallidas.

¿Cómo puedo reducir el costo de un agente de IA?

Cuatro palancas. Usa la caché de prompts, que deja al modelo releer texto guardado a alrededor de una décima parte del precio normal. Envía los pasos simples a modelos más pequeños y baratos. Convierte los pasos que ya conoces en un flujo de trabajo fijo en lugar de un bucle libre. Y pon límites de pasos y de gasto, para que las ejecuciones fallidas se detengan pronto en vez de quemar dinero.

¿Por qué los agentes de IA usan tantos tokens?

Los tokens son los pequeños trozos de texto que un modelo cobra. En cada paso, un agente reenvía todo lo anterior —sus instrucciones, el historial y todos los resultados de herramientas previos— más su nueva salida. Diez llamadas a herramientas significan pagar diez veces por el texto inicial. Los historiales largos y los resultados de herramientas verbosos lo empeoran.