# Costes de ejecutar un agente de IA: cuánto cuesta realmente al mes

> Calculamos los costes de un agente de IA con los precios de los tokens de septiembre de 2026. Descubre en qué se va el dinero, cómo escalan los costes y cómo estimar y limitar tu factura.

Last updated: 2026-09-28T12:00:00

Canonical URL: https://crevio.co/es/blog/ai-agent-running-costs

*Última actualización: septiembre de 2026. Todos los precios son tarifas públicas comprobadas el 28 de septiembre de 2026.*

**La factura del modelo rara vez es la parte más cara de ejecutar un agente de IA. Lo que más cuesta es tu tiempo de revisión.** En el ejemplo práctico de abajo, un agente empresarial que realiza 300 tareas al mes cuesta 73,71 $ en tokens del modelo y 167,70 $ en tiempo de revisión, calculando un minuto de comprobación por tarea.

Eso no significa que los tokens sean irrelevantes. El mismo agente puede costar 37 $ o 387 $ al mes en tokens, dependiendo de dos ajustes que casi nadie consulta. Esta guía está pensada para propietarios y responsables de pequeñas empresas que quieren conocer una cifra real antes de activar un agente, no un intervalo de 15 a 15.000 $.

- **Una ejecución de un agente implica muchas llamadas al modelo, no una sola.** En cada paso se vuelve a enviar toda la conversación, por lo que los tokens de entrada predominan y crecen más rápido que el número de pasos
- **La caché de prompts redujo la factura de tokens un 62 %** en nuestro ejemplo, más que cambiar a un nivel de modelo más barato
- **Los tokens de razonamiento se facturan como salida** y, después de aplicar la caché, representaban un tercio del coste por ejecución
- **Las llamadas a herramientas y el tiempo de sandbox son reducidos** con volúmenes habituales: 7,20 $ al mes entre ambos
- **La revisión humana es la partida más grande** hasta que pasas de revisar cada ejecución a revisar una muestra

## Qué incluyen realmente los costes de ejecutar un agente de IA

Un agente de IA es un modelo que trabaja en un bucle: lee la tarea, llama a una herramienta, lee el resultado, decide el siguiente paso y repite el proceso hasta terminar. Cada vuelta del bucle es una llamada al modelo que se factura por separado. Esa es la primera diferencia entre los costes de un agente y los de un chat.

[El equipo de ingeniería de Anthropic informó](https://www.anthropic.com/engineering/multi-agent-research-system) de que «los agentes suelen usar aproximadamente cuatro veces más tokens que las interacciones de chat, y los sistemas multiagente, unas 15 veces más tokens que los chats». El mismo análisis concluyó que el uso de tokens por sí solo explicaba el 80 % de la variación del rendimiento en sus evaluaciones de investigación; las llamadas a herramientas y la elección del modelo eran los otros dos factores. Gastar tokens es la forma en que los agentes obtienen mejores respuestas, precisamente por eso hay que vigilar la factura.

Estos son todos los conceptos por los que pagas:

| Partida de coste | Qué la determina | Magnitud habitual |
|---|---|---|
| **Tokens de entrada** | Instrucciones, definiciones de herramientas, historial y resultados de herramientas, reenviados en cada paso | La partida de tokens más grande |
| **Tokens de salida** | Respuestas visibles y razonamiento oculto | Menor volumen, 5 veces el precio unitario |
| **Llamadas a herramientas** | Herramientas de pago, como la búsqueda web, por llamada | Céntimos por ejecución |
| **Tiempo de sandbox o de cómputo** | Un espacio de trabajo donde el agente ejecuta código o usa un navegador | Céntimos por hora |
| **Integraciones** | Las aplicaciones y planes de automatización a los que se conecta el agente | A menudo, una suscripción que ya pagas |
| **Reintentos y bucles** | Ejecuciones que fallan, se repiten o se desvían | Una cola de coste que puede superar la media |
| **Revisión humana** | Los minutos que dedicas a comprobar lo que ha hecho el agente | Normalmente, la partida más grande |

## Precios de los tokens en septiembre de 2026

Actualmente, todos los proveedores principales fijan por separado el precio de la entrada nueva, la entrada almacenada en caché y la salida; la mayoría también cobra por escribir en la caché. Las cifras siguientes proceden directamente de las páginas de precios de la [API de Claude](https://platform.claude.com/docs/en/about-claude/pricing), la [API de OpenAI](https://developers.openai.com/api/docs/pricing) y la [API de Gemini](https://ai.google.dev/gemini-api/docs/pricing), y se expresan por millón de tokens.

![Página de precios de la API de Claude con las tarifas por millón de tokens de entrada, salida y caché de prompts para Claude Fable 5.1, Opus 5.5, Sonnet 5.5 y Haiku 4.5](https://crevio.co/vite/assets/claude-api-pricing-fbkhhf9h.png)

| Modelo | Entrada | Escritura en caché | Entrada almacenada en caché | Salida |
|---|---|---|---|---|
| Claude Opus 5.5 | 4,00 $ | 5,00 $ | 0,20 $ | 20,00 $ |
| Claude Sonnet 5.5 | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| GPT-6 Sol | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| Gemini 3.8 Flash | 0,75 $ | Almacenamiento facturado por hora | 0,075 $ | 3,75 $ |
| Claude Haiku 4.5 | 1,00 $ | 1,25 $ | 0,10 $ | 5,00 $ |

Hay tres detalles de esas páginas que cambian los cálculos más que las tarifas anunciadas.

**La entrada almacenada en caché cuesta una décima parte de la entrada nueva o menos.** Anthropic cobra la lectura de la caché a 0,1 veces el precio base de entrada y a 0,05 veces en Opus 5.5. Escribir en la caché cuesta 1,25 veces el precio normal para la caché de cinco minutos, así que aplicar la caché sale rentable después de un solo uso adicional. Los modelos GPT-6 de OpenAI siguen el mismo patrón.

**Los tokens de razonamiento son tokens de salida.** La [guía de razonamiento de OpenAI](https://developers.openai.com/api/docs/guides/reasoning) indica que los tokens de razonamiento «se facturan como tokens de salida», aunque nunca los veas, y Google etiqueta su precio de salida como «incluidos los tokens de razonamiento». Si un modelo emplea 700 tokens en razonar antes de ofrecer una respuesta de 300, se te cobran 1.000.

**Las herramientas añaden tokens antes de hacer nada.** Anthropic incluye un prompt de sistema de 286 tokens para el uso de herramientas en Opus 5.5, antes incluso de añadir tus propias definiciones de herramientas. Su conjunto de herramientas de navegador suma unos 6.600 tokens de entrada a cada solicitud que lo declara.

![Página de precios de la API de OpenAI con las tarifas estándar por millón de tokens de GPT-6 Astra, Sol y Luna, incluidos los precios de entrada almacenada en caché y de escritura en caché](https://crevio.co/vite/assets/openai-api-pricing-di89bf36.png)

## Ejemplo práctico: un agente, 300 ejecuciones al mes

Para obtener una cifra real necesitas una tarea real. Pensemos en un caso habitual de una pequeña empresa: un agente que gestiona de principio a fin una solicitud de cliente. Lee el mensaje, consulta el pedido, comprueba la política, busca una o dos veces en la web cuando es necesario, redacta una respuesta y registra lo que ha hecho.

**Supuestos:**

- **12 llamadas al modelo por ejecución.** Aproximadamente lo que necesita una tarea con cinco llamadas a herramientas, más uno o dos pasos para terminar
- **12.000 tokens de contexto fijo** por llamada: instrucciones, contexto empresarial y definiciones de herramientas
- **1.800 tokens añadidos por paso:** 1.500 de resultados de herramientas y 300 de salida visible del modelo
- **1.000 tokens de salida por paso,** de los que 700 son de razonamiento
- **2 búsquedas web, 3 minutos de sandbox y 1 minuto de revisión** por ejecución
- **300 ejecuciones al mes,** aproximadamente 10 al día

### Cálculo de tokens por ejecución

La primera llamada envía 12.000 tokens. La duodécima envía el contexto fijo más once pasos de historial: 12.000 + 11 × 1.800 = 31.800 tokens. Si sumamos las doce, una ejecución envía **262.800 tokens de entrada** para producir **12.000 tokens de salida**. El modelo vuelve a leer su propio historial muchas más veces de las que escribe.

Con tarifas de nivel intermedio y sin caché:

- Entrada: 262.800 × 2,00 $ por millón = 0,53 $
- Salida: 12.000 × 10,00 $ por millón = 0,12 $
- **Total: 0,65 $ por ejecución**

Con la caché activada, cada llamada lee de la caché todo lo que ya había enviado y solo escribe lo nuevo. En toda la ejecución son 231.000 tokens leídos desde la caché y 31.800 tokens escritos por primera vez:

- Escrituras en caché: 31.800 × 2,50 $ por millón = 0,08 $
- Lecturas de caché: 231.000 × 0,20 $ por millón = 0,05 $
- Salida: 12.000 × 10,00 $ por millón = 0,12 $
- **Total: 0,25 $ por ejecución, un 62 % menos**

Fíjate en cómo cambia la composición. Antes de aplicar la caché, la entrada representaba el 81 % de la factura. Después, la salida supone casi la mitad y los 8.400 tokens de razonamiento por sí solos cuestan 0,08 $, aproximadamente un tercio de la ejecución.

### Elección del modelo frente a la caché

Si aplicamos el mismo cálculo a toda la tabla de precios, el resultado no es el que la mayoría espera.

![Gráfico de barras del coste mensual de tokens del modelo para 300 ejecuciones de un agente: 387 $ con un modelo puntero sin caché, 194 $ con un modelo intermedio sin caché, 134 $ con un modelo puntero y caché, 74 $ con un modelo intermedio y caché y 37 $ con un modelo pequeño y caché](https://crevio.co/vite/assets/model-and-caching-monthly-cost-bdzdq4na.svg)

Un modelo puntero con caché (134 $) cuesta menos que un modelo intermedio sin caché (194 $). Antes de rebajar el modelo para ahorrar dinero, comprueba si la caché está activada. Algunos proveedores aplican la caché de prompts automáticamente y otros requieren activar una opción; además, un único valor cambiante cerca del principio del prompt, como una marca de tiempo, la invalida silenciosamente en cada llamada.

### La factura mensual completa

Ahora añadamos las partidas que no son tokens. La búsqueda web cuesta [10 $ por cada 1.000 búsquedas en la API de Claude](https://platform.claude.com/docs/en/about-claude/pricing) y [en OpenAI](https://developers.openai.com/api/docs/pricing). El tiempo de sandbox utiliza la [tarifa publicada para sesiones de agentes de Anthropic](https://platform.claude.com/docs/en/about-claude/pricing), de 0,08 $ por hora de ejecución. Las integraciones utilizan el [plan Professional de Zapier](https://zapier.com/pricing), a 19,99 $ al mes con facturación anual. Para el tiempo de revisión usamos 33,54 $ por hora: el [salario medio de EE. UU. en mayo de 2025](https://www.bls.gov/news.release/ocwage.nr0.htm), de 69.770 $ anuales para todas las ocupaciones, dividido entre 2.080 horas de trabajo.

| Partida | Cálculo | Mensual |
|---|---|---|
| Tokens del modelo | 300 ejecuciones × 0,2457 $ | 73,71 $ |
| Bucles y reintentos | El 5 % de las ejecuciones (15) se desvían hasta 30 pasos, 0,43 $ extra cada una | 6,46 $ |
| Búsquedas web | 600 × 0,01 $ | 6,00 $ |
| Tiempo de sandbox | 15 horas × 0,08 $ | 1,20 $ |
| Plan de integración | Una suscripción de automatización | 19,99 $ |
| **Total de máquinas** | | **107,36 $** |
| Revisión humana | 5 horas × 33,54 $ | 167,70 $ |
| **Total** | | **275,06 $** |

![Gráfico de barras del coste mensual de 275 $ de un agente de IA: 167,70 $ de tiempo de revisión, 73,71 $ de tokens del modelo, 19,99 $ del plan de integración, 6,46 $ de bucles, 6,00 $ de búsquedas web y 1,20 $ de tiempo de sandbox](https://crevio.co/vite/assets/where-the-money-goes-jjla4krw.svg)

Eso equivale a 0,92 $ por tarea completada. Que sea barato o no depende por completo del valor de la tarea. Si una persona dedicara seis minutos a cada solicitud, las mismas 300 tareas ocuparían 30 horas, es decir, unos 1.006 $ con el mismo salario.

## Cómo escalan los costes de un agente de IA

No todos los costes crecen de la misma manera, y la diferencia importa cuando planificas un mayor volumen.

**Las ejecuciones escalan linealmente.** Si duplicas las ejecuciones, duplicas la factura de tokens. Con volúmenes de pequeña empresa apenas hay descuentos por volumen, aunque el [procesamiento por lotes](https://platform.claude.com/docs/en/about-claude/pricing) reduce los precios de los tokens un 50 % en trabajos que pueden esperar.

**Los pasos crecen más rápido que de forma lineal.** Cada paso adicional vuelve a enviar todo lo anterior, por lo que el coste crece aproximadamente con el cuadrado de la duración de la ejecución. En nuestro ejemplo, una ejecución que se desvía hasta 30 pasos dura 2,5 veces más, pero cuesta 0,68 $ en lugar de 0,25 $ con la caché: 2,75 veces más. Sin caché cuesta 2,59 $ en lugar de 0,65 $: cuatro veces más. Las ejecuciones largas son las que rompen los presupuestos, y la caché también sirve para suavizar esa curva.

**Los resultados de las herramientas escalan según lo que permitas introducir.** Una página web obtenida de una búsqueda contiene unos 2.500 tokens y un PDF de investigación, unos 125.000, según las cifras de Anthropic. Un agente que lee documentos completos en lugar de la sección relevante paga por ese texto en cada paso restante de la ejecución.

**La revisión escala con tu nivel de confianza, no con el volumen.** Revisar cada ejecución mantiene la revisión como la partida más grande para siempre. Revisar una de cada diez, una vez que el agente se haya ganado tu confianza, reduce el total de 275,06 $ a 124,13 $ al mes. Es el mayor ahorro individual disponible y no tiene nada que ver con los modelos.

## Cómo calcular tus propios costes de agente

No necesitas una hoja de cálculo. Necesitas cinco cifras, y la cuarta es la que la mayoría omite.

1. **Ejecuciones al mes.** Cuenta con qué frecuencia se realiza realmente la tarea hoy, no con qué frecuencia te gustaría que se realizara
2. **Pasos por ejecución.** Aproximadamente dos llamadas al modelo por cada llamada a una herramienta, más una para terminar
3. **Tokens por paso.** Contexto fijo más el tamaño de un resultado de herramienta típico. La mayoría de proveedores muestra el uso por solicitud, así que ejecuta la tarea diez veces y consulta la cifra real
4. **Minutos de revisión por ejecución.** Cronométrate mientras compruebas cinco resultados. Esta cifra influye en el total más que el modelo
5. **Tasa de fallos.** La proporción de ejecuciones que entran en bucle, se reintentan o deben repetirse, calculada según su duración adicional

Después, aplica esta fórmula: **coste mensual ≈ ejecuciones × (tokens por ejecución × precio combinado + llamadas a herramientas de pago) + ejecuciones × minutos de revisión × tu tarifa por hora.** Usa el precio de caché para el contexto repetido y el precio completo para todo lo nuevo; normalmente te acercarás bastante a la factura real.

## Cómo limitar los costes de un agente de IA

Las estimaciones se desvían. Los límites no. Estos son los controles que realmente funcionan:

- **Establece un límite de gasto en la cuenta del proveedor.** La mayoría de las consolas de proveedores ofrecen un límite mensual, una alerta de presupuesto o ambas cosas. Configúralo antes de la primera ejecución programada, no después de recibir la primera factura inesperada
- **Limita los pasos por ejecución.** Un máximo de 20 o 25 pasos convierte un bucle descontrolado en una ejecución fallida que puedes revisar, en lugar de dejar abierta una factura sin límite
- **Limita el esfuerzo de razonamiento y la longitud de salida.** La mayoría de los modelos de razonamiento ofrece un ajuste de esfuerzo o presupuesto. Reserva los valores altos para las tareas complejas; las consultas rutinarias no los necesitan
- **Mantén estable el principio del prompt.** Todo lo que cambie en cada llamada y esté situado al principio invalida la caché para todo lo que viene después
- **Recorta los resultados de las herramientas antes de mostrárselos al modelo.** Devuelve los tres campos que necesita el agente, no el registro completo ni la página entera
- **Asigna cada tarea según su dificultad.** Usa un modelo pequeño para clasificaciones y consultas, y uno más potente para el paso que requiere criterio
- **Pasa de revisar todo a revisar muestras** cuando el agente haya demostrado un historial fiable en esa tarea, y mantén la revisión completa para cualquier acción que envíe dinero o mensajes a clientes. Es la misma regla de empezar por borradores que recomendamos al [elegir qué tareas delegar primero en un agente](/es/blog/ai-agents-for-small-business)

## Lo que nadie te cuenta

- **El mismo texto puede costar más en un modelo nuevo.** [Anthropic señala](https://platform.claude.com/docs/en/about-claude/pricing) que su nuevo tokenizador «genera aproximadamente un 30 % más de tokens para el mismo texto». Compara el uso real, no solo el precio por token
- **Las tarifas promocionales terminan.** [Gemini 3.8 Flash](https://ai.google.dev/gemini-api/docs/pricing) cuesta 0,75 $ por millón de tokens de entrada hasta el 31 de diciembre de 2026; a partir del 1 de enero de 2027 costará 1,50 $. Haz el presupuesto con el precio que pagarás el año que viene
- **Los precios de la caché varían según el modelo, incluso dentro de un mismo proveedor.** Opus 5.5 lee la caché al 5 % del precio base de entrada, mientras que la mayoría de los modelos lo hace al 10 %; por eso la configuración más barata no siempre utiliza el modelo más barato
- **Los fallos también se facturan.** Una ejecución que falla en el paso nueve ya ha pagado los ocho pasos anteriores. Si la repites desde cero, vuelves a pagar por ellos; y si cambias a un [modelo de respaldo](/es/blog/ai-agent-backup-models) a mitad de la ejecución, empiezas de nuevo con la caché vacía
- **Los meses tranquilos son baratos y el mes de mayor actividad no.** El coste del agente sigue el volumen de tu negocio, justo cuando una factura variable resulta menos bienvenida. Establece el límite pensando en tu mejor mes, no en la media

## Dónde encaja Crevio

![Página de precios de Crevio con el plan Starter gratuito, Pro a 20 $ al mes con 1.000 créditos y Business a 50 $ al mes con 2.500 créditos](https://crevio.co/vite/assets/crevio-pricing-pe4bsahk.png)

Todo lo anterior presupone que ejecutas el agente por tu cuenta y pagas por separado a cada proveedor. [Crevio](https://crevio.co/) adopta un enfoque diferente: es un [constructor de negocios con IA](/es/blog/ai-business-builder), y todo el trabajo de IA que realiza por ti —desde crear tu sitio web y redactar páginas de producto hasta generar imágenes, enviar correos de marketing e investigar en la web— se descuenta de un único saldo de créditos. Las tareas grandes consumen más créditos que las pequeñas, y la plataforma controla los tokens, la caché y las llamadas a herramientas en segundo plano para que tú no tengas que hacerlo.

Pro cuesta 20 $ al mes e incluye 1.000 créditos, mientras que Business cuesta 50 $ al mes e incluye 2.500. Ambos planes te permiten elegir una asignación mensual mayor a medida que crece el negocio. Starter es gratuito e incluye una asignación pequeña para probar el servicio. Los créditos mensuales se renuevan en cada ciclo de facturación, mientras que los créditos extra obtenidos por registro y recomendaciones no caducan. Con un plan de pago puedes comprar más créditos en cualquier momento o activar las recargas automáticas; y si se agotan, tu sitio web y el proceso de pago siguen funcionando. Solo se pausa el trabajo nuevo de IA.

Hablemos claro sobre la contrapartida: un saldo de créditos te ofrece una cifra predecible, pero oculta el detalle por token que explicamos en este artículo. Si quieres controlar por tu cuenta la elección del modelo y los ajustes de caché, ejecutar tu propia infraestructura de agentes te permite hacerlo. Y ningún modelo de precios elimina la partida de revisión. Ese minuto por ejecución sigue siendo tuyo hasta que decidas que el agente se ha ganado una supervisión menor. Además, todos los planes aplican comisiones por transacción: el 5 % en Starter, el 2,5 % en Pro y el 1 % en Business.

## Preguntas frecuentes sobre los costes de ejecutar un agente de IA

### ¿Cuánto cuesta ejecutar un agente de IA al mes?

Para un único agente empresarial que gestione unas 300 tareas al mes, calcula aproximadamente entre 40 $ y 400 $ en tokens del modelo, según el modelo elegido y si la caché de prompts está activada, más unos cuantos dólares por herramientas y cómputo. En nuestro ejemplo práctico, el coste de las máquinas fue de 107,36 $ y el total, incluida un minuto de revisión humana por tarea, de 275,06 $.

### ¿Cuál es el mayor coste oculto de un agente de IA?

El tiempo de revisión humana. Comprobar cada resultado durante un minuto con el salario medio estadounidense costó más del doble que toda la factura de tokens en nuestro ejemplo. El segundo mayor coste es el contexto reenviado: en cada paso de una ejecución vuelves a pagar por todo lo que el agente ya ha leído, por eso las ejecuciones largas resultan desproporcionadamente más caras.

### ¿Los tokens de razonamiento cuestan más?

Se facturan como tokens de salida al precio de salida del modelo, aunque nunca los veas. Tanto OpenAI como Google lo indican en sus páginas de documentación y precios. En nuestro ejemplo, el razonamiento representaba aproximadamente un tercio del coste de cada ejecución con caché.

### ¿Cuánto ahorra la caché de prompts en los costes de un agente?

En nuestro ejemplo redujo la factura de tokens un 62 %, de 0,65 $ a 0,25 $ por ejecución, porque un agente vuelve a enviar las mismas instrucciones y el mismo historial en cada paso. En la mayoría de los modelos, las lecturas almacenadas en caché cuestan una décima parte de la entrada nueva. La caché solo funciona si el principio del prompt permanece idéntico entre llamadas.

### ¿Es más barata una suscripción que pagar por tokens en un agente?

Depende de tu volumen y de lo predecible que sea. Los planes de tarifa fija limitan el coste máximo, pero pueden salir más caros cuando el uso es reducido; los precios de la API por consumo reflejan exactamente el uso. Para los planes de ChatGPT y Claude en concreto, calculamos el [punto de equilibrio entre una suscripción y la API](/es/blog/chatgpt-subscription-vs-api-for-agents): unas 80 ejecuciones al mes para un plan de 20 $. Analizamos el lado de las plataformas en nuestro [desglose de alternativas a Squad](/es/blog/squad-so-alternatives), donde comparamos los precios por consumo con las tarifas fijas.

Los tokens son el coste que puedes leer en una factura. Tu atención es el coste que tienes que calcular por tu cuenta y, normalmente, es el mayor de los dos.

## Artículos relacionados

- [Agentes de IA para pequeñas empresas: qué tareas delegar primero](/es/blog/ai-agents-for-small-business)
- [Empleado de IA frente a agente de IA: la diferencia que realmente importa](/es/blog/ai-employee-vs-ai-agent)
- [Constructor de negocios con IA frente a contratar un equipo: la comparativa sincera de 2026](/es/blog/ai-business-builder-vs-hiring-a-team)
