# Custos de funcionamento de um agente de IA: quanto custa realmente por mês

> Custos de funcionamento de agentes de IA, calculados com os preços de tokens de setembro de 2026. Veja para onde vai o dinheiro, como os custos escalam e como estimar e limitar a sua fatura.

Last updated: 2026-09-28T12:00:00

Canonical URL: https://crevio.co/pt/blog/ai-agent-running-costs

*Última atualização: setembro de 2026. Todos os preços são preços de tabela públicos, verificados em 28 de setembro de 2026.*

**A fatura do modelo raramente é a maior parcela dos custos de funcionamento de um agente de IA. O seu tempo de revisão é.** No exemplo detalhado abaixo, um agente empresarial que executa 300 tarefas por mês custa 73,71 $ em tokens do modelo e 167,70 $ do seu tempo, considerando um minuto de verificação por tarefa.

Isto não significa que os tokens sejam irrelevantes. O mesmo agente pode custar 37 $ ou 387 $ por mês em tokens, dependendo de duas definições que a maioria das pessoas nunca verifica. Este guia destina-se a proprietários e gestores de empresas que querem saber o valor real antes de ativarem um agente, e não receber um intervalo entre 15 $ e 15 000 $.

- **Uma execução de agente envolve muitas chamadas ao modelo, não apenas uma.** Em cada passo, toda a conversa é enviada novamente, pelo que os tokens de entrada dominam e crescem mais depressa do que o número de passos
- **O prompt caching reduziu a fatura de tokens em 62%** no nosso exemplo, mais do que a mudança para um nível de modelo mais barato
- **Os tokens de raciocínio são cobrados como tokens de saída** e, depois do caching, representaram um terço do custo por execução
- **As chamadas a ferramentas e o tempo de sandbox são reduzidos** em volumes normais: 7,20 $ por mês no total, neste caso
- **A revisão humana é a maior parcela** até deixar de verificar todas as execuções e passar a verificar apenas uma amostra

## O que incluem realmente os custos de funcionamento de um agente de IA

Um agente de IA é um modelo a trabalhar num ciclo: lê a tarefa, chama uma ferramenta, lê o resultado, decide o passo seguinte e repete o processo até concluir. Cada ciclo é uma chamada ao modelo cobrada separadamente. Esta é a primeira diferença entre os custos de um agente e os custos de um chat.

A [equipa de engenharia da Anthropic afirmou](https://www.anthropic.com/engineering/multi-agent-research-system) que «os agentes utilizam normalmente cerca de 4 vezes mais tokens do que as interações de chat, e os sistemas multiagente utilizam cerca de 15 vezes mais tokens do que os chats». O mesmo artigo concluiu que a utilização de tokens, por si só, explicava 80% da variação de desempenho nas avaliações de investigação, sendo as chamadas a ferramentas e a escolha do modelo os outros dois fatores. É através dos tokens que os agentes obtêm respostas melhores, precisamente por isso é necessário acompanhar a fatura.

Eis a lista completa do que paga:

| Parcela de custo | O que a determina | Dimensão habitual |
|---|---|---|
| **Tokens de entrada** | Instruções, definições de ferramentas, histórico e resultados das ferramentas, reenviados em cada passo | A maior parcela de tokens |
| **Tokens de saída** | Respostas visíveis e raciocínio oculto | Menor volume, preço unitário 5 vezes superior |
| **Chamadas a ferramentas** | Ferramentas pagas, como pesquisa na web, por chamada | Cêntimos por execução |
| **Tempo de sandbox ou computação** | Um espaço de trabalho onde o agente executa código ou utiliza um browser | Cêntimos por hora |
| **Integrações** | As aplicações e os planos de automação a que o agente se liga | Muitas vezes, uma subscrição que já paga |
| **Novas tentativas e ciclos** | Execuções que falham, se repetem ou se desviam | Uma parcela que pode ultrapassar a média |
| **Revisão humana** | Os minutos que passa a verificar o trabalho do agente | Normalmente, a maior parcela |

## Preços dos tokens em setembro de 2026

Todos os principais fornecedores estabelecem atualmente preços separados para tokens de entrada novos, tokens de entrada em cache e tokens de saída, e a maioria acrescenta um preço pela gravação na cache. Os valores abaixo são retirados diretamente da [página de preços da Claude API](https://platform.claude.com/docs/en/about-claude/pricing), da [página de preços da OpenAI API](https://developers.openai.com/api/docs/pricing) e da [página de preços da Gemini API](https://ai.google.dev/gemini-api/docs/pricing), sempre por milhão de tokens.

![Página de preços da Claude API com os preços por milhão de tokens de entrada, saída e prompt caching para Claude Fable 5.1, Opus 5.5, Sonnet 5.5 e Haiku 4.5](https://crevio.co/vite/assets/claude-api-pricing-fbkhhf9h.png)

| Modelo | Entrada | Gravação na cache | Entrada em cache | Saída |
|---|---|---|---|---|
| Claude Opus 5.5 | 4,00 $ | 5,00 $ | 0,20 $ | 20,00 $ |
| Claude Sonnet 5.5 | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| GPT-6 Sol | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| Gemini 3.8 Flash | 0,75 $ | Armazenamento cobrado à hora | 0,075 $ | 3,75 $ |
| Claude Haiku 4.5 | 1,00 $ | 1,25 $ | 0,10 $ | 5,00 $ |

Há três detalhes nessas páginas que alteram os cálculos mais do que as tarifas anunciadas.

**A entrada em cache custa um décimo da entrada nova, ou menos.** A Anthropic cobra uma leitura da cache a 0,1 vezes o preço base da entrada e, no Opus 5.5, a 0,05 vezes esse preço. A gravação na cache custa 1,25 vezes mais no caso da cache de cinco minutos, pelo que o caching compensa após uma única reutilização. Os modelos GPT-6 da OpenAI seguem o mesmo padrão.

**Os tokens de raciocínio são tokens de saída.** O [guia de raciocínio da OpenAI](https://developers.openai.com/api/docs/guides/reasoning) afirma que os tokens de raciocínio «são cobrados como tokens de saída», apesar de nunca os ver, e a Google identifica o preço de saída como «incluindo tokens de pensamento». Se um modelo pensar durante 700 tokens antes de dar uma resposta de 300 tokens, serão cobrados 1 000 tokens.

**As ferramentas acrescentam tokens antes de fazerem qualquer coisa.** A Anthropic indica um prompt de sistema de 286 tokens para utilização de ferramentas no Opus 5.5, antes das suas próprias definições de ferramentas. O respetivo conjunto de ferramentas de browser acrescenta cerca de 6 600 tokens de entrada a cada pedido que o declara.

![Página de preços da OpenAI API com as tarifas padrão por milhão de tokens para GPT-6 Astra, Sol e Luna, incluindo os preços de entrada em cache e de gravação na cache](https://crevio.co/vite/assets/openai-api-pricing-di89bf36.png)

## Um exemplo detalhado: um agente, 300 execuções por mês

Para obter um valor real, precisa de uma tarefa real. Pense numa atividade comum numa pequena empresa: um agente que trata de um pedido de cliente de ponta a ponta. Lê a mensagem, consulta a encomenda, verifica a política, pesquisa na web uma ou duas vezes quando necessário, redige uma resposta e regista o que fez.

**Pressupostos:**

- **12 chamadas ao modelo por execução.** É aproximadamente o necessário para uma tarefa com cinco chamadas a ferramentas, mais um ou dois passos para concluir
- **12 000 tokens de contexto fixo** por chamada: instruções, contexto empresarial e definições de ferramentas
- **1 800 tokens acrescentados por passo:** 1 500 de resultados das ferramentas e 300 de saída visível do modelo
- **1 000 tokens de saída por passo,** dos quais 700 são de raciocínio
- **2 pesquisas na web, 3 minutos de tempo de sandbox e 1 minuto da sua revisão** por execução
- **300 execuções por mês,** aproximadamente 10 por dia

### Os cálculos de tokens por execução

A primeira chamada envia 12 000 tokens. A décima segunda envia o contexto fixo mais onze passos de histórico: 12 000 + 11 × 1 800 = 31 800 tokens. Somando as doze chamadas, uma execução envia **262 800 tokens de entrada** para produzir **12 000 tokens de saída**. O modelo relê o seu próprio histórico muito mais vezes do que escreve.

Com tarifas de nível intermédio e sem caching:

- Entrada: 262 800 × 2,00 $ por milhão = 0,53 $
- Saída: 12 000 × 10,00 $ por milhão = 0,12 $
- **Total: 0,65 $ por execução**

Com caching, cada chamada lê da cache tudo o que já enviou e grava apenas o que é novo. Ao longo da execução, isso corresponde a 231 000 tokens lidos da cache e 31 800 tokens novos gravados:

- Gravações na cache: 31 800 × 2,50 $ por milhão = 0,08 $
- Leituras da cache: 231 000 × 0,20 $ por milhão = 0,05 $
- Saída: 12 000 × 10,00 $ por milhão = 0,12 $
- **Total: 0,25 $ por execução, menos 62%**

Veja o que aconteceu à composição do custo. Antes do caching, a entrada representava 81% da fatura. Depois, a saída representa quase metade e os 8 400 tokens de raciocínio, por si só, custam 0,08 $, cerca de um terço da execução.

### Escolha do modelo versus caching

Faça os mesmos cálculos para os preços da tabela e a classificação não será a que a maioria das pessoas espera.

![Gráfico de barras do custo mensal dos tokens do modelo para 300 execuções de agentes: 387 $ no modelo de topo sem cache, 194 $ no nível intermédio sem cache, 134 $ no modelo de topo com cache, 74 $ no nível intermédio com cache e 37 $ num modelo pequeno com cache](https://crevio.co/vite/assets/model-and-caching-monthly-cost-bdzdq4na.svg)

Um modelo de topo com caching (134 $) custa menos do que um modelo de nível intermédio sem caching (194 $). Antes de baixar de modelo para poupar dinheiro, verifique se o caching está ativo. O prompt caching é automático em alguns fornecedores e requer uma flag noutros; além disso, um único valor variável perto do início do prompt, como um carimbo de data/hora, quebra silenciosamente a cache em todas as chamadas.

### A fatura mensal completa

Agora acrescente as parcelas que não correspondem a tokens. A pesquisa na web custa [10 $ por 1 000 pesquisas na Claude API](https://platform.claude.com/docs/en/about-claude/pricing) e [na OpenAI](https://developers.openai.com/api/docs/pricing). O tempo de sandbox usa a [tarifa publicada para sessões de agentes da Anthropic](https://platform.claude.com/docs/en/about-claude/pricing), de 0,08 $ por hora de execução. As integrações usam o [plano Professional da Zapier](https://zapier.com/pricing), a 19,99 $ por mês com faturação anual. O tempo de revisão usa 33,54 $ por hora, o [salário médio nos EUA em maio de 2025](https://www.bls.gov/news.release/ocwage.nr0.htm), de 69 770 $ por ano para todas as profissões, dividido por 2 080 horas de trabalho.

| Parcela | Cálculo | Mensal |
|---|---|---|
| Tokens do modelo | 300 execuções × 0,2457 $ | 73,71 $ |
| Ciclos e novas tentativas | 5% das execuções (15) desviam-se até 30 passos, mais 0,43 $ cada | 6,46 $ |
| Pesquisas na web | 600 × 0,01 $ | 6,00 $ |
| Tempo de sandbox | 15 horas × 0,08 $ | 1,20 $ |
| Plano de integração | Uma subscrição de automação | 19,99 $ |
| **Total das máquinas** | | **107,36 $** |
| Revisão humana | 5 horas × 33,54 $ | 167,70 $ |
| **Total** | | **275,06 $** |

![Gráfico de barras do custo mensal de 275 $ de um agente de IA: 167,70 $ de tempo de revisão, 73,71 $ de tokens do modelo, 19,99 $ do plano de integração, 6,46 $ de ciclos, 6,00 $ de pesquisas na web e 1,20 $ de tempo de sandbox](https://crevio.co/vite/assets/where-the-money-goes-jjla4krw.svg)

Isto corresponde a 0,92 $ por tarefa concluída. O facto de ser barato depende inteiramente do valor que a tarefa tinha anteriormente. Se uma pessoa demorasse seis minutos em cada pedido, as mesmas 300 tarefas ocupariam 30 horas, ou cerca de 1 006 $ ao mesmo preço por hora.

## Como escalam os custos de funcionamento de um agente de IA

Os custos não crescem todos da mesma forma, e essa diferença é importante quando planeia aumentar o volume.

**As execuções escalam linearmente.** Duplique as execuções e duplica a fatura de tokens. Em volumes de pequenas empresas, há pouco desconto por volume, embora o [processamento em lote](https://platform.claude.com/docs/en/about-claude/pricing) reduza os preços dos tokens em 50% para trabalhos que possam esperar.

**Os passos escalam mais do que linearmente.** Cada passo adicional reenvia tudo o que veio antes, pelo que o custo cresce aproximadamente com o quadrado da duração da execução. No nosso exemplo, uma execução que se prolongue até 30 passos é 2,5 vezes mais longa, mas custa 0,68 $ em vez de 0,25 $ com caching: 2,75 vezes mais. Sem caching, custa 2,59 $ em vez de 0,65 $, ou seja, quatro vezes mais. É nas execuções longas que os orçamentos derrapam, e o caching também ajuda a atenuar essa curva.

**Os resultados das ferramentas escalam com a quantidade de informação que deixa entrar.** Uma página web obtida tem cerca de 2 500 tokens e um PDF de investigação cerca de 125 000, segundo os valores da Anthropic. Um agente que leia documentos inteiros em vez da secção relevante paga esse texto em cada passo restante da execução.

**A revisão escala com o seu nível de confiança, não com o volume.** Verificar todas as execuções mantém a revisão como a maior parcela para sempre. Verificar uma em cada dez, depois de o agente ter conquistado a sua confiança, reduz o valor total de 275,06 $ para 124,13 $ por mês. É a maior poupança individual disponível e não tem nada que ver com os modelos.

## Como estimar os custos do seu próprio agente

Não precisa de uma folha de cálculo. Precisa de cinco números, e o quarto é aquele que as pessoas ignoram.

1. **Execuções por mês.** Conte a frequência com que a tarefa ocorre realmente hoje, não a frequência com que gostaria que ocorresse
2. **Passos por execução.** Aproximadamente duas chamadas ao modelo por chamada a uma ferramenta, mais uma para concluir
3. **Tokens por passo.** Contexto fixo mais o tamanho de um resultado típico de uma ferramenta. A maioria dos fornecedores mostra a utilização por pedido; execute a tarefa dez vezes e consulte o valor real
4. **Minutos de revisão por execução.** Cronometre-se enquanto verifica cinco resultados. Este número influencia o total mais do que o modelo
5. **Taxa de falhas.** A percentagem de execuções que entram em ciclo, são repetidas ou precisam de ser refeitas, calculada com a sua duração maior

Depois, use: **custo mensal ≈ execuções × (tokens por execução × preço médio + chamadas pagas a ferramentas) + execuções × minutos de revisão × a sua tarifa horária.** Use o preço em cache para o contexto repetido e o preço total para tudo o que for novo, e normalmente ficará próximo da fatura real.

## Como limitar os custos de um agente de IA

As estimativas desviam-se. Os limites não. Estes são os controlos que funcionam de facto:

- **Defina um limite de gastos na conta do fornecedor.** A maioria das consolas de fornecedores oferece um limite mensal, um alerta de orçamento ou ambos. Defina-o antes da primeira execução agendada, não depois da primeira fatura surpreendente
- **Limite os passos por execução.** Um máximo de 20 ou 25 passos transforma um ciclo descontrolado numa execução falhada que pode inspecionar, em vez de gerar uma fatura sem limite
- **Limite o esforço de raciocínio e o comprimento da saída.** A maioria dos modelos de raciocínio disponibiliza uma definição de esforço ou orçamento. Reserve-a para tarefas difíceis; não é necessária em consultas de rotina
- **Mantenha estável o início do prompt.** Qualquer elemento que mude em cada chamada e seja colocado no início quebra o caching de tudo o que vem depois
- **Reduza os resultados das ferramentas antes de os mostrar ao modelo.** Devolva os três campos de que o agente precisa, não o registo completo nem a página inteira
- **Encaminhe as tarefas consoante a dificuldade.** Use um modelo pequeno para classificação e consultas e um modelo mais potente para o passo que exige discernimento
- **Passe da revisão completa para a amostragem** quando o agente tiver um histórico consistente nessa tarefa, mantendo a revisão completa para qualquer ação que envie dinheiro ou mensagens a clientes. É a mesma regra de criar primeiro um rascunho que recomendamos ao [escolher as primeiras tarefas a entregar a um agente](/pt/blog/ai-agents-for-small-business)

## O que ninguém lhe diz

- **O mesmo texto pode custar mais num modelo mais recente.** A [Anthropic refere](https://platform.claude.com/docs/en/about-claude/pricing) que o seu tokenizador mais recente «produz aproximadamente 30% mais tokens para o mesmo texto». Compare a utilização real, não apenas o preço por token
- **Os preços promocionais terminam.** O [Gemini 3.8 Flash](https://ai.google.dev/gemini-api/docs/pricing) custa 0,75 $ por milhão de tokens de entrada até 31 de dezembro de 2026 e, depois, 1,50 $ a partir de 1 de janeiro de 2027. Faça o orçamento com base no preço que pagará no próximo ano
- **Os preços em cache variam consoante o modelo, mesmo dentro do mesmo fornecedor.** O Opus 5.5 lê a cache a 5% do preço base de entrada, enquanto a maioria dos modelos a lê a 10%; por isso, a configuração mais barata nem sempre usa o modelo mais barato
- **As falhas também são cobradas.** Uma execução que dá erro no passo nove já pagou oito passos. Recomeçar do zero paga-os novamente, e mudar para um [modelo de reserva](/pt/blog/ai-agent-backup-models) a meio da execução começa de novo com uma cache vazia
- **Os meses tranquilos são baratos e o mês movimentado não é.** O custo do agente acompanha o volume da sua empresa, precisamente quando uma fatura variável é menos conveniente. Defina o limite para o seu melhor mês, não para a média

## Onde entra a Crevio

![Página de preços da Crevio com o plano Starter gratuito, o Pro a 20 $ por mês com 1 000 créditos e o Business a 50 $ por mês com 2 500 créditos](https://crevio.co/vite/assets/crevio-pricing-pe4bsahk.png)

Tudo o que foi apresentado acima pressupõe que executa o agente por sua conta e paga separadamente a cada fornecedor. A [Crevio](https://crevio.co/) segue uma abordagem diferente: é um [construtor de negócios com IA](/pt/blog/ai-business-builder), e todo o trabalho de IA que realiza por si — desde criar o seu site e escrever páginas de produtos até gerar imagens, enviar e-mails de marketing e pesquisar na web — é descontado de um único saldo de créditos. As tarefas maiores utilizam mais créditos do que as pequenas, e a plataforma acompanha os tokens, o caching e as chamadas a ferramentas nos bastidores, para que não tenha de o fazer.

O Pro custa 20 $ por mês e inclui 1 000 créditos; o Business custa 50 $ e inclui 2 500. Ambos permitem escolher um plafond mensal maior à medida que a empresa cresce. O Starter é gratuito e inclui um plafond reduzido para experimentar. Os créditos mensais são repostos em cada ciclo de faturação, enquanto os créditos bónus de registo e de referências não expiram. Num plano pago, pode comprar créditos adicionais a qualquer momento ou ativar compras automáticas; e, se os créditos acabarem, o seu site e o checkout continuam a funcionar. Apenas o novo trabalho de IA fica suspenso.

Sendo claros quanto à contrapartida: um saldo de créditos dá-lhe um único valor previsível, mas oculta o detalhe por token explicado neste artigo. Se quiser controlar por si a escolha do modelo e as definições de caching, executar a sua própria stack de agentes dá-lhe esse controlo. E nenhum modelo de preços elimina a parcela da revisão. Esse minuto por execução continua a ser seu até decidir que o agente merece menos supervisão. Também se aplicam taxas de transação em todos os planos: 5% no Starter, 2,5% no Pro e 1% no Business.

## Perguntas frequentes sobre os custos de funcionamento de agentes de IA

### Quanto custa executar um agente de IA por mês?

Para um único agente empresarial que trate cerca de 300 tarefas por mês, conte com aproximadamente 40 $ a 400 $ em tokens do modelo, dependendo do modelo e de o prompt caching estar ativo, mais alguns dólares em ferramentas e computação. No nosso exemplo detalhado, os custos das máquinas totalizaram 107,36 $ e o total chegou a 275,06 $, incluindo um minuto de revisão humana por tarefa.

### Qual é o maior custo oculto de um agente de IA?

O tempo de revisão humana. Verificar cada resultado durante um minuto, ao salário médio nos EUA, custou mais do dobro da fatura total de tokens no nosso exemplo. O segundo maior custo é o contexto reenviado: em cada passo de uma execução paga novamente por tudo o que o agente já leu, razão pela qual as execuções longas custam desproporcionalmente mais.

### Os tokens de raciocínio têm um custo adicional?

São cobrados como tokens de saída ao preço de saída do modelo, apesar de nunca os ver. Tanto a OpenAI como a Google afirmam isso na respetiva documentação e nas páginas de preços. No nosso exemplo, o raciocínio representou cerca de um terço do custo de cada execução com cache.

### Quanto poupa o prompt caching nos custos de um agente?

No nosso exemplo, reduziu a fatura de tokens em 62%, de 0,65 $ para 0,25 $ por execução, porque um agente reenvia as mesmas instruções e o mesmo histórico em cada passo. Na maioria dos modelos, as leituras em cache custam um décimo da entrada nova. O caching só funciona se o início do prompt permanecer idêntico entre chamadas.

### Uma subscrição é mais barata do que pagar por token por um agente?

Depende do seu volume e da previsibilidade desse volume. Os planos fixos limitam o risco de custos elevados, mas podem sair mais caros quando a utilização é reduzida; os preços da API por utilização acompanham exatamente o consumo. Especificamente para os planos do ChatGPT e da Claude, calculámos o [ponto de equilíbrio entre uma subscrição e a API](/pt/blog/chatgpt-subscription-vs-api-for-agents): cerca de 80 execuções por mês para um plano de 20 $. Analisámos o lado da plataforma na nossa [análise de alternativas ao Squad](/pt/blog/squad-so-alternatives), que compara preços por utilização com preços fixos.

Os tokens são o custo que consegue ler numa fatura. A sua atenção é o custo que tem de contabilizar por si e, normalmente, é o maior dos dois.

## Artigos relacionados

- [Agentes de IA para pequenas empresas: que tarefas entregar primeiro](/pt/blog/ai-agents-for-small-business)
- [Funcionário de IA vs. agente de IA: a diferença que realmente importa](/pt/blog/ai-employee-vs-ai-agent)
- [Construtor de negócios com IA vs. contratar uma equipa: a comparação honesta de 2026](/pt/blog/ai-business-builder-vs-hiring-a-team)
