# Costi di gestione di un agente AI: quanto costa davvero al mese

> Costi di gestione di un agente AI, calcolati con i prezzi dei token di settembre 2026. Scopra dove finiscono i soldi, come scalano i costi e come stimare e limitare la spesa.

Last updated: 2026-09-28T12:00:00

Canonical URL: https://crevio.co/it/blog/ai-agent-running-costs

*Ultimo aggiornamento: settembre 2026. Tutti i prezzi sono prezzi di listino pubblici verificati il 28 settembre 2026.*

**Il costo del modello è raramente la voce più alta nella gestione di un agente AI. Il tempo dedicato alla verifica, invece, lo è.** Nell’esempio riportato di seguito, un agente aziendale che svolge 300 attività al mese costa 73,71 $ in token del modello e 167,70 $ per il tempo impiegato, considerando un minuto di verifica per attività.

Questo non significa che i token siano irrilevanti. Lo stesso agente può costare 37 o 387 $ al mese in token, a seconda di due impostazioni che quasi nessuno controlla. Questa guida è pensata per titolari d’impresa e responsabili operativi che vogliono conoscere un costo realistico prima di attivare un agente, non una forbice da 15 a 15.000 $.

- **Un’esecuzione dell’agente comprende molte chiamate al modello, non una sola.** A ogni passaggio viene reinviata l’intera conversazione, quindi i token di input prevalgono e crescono più rapidamente del numero di passaggi
- **Il prompt caching ha ridotto del 62% il costo dei token** nel nostro esempio, più di quanto abbia fatto il passaggio a un livello di modello meno costoso
- **I token di ragionamento vengono fatturati come output** e, dopo il caching, rappresentavano un terzo del costo per esecuzione
- **Le chiamate agli strumenti e il tempo in sandbox incidono poco** ai volumi tipici: qui ammontano complessivamente a 7,20 $ al mese
- **La verifica umana è la voce più alta** finché non si passa dal controllo di ogni esecuzione al controllo di un campione

## Che cosa comprendono davvero i costi di gestione di un agente AI

Un agente AI è un modello che lavora in un ciclo: legge l’attività, chiama uno strumento, legge il risultato, decide il passaggio successivo e ripete il processo finché non ha terminato. Ogni ciclo è una chiamata al modello distinta e a pagamento. È questo il primo elemento che distingue i costi di un agente da quelli di una chat.

[Il team di progettazione di Anthropic ha riferito](https://www.anthropic.com/engineering/multi-agent-research-system) che «in genere gli agenti utilizzano circa 4 volte più token delle interazioni in chat e i sistemi multi-agente circa 15 volte più token delle chat». Lo stesso documento rileva che il solo utilizzo dei token spiegava l’80% della variabilità delle prestazioni nelle valutazioni di ricerca, mentre le chiamate agli strumenti e la scelta del modello rappresentavano gli altri due fattori. Gli agenti ottengono risposte migliori utilizzando più token: proprio per questo è importante tenere sotto controllo la spesa.

Ecco l’elenco completo di ciò che paga:

| Livello di costo | Fattore determinante | Entità tipica |
|---|---|---|
| **Token di input** | Istruzioni, definizioni degli strumenti, cronologia e risultati degli strumenti, reinviati a ogni passaggio | La voce più alta tra i token |
| **Token di output** | Risposte visibili e ragionamento nascosto | Volume inferiore, prezzo unitario 5 volte maggiore |
| **Chiamate agli strumenti** | Strumenti a pagamento, come la ricerca web, per chiamata | Centesimi per esecuzione |
| **Tempo in sandbox o di calcolo** | Un ambiente di lavoro in cui l’agente esegue codice o utilizza un browser | Centesimi all’ora |
| **Integrazioni** | Le app e i piani di automazione a cui l’agente si collega | Spesso un abbonamento che paga già |
| **Nuovi tentativi e cicli** | Esecuzioni che falliscono, si ripetono o si perdono | Una coda di costi che può superare la media |
| **Verifica umana** | I minuti dedicati a controllare il lavoro dell’agente | Di solito la voce più alta |

## Prezzi dei token a settembre 2026

Oggi tutti i principali provider applicano prezzi distinti per l’input nuovo, l’input memorizzato nella cache e l’output; la maggior parte applica inoltre un prezzo per la scrittura nella cache. I numeri riportati di seguito provengono direttamente dalla [pagina dei prezzi dell’API Claude](https://platform.claude.com/docs/en/about-claude/pricing), dalla [pagina dei prezzi dell’API OpenAI](https://developers.openai.com/api/docs/pricing) e dalla [pagina dei prezzi dell’API Gemini](https://ai.google.dev/gemini-api/docs/pricing), tutti espressi per milione di token.

![Pagina dei prezzi dell’API Claude con i prezzi per milione di token di input, output e prompt caching per Claude Fable 5.1, Opus 5.5, Sonnet 5.5 e Haiku 4.5](https://crevio.co/vite/assets/claude-api-pricing-fbkhhf9h.png)

| Modello | Input | Scrittura nella cache | Input memorizzato nella cache | Output |
|---|---|---|---|---|
| Claude Opus 5.5 | 4,00 $ | 5,00 $ | 0,20 $ | 20,00 $ |
| Claude Sonnet 5.5 | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| GPT-6 Sol | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| Gemini 3.8 Flash | 0,75 $ | Archiviazione fatturata a ore | 0,075 $ | 3,75 $ |
| Claude Haiku 4.5 | 1,00 $ | 1,25 $ | 0,10 $ | 5,00 $ |

Tre dettagli riportati in quelle pagine modificano i calcoli più dei prezzi principali.

**L’input memorizzato nella cache costa un decimo dell’input nuovo, o anche meno.** Anthropic applica un prezzo pari a 0,1 volte quello dell’input di base per la lettura dalla cache e a 0,05 volte per Opus 5.5. La scrittura nella cache temporanea di cinque minuti costa 1,25 volte il prezzo normale, quindi il caching si ripaga dopo un solo riutilizzo. Anche i modelli GPT-6 di OpenAI seguono lo stesso schema.

**I token di ragionamento sono token di output.** La [guida al ragionamento di OpenAI](https://developers.openai.com/api/docs/guides/reasoning) specifica che i token di ragionamento «vengono fatturati come token di output», anche se non vengono mai mostrati; Google indica il prezzo dell’output come «comprensivo dei token di ragionamento». Se un modello utilizza 700 token per ragionare prima di fornire una risposta di 300 token, ne vengono fatturati 1.000.

**Gli strumenti aggiungono token prima ancora di fare qualcosa.** Anthropic indica un prompt di sistema per l’utilizzo degli strumenti di 286 token su Opus 5.5, prima ancora delle definizioni degli strumenti. Il relativo set di strumenti per il browser aggiunge circa 6.600 token di input a ogni richiesta in cui viene dichiarato.

![Pagina dei prezzi dell’API OpenAI con le tariffe standard per milione di token di GPT-6 Astra, Sol e Luna, compresi i prezzi dell’input memorizzato nella cache e della scrittura nella cache](https://crevio.co/vite/assets/openai-api-pricing-di89bf36.png)

## Un esempio concreto: un agente, 300 esecuzioni al mese

Per ottenere un numero realistico serve un’attività reale. Prendiamo un caso comune per una piccola impresa: un agente che gestisce una richiesta del cliente dall’inizio alla fine. Legge il messaggio, cerca l’ordine, verifica la policy, effettua una o due ricerche sul web quando necessario, prepara una risposta e registra ciò che ha fatto.

**Le ipotesi:**

- **12 chiamate al modello per esecuzione.** È il numero approssimativo necessario per un’attività con cinque chiamate agli strumenti, più uno o due passaggi conclusivi
- **12.000 token di contesto fisso** per chiamata: istruzioni, contesto aziendale e definizioni degli strumenti
- **1.800 token aggiunti a ogni passaggio:** 1.500 di risultati degli strumenti e 300 di output visibile del modello
- **1.000 token di output per passaggio,** di cui 700 di ragionamento
- **2 ricerche web, 3 minuti in sandbox e 1 minuto di verifica** per esecuzione
- **300 esecuzioni al mese,** circa 10 al giorno

### Il calcolo dei token per esecuzione

La prima chiamata invia 12.000 token. La dodicesima invia il contesto fisso più gli undici passaggi della cronologia: 12.000 + 11 × 1.800 = 31.800 token. Sommando tutte e dodici le chiamate, un’esecuzione invia **262.800 token di input** per produrre **12.000 token di output**. Il modello rilegge la propria cronologia molto più di quanto scriva.

Con le tariffe di fascia media e senza caching:

- Input: 262.800 × 2,00 $ per milione = 0,53 $
- Output: 12.000 × 10,00 $ per milione = 0,12 $
- **Totale: 0,65 $ per esecuzione**

Con il caching, a ogni chiamata tutto ciò che è già stato inviato viene letto dalla cache e viene scritto soltanto ciò che è nuovo. Nell’intera esecuzione si tratta di 231.000 token memorizzati nella cache e 31.800 scritti ex novo:

- Scritture nella cache: 31.800 × 2,50 $ per milione = 0,08 $
- Letture dalla cache: 231.000 × 0,20 $ per milione = 0,05 $
- Output: 12.000 × 10,00 $ per milione = 0,12 $
- **Totale: 0,25 $ per esecuzione, il 62% in meno**

Osservi come cambia la composizione dei costi. Prima del caching, l’input rappresentava l’81% della spesa. Dopo il caching, l’output ne rappresenta quasi la metà e i soli 8.400 token di ragionamento costano 0,08 $, circa un terzo del costo dell’esecuzione.

### Scelta del modello o caching

Ripetendo lo stesso calcolo per tutti i prezzi della tabella, la classifica non è quella che molti si aspetterebbero.

![Grafico a barre del costo mensile dei token del modello per 300 esecuzioni di un agente: 387 $ per un modello frontier senza caching, 194 $ per un modello di fascia media senza caching, 134 $ per un modello frontier con caching, 74 $ per un modello di fascia media con caching e 37 $ per un modello piccolo con caching](https://crevio.co/vite/assets/model-and-caching-monthly-cost-bdzdq4na.svg)

Un modello frontier con caching (134 $) costa meno di un modello di fascia media senza caching (194 $). Prima di passare a un modello meno potente per risparmiare, verifichi che il caching sia attivo. Per alcuni provider il prompt caching è automatico, mentre per altri richiede un flag; inoltre, un solo valore variabile vicino all’inizio del prompt, come un timestamp, può interromperlo silenziosamente a ogni chiamata.

### Il costo mensile complessivo

Ora aggiungiamo i livelli di costo che non riguardano i token. La ricerca web costa [10 $ ogni 1.000 ricerche sull’API Claude](https://platform.claude.com/docs/en/about-claude/pricing) e [su OpenAI](https://developers.openai.com/api/docs/pricing). Il tempo in sandbox utilizza la [tariffa pubblicata per le sessioni degli agenti](https://platform.claude.com/docs/en/about-claude/pricing) di Anthropic, pari a 0,08 $ per ora di esecuzione. Per le integrazioni consideriamo il [piano Professional di Zapier](https://zapier.com/pricing), pari a 19,99 $ al mese con fatturazione annuale. Per il tempo di verifica utilizziamo 33,54 $ l’ora, la [retribuzione media statunitense di maggio 2025](https://www.bls.gov/news.release/ocwage.nr0.htm), pari a 69.770 $ l’anno per tutte le professioni, divisa per 2.080 ore lavorative.

| Voce | Calcolo | Mensile |
|---|---|---|
| Token del modello | 300 esecuzioni × 0,2457 $ | 73,71 $ |
| Cicli e nuovi tentativi | Il 5% delle esecuzioni (15) arriva a 30 passaggi, con 0,43 $ aggiuntivi ciascuna | 6,46 $ |
| Ricerche web | 600 × 0,01 $ | 6,00 $ |
| Tempo in sandbox | 15 ore × 0,08 $ | 1,20 $ |
| Piano di integrazione | Un abbonamento per l’automazione | 19,99 $ |
| **Totale macchina** | | **107,36 $** |
| Verifica umana | 5 ore × 33,54 $ | 167,70 $ |
| **Totale complessivo** | | **275,06 $** |

![Grafico a barre del costo mensile di 275 $ per un agente AI: 167,70 $ di tempo di verifica, 73,71 $ di token del modello, 19,99 $ per il piano di integrazione, 6,46 $ per i cicli, 6,00 $ per le ricerche web e 1,20 $ per il tempo in sandbox](https://crevio.co/vite/assets/where-the-money-goes-jjla4krw.svg)

Sono 0,92 $ per attività completata. Stabilire se sia poco dipende interamente dal valore che l’attività aveva prima. Se una persona impiegava sei minuti per ogni richiesta, le stesse 300 attività richiedevano 30 ore, ovvero circa 1.006 $ alla stessa tariffa oraria.

## Come scalano i costi di gestione di un agente AI

I costi non crescono tutti allo stesso modo e la differenza è importante quando si pianificano volumi maggiori.

**Le esecuzioni scalano linearmente.** Se raddoppiano le esecuzioni, raddoppia il costo dei token. Alle dimensioni di una piccola impresa gli sconti sui volumi sono limitati, anche se il [batch processing](https://platform.claude.com/docs/en/about-claude/pricing) riduce del 50% il prezzo dei token per le attività che possono attendere.

**I passaggi crescono più che linearmente.** Ogni passaggio aggiuntivo reinvia tutto ciò che lo precede, quindi il costo cresce all’incirca con il quadrato della durata dell’esecuzione. Nel nostro esempio, un’esecuzione che si prolunga fino a 30 passaggi è 2,5 volte più lunga, ma con il caching costa 0,68 $ invece di 0,25 $, cioè 2,75 volte tanto. Senza caching costa 2,59 $ invece di 0,65 $, quattro volte tanto. Sono le esecuzioni lunghe a far saltare i budget, e il caching è anche ciò che attenua questa curva.

**I risultati degli strumenti scalano in base a ciò che si lascia passare.** Secondo i dati di Anthropic, una pagina web recuperata contiene circa 2.500 token e un PDF di ricerca circa 125.000. Un agente che legge documenti interi invece della sezione pertinente paga quel testo a ogni passaggio successivo dell’esecuzione.

**La verifica scala in base al livello di fiducia, non al volume.** Controllare ogni esecuzione fa sì che la verifica resti per sempre la voce più alta. Controllare un’esecuzione su dieci, dopo che l’agente ha dimostrato di meritarlo, porta il totale complessivo da 275,06 a 124,13 $ al mese. È il maggiore risparmio ottenibile con una singola modifica e non ha nulla a che vedere con i modelli.

## Come stimare i costi del proprio agente

Non serve un foglio di calcolo. Servono cinque numeri, e il quarto è quello che tutti tendono a saltare.

1. **Esecuzioni al mese.** Conti quante volte l’attività viene effettivamente svolta oggi, non quante volte vorrebbe che venisse svolta
2. **Passaggi per esecuzione.** In linea di massima, due chiamate al modello per chiamata allo strumento, più una per concludere
3. **Token per passaggio.** Contesto fisso più la dimensione di un risultato tipico dello strumento. La maggior parte dei provider mostra l’utilizzo per richiesta: esegua l’attività dieci volte e legga il dato reale
4. **Minuti di verifica per esecuzione.** Si cronometri mentre controlla cinque risultati. Questo numero incide sul totale più del modello
5. **Tasso di errore.** La percentuale di esecuzioni che entrano in loop, richiedono un nuovo tentativo o devono essere ripetute, calcolata sulla loro durata maggiore

Quindi: **costo mensile ≈ esecuzioni × (token per esecuzione × prezzo medio + chiamate agli strumenti a pagamento) + esecuzioni × minuti di verifica × tariffa oraria.** Utilizzi il prezzo della cache per il contesto ripetuto e il prezzo pieno per tutto ciò che è nuovo: di solito otterrà una stima molto vicina alla spesa reale.

## Come limitare i costi di un agente AI

Le stime possono cambiare. I limiti no. Questi sono i controlli che funzionano davvero:

- **Imposti un limite di spesa sull’account del provider.** La maggior parte delle console offre un limite mensile, un avviso di budget o entrambi. Lo imposti prima della prima esecuzione programmata, non dopo la prima fattura sorprendente
- **Limiti i passaggi per esecuzione.** Un massimo di 20 o 25 passaggi trasforma un loop senza fine in un’esecuzione non riuscita che può essere analizzata, invece di generare una spesa illimitata
- **Limiti il livello di ragionamento e la lunghezza dell’output.** La maggior parte dei modelli di ragionamento espone un’impostazione per il livello o il budget. I lavori complessi la meritano, le ricerche di routine no
- **Mantenga stabile l’inizio del prompt.** Qualsiasi elemento che cambia a ogni chiamata e viene inserito all’inizio interrompe il caching per tutto ciò che segue
- **Riduca i risultati degli strumenti prima che arrivino al modello.** Restituisca i tre campi necessari all’agente, non l’intero record o l’intera pagina
- **Scelga il modello in base alla difficoltà.** Un modello piccolo per classificazione e ricerche, uno più potente per il passaggio che richiede valutazione
- **Passi dal controllo completo al campionamento** quando l’agente ha dimostrato di lavorare bene su quell’attività, mantenendo il controllo completo per qualsiasi azione che invii denaro o messaggi ai clienti. È la stessa regola del «prima la bozza» che consigliamo quando [sceglie a quali attività affidare per prime un agente](/it/blog/ai-agents-for-small-business)

## Quello che nessuno le dice

- **Lo stesso testo può costare di più su un modello più recente.** [Anthropic osserva](https://platform.claude.com/docs/en/about-claude/pricing) che il suo tokenizer più recente «produce circa il 30% di token in più a parità di testo». Confronti l’utilizzo reale, non solo il prezzo per token
- **I prezzi promozionali finiscono.** [Gemini 3.8 Flash](https://ai.google.dev/gemini-api/docs/pricing) costa 0,75 $ per milione di token di input fino al 31 dicembre 2026, poi 1,50 $ dal 1° gennaio 2027. Pianifichi il budget sulla tariffa che pagherà l’anno prossimo
- **I prezzi della cache cambiano da un modello all’altro dello stesso provider.** Opus 5.5 legge dalla cache al 5% del prezzo dell’input di base, mentre la maggior parte dei modelli lo fa al 10%; perciò la configurazione più economica non coincide sempre con il modello meno costoso
- **Anche gli errori vengono fatturati.** Un’esecuzione che va in errore al nono passaggio ha già pagato gli otto precedenti. Ripartire da zero significa pagarli di nuovo; passare a un [modello di riserva](/it/blog/ai-agent-backup-models) durante l’esecuzione significa iniziare con una cache vuota
- **I mesi tranquilli costano poco, quello più intenso no.** Il costo dell’agente segue il volume dell’attività, proprio quando una spesa variabile è meno gradita. Imposti il limite sul mese migliore, non su quello medio

## Il ruolo di Crevio

![Pagina dei prezzi di Crevio con il piano Starter gratuito, Pro a 20 $ al mese con 1.000 crediti e Business a 50 $ al mese con 2.500 crediti](https://crevio.co/vite/assets/crevio-pricing-pe4bsahk.png)

Tutto ciò che abbiamo visto finora presuppone che gestisca l’agente autonomamente e paghi separatamente ogni provider. [Crevio](https://crevio.co/) segue un approccio diverso: è un [AI business builder](/it/blog/ai-business-builder) e tutto il lavoro AI che svolge per lei, dalla creazione del sito e delle pagine prodotto alla generazione di immagini, dall’invio di email di marketing alla ricerca sul web, viene scalato da un unico saldo crediti. Le attività più complesse utilizzano più crediti di quelle semplici e la piattaforma gestisce token, caching e chiamate agli strumenti in background, senza che debba occuparsene.

Pro costa 20 $ al mese con 1.000 crediti, mentre Business costa 50 $ con 2.500 crediti; entrambi consentono di scegliere una disponibilità mensile maggiore quando l’attività cresce. Starter è gratuito e include una disponibilità ridotta per fare una prova. I crediti mensili si azzerano a ogni ciclo di fatturazione, mentre i crediti bonus ottenuti con la registrazione e i referral non scadono. Con un piano a pagamento può effettuare una ricarica in qualsiasi momento o attivare le ricariche automatiche; se i crediti finiscono, il sito e il checkout continuano a funzionare. Si interrompono solo le nuove attività AI.

Parlando con chiarezza del compromesso: un saldo crediti offre un unico numero prevedibile, ma nasconde il dettaglio per token illustrato in questo articolo. Se vuole gestire personalmente la scelta del modello e le impostazioni di caching, una propria infrastruttura per agenti le offre questo controllo. Nessun modello di prezzo, però, elimina la voce della verifica. Quel minuto per esecuzione resta a suo carico finché non decide che l’agente ha dimostrato di poter lavorare con meno supervisione. Le commissioni sulle transazioni si applicano inoltre a tutti i piani: 5% su Starter, 2,5% su Pro e 1% su Business.

## Domande frequenti sui costi di gestione di un agente AI

### Quanto costa gestire un agente AI al mese?

Per un singolo agente aziendale che gestisce circa 300 attività al mese, metta in conto approssimativamente da 40 a 400 $ in token del modello, a seconda del modello scelto e dell’attivazione del prompt caching, più qualche dollaro per strumenti e calcolo. Nel nostro esempio concreto, i costi macchina ammontano a 107,36 $, mentre il totale, includendo un minuto di verifica umana per attività, è di 275,06 $.

### Qual è il maggiore costo nascosto di un agente AI?

Il tempo dedicato alla verifica umana. Nel nostro esempio, controllare ogni risultato per un minuto alla retribuzione media statunitense costa più del doppio dell’intera spesa per i token. Il secondo costo nascosto più importante è il contesto reinviato: a ogni passaggio si paga nuovamente tutto ciò che l’agente ha già letto, motivo per cui le esecuzioni lunghe costano sproporzionatamente di più.

### I token di ragionamento costano di più?

Vengono fatturati come token di output al prezzo dell’output del modello, anche se non vengono mai mostrati. OpenAI e Google lo dichiarano entrambe nella documentazione e nelle pagine dei prezzi. Nel nostro esempio, il ragionamento rappresentava circa un terzo del costo di ogni esecuzione con caching.

### Quanto fa risparmiare il prompt caching sui costi di un agente?

Nel nostro esempio ha ridotto del 62% il costo dei token, da 0,65 a 0,25 $ per esecuzione, perché un agente reinvia le stesse istruzioni e la stessa cronologia a ogni passaggio. Sulla maggior parte dei modelli, le letture dalla cache costano un decimo dell’input nuovo. Il caching funziona solo se l’inizio del prompt rimane identico tra una chiamata e l’altra.

### Un abbonamento costa meno del pagamento a consumo per token?

Dipende dal volume e dalla sua prevedibilità. I piani a tariffa fissa limitano la spesa massima, ma possono costare di più quando l’utilizzo è ridotto; i prezzi API a consumo seguono invece esattamente l’utilizzo. Per i piani ChatGPT e Claude, in particolare, abbiamo calcolato il [punto di pareggio tra un abbonamento e l’API](/it/blog/chatgpt-subscription-vs-api-for-agents): circa 80 esecuzioni al mese per un piano da 20 $. Abbiamo confrontato l’aspetto legato alla piattaforma nella nostra [analisi delle alternative a Squad](/it/blog/squad-so-alternatives), che mette a confronto prezzi a consumo e prezzi fissi.

I token sono il costo che può leggere in fattura. La sua attenzione è il costo che deve conteggiare personalmente e, di solito, è quello più alto.

## Articoli correlati

- [Agenti AI per le piccole imprese: a quali attività affidarsi per prime](/it/blog/ai-agents-for-small-business)
- [Dipendente AI o agente AI: la differenza che conta davvero](/it/blog/ai-employee-vs-ai-agent)
- [AI business builder o assunzione di un team: il confronto onesto del 2026](/it/blog/ai-business-builder-vs-hiring-a-team)
