# Coûts d’exploitation d’un agent IA : combien coûte réellement un agent par mois

> Coûts d’exploitation d’un agent IA calculés avec les prix des tokens de septembre 2026. Découvrez où va l’argent, comment les coûts évoluent et comment estimer et plafonner votre facture.

Last updated: 2026-09-28T12:00:00

Canonical URL: https://crevio.co/fr/blog/ai-agent-running-costs

*Dernière mise à jour : septembre 2026. Tous les prix correspondent aux tarifs publics vérifiés le 28 septembre 2026.*

**La facture du modèle représente rarement la majeure partie des coûts d’exploitation d’un agent IA. C’est votre temps de vérification qui pèse le plus.** Dans l’exemple détaillé ci-dessous, un agent métier qui traite 300 tâches par mois coûte 73,71 $ en tokens de modèle et 167,70 $ en temps humain, à raison d’une minute de vérification par tâche.

Cela ne signifie pas que les tokens sont négligeables. Le même agent peut coûter 37 ou 387 $ par mois en tokens selon deux paramètres que la plupart des utilisateurs ne consultent jamais. Ce guide s’adresse aux dirigeants et responsables opérationnels qui veulent connaître le coût réel avant d’activer un agent, plutôt qu’obtenir une fourchette allant de 15 à 15 000 $.

- **Une exécution d’agent comporte de nombreux appels au modèle, pas un seul.** À chaque étape, l’intégralité de la conversation est renvoyée : les tokens d’entrée dominent donc la facture et augmentent plus vite que le nombre d’étapes
- **La mise en cache des prompts a réduit la facture de tokens de 62 %** dans notre exemple, soit davantage que le passage à une gamme de modèles moins chère
- **Les tokens de raisonnement sont facturés comme des tokens de sortie** et, après mise en cache, représentaient un tiers du coût par exécution
- **Les appels d’outils et le temps d’exécution en sandbox restent limités** aux volumes habituels : 7,20 $ par mois au total ici
- **La vérification humaine est le poste le plus important** tant que vous contrôlez chaque exécution au lieu de vérifier seulement un échantillon

## Ce que comprennent réellement les coûts d’exploitation d’un agent IA

Un agent IA est un modèle qui fonctionne en boucle : il lit la tâche, appelle un outil, lit le résultat, décide de l’étape suivante, puis recommence jusqu’à la fin. Chaque boucle correspond à un appel au modèle facturé séparément. C’est le premier élément qui distingue les coûts d’un agent de ceux d’une conversation classique.

L’[équipe d’ingénierie d’Anthropic a indiqué](https://www.anthropic.com/engineering/multi-agent-research-system) que « les agents utilisent généralement environ 4 fois plus de tokens que les interactions conversationnelles, et les systèmes multi-agents environ 15 fois plus que les conversations ». La même étude a montré que l’utilisation des tokens expliquait à elle seule 80 % de la variance des performances lors de leurs évaluations de recherche, les appels d’outils et le choix du modèle constituant les deux autres facteurs. Les tokens permettent aux agents d’obtenir de meilleures réponses : c’est précisément pour cela qu’il faut surveiller la facture.

Voici la liste complète de ce que vous payez :

| Poste de coût | Ce qui le détermine | Ordre de grandeur habituel |
|---|---|---|
| **Tokens d’entrée** | Instructions, définitions des outils, historique et résultats des outils, renvoyés à chaque étape | Le principal poste lié aux tokens |
| **Tokens de sortie** | Réponses visibles et raisonnement masqué | Moins nombreux, mais prix unitaire 5 fois supérieur |
| **Appels d’outils** | Outils payants, comme la recherche web, facturés à l’appel | Quelques centimes par exécution |
| **Temps en sandbox ou de calcul** | Espace de travail où l’agent exécute du code ou utilise un navigateur | Quelques centimes par heure |
| **Intégrations** | Applications et offres d’automatisation auxquelles l’agent se connecte | Souvent un abonnement que vous payez déjà |
| **Nouvelles tentatives et boucles** | Exécutions qui échouent, recommencent ou s’égarent | Un surplus pouvant dépasser la moyenne |
| **Vérification humaine** | Minutes que vous passez à contrôler le travail de l’agent | Généralement le poste le plus important |

## Prix des tokens en septembre 2026

Tous les principaux fournisseurs facturent désormais séparément les tokens d’entrée nouveaux, les tokens d’entrée mis en cache et les tokens de sortie. La plupart appliquent également un tarif à l’écriture dans le cache. Les chiffres ci-dessous proviennent directement des pages de tarification de l’[API Claude](https://platform.claude.com/docs/en/about-claude/pricing), de l’[API OpenAI](https://developers.openai.com/api/docs/pricing) et de l’[API Gemini](https://ai.google.dev/gemini-api/docs/pricing), et sont indiqués pour un million de tokens.

![Page de tarification de l’API Claude affichant les prix par million de tokens d’entrée, de sortie et de mise en cache des prompts pour Claude Fable 5.1, Opus 5.5, Sonnet 5.5 et Haiku 4.5](https://crevio.co/vite/assets/claude-api-pricing-fbkhhf9h.png)

| Modèle | Entrée | Écriture dans le cache | Entrée mise en cache | Sortie |
|---|---|---|---|---|
| Claude Opus 5.5 | 4,00 $ | 5,00 $ | 0,20 $ | 20,00 $ |
| Claude Sonnet 5.5 | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| GPT-6 Sol | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| Gemini 3.8 Flash | 0,75 $ | Stockage facturé à l’heure | 0,075 $ | 3,75 $ |
| Claude Haiku 4.5 | 1,00 $ | 1,25 $ | 0,10 $ | 5,00 $ |

Trois informations présentes sur ces pages modifient davantage le calcul que les tarifs affichés en tête de page.

**Les tokens mis en cache coûtent au moins dix fois moins cher que les tokens d’entrée nouveaux.** Anthropic facture la lecture du cache 0,1 fois le prix de base de l’entrée, et 0,05 fois pour Opus 5.5. L’écriture dans le cache coûte 1,25 fois le tarif normal pour le cache de cinq minutes : la mise en cache devient donc rentable dès la première réutilisation. Les modèles GPT-6 d’OpenAI suivent le même principe.

**Les tokens de raisonnement sont des tokens de sortie.** Le [guide du raisonnement d’OpenAI](https://developers.openai.com/api/docs/guides/reasoning) précise que les tokens de raisonnement « sont facturés comme des tokens de sortie », même si vous ne les voyez jamais. Google qualifie de son côté son tarif de sortie de tarif « incluant les tokens de réflexion ». Si un modèle réfléchit pendant 700 tokens avant de produire une réponse de 300 tokens, vous payez 1 000 tokens.

**Les outils ajoutent des tokens avant même d’effectuer la moindre action.** Anthropic indique que le prompt système d’utilisation des outils représente 286 tokens sur Opus 5.5, avant même vos propres définitions d’outils. Son ensemble d’outils de navigation ajoute environ 6 600 tokens d’entrée à chaque requête qui le déclare.

![Page de tarification de l’API OpenAI affichant les tarifs standards par million de tokens pour GPT-6 Astra, Sol et Luna, notamment les prix de l’entrée mise en cache et de l’écriture dans le cache](https://crevio.co/vite/assets/openai-api-pricing-di89bf36.png)

## Exemple détaillé : un agent, 300 exécutions par mois

Pour obtenir un chiffre réel, il faut partir d’une tâche réelle. Prenons un cas courant dans une petite entreprise : un agent qui traite une demande client de bout en bout. Il lit le message, consulte la commande, vérifie la politique applicable, effectue une ou deux recherches web si nécessaire, rédige une réponse et consigne ses actions.

**Hypothèses :**

- **12 appels au modèle par exécution.** C’est ce qu’exige environ une tâche comportant cinq appels d’outils, auxquels s’ajoutent une ou deux étapes de finalisation
- **12 000 tokens de contexte fixe** par appel : instructions, contexte métier et définitions des outils
- **1 800 tokens ajoutés par étape :** 1 500 tokens de résultats d’outils et 300 tokens de sortie visible du modèle
- **1 000 tokens de sortie par étape,** dont 700 tokens de raisonnement
- **2 recherches web, 3 minutes de sandbox et 1 minute de vérification humaine** par exécution
- **300 exécutions par mois,** soit environ 10 par jour

### Calcul des tokens par exécution

Le premier appel envoie 12 000 tokens. Le douzième envoie le contexte fixe plus onze étapes d’historique : 12 000 + 11 × 1 800 = 31 800 tokens. Au total, les douze appels envoient **262 800 tokens d’entrée** pour produire **12 000 tokens de sortie**. Le modèle relit son propre historique bien plus souvent qu’il n’écrit.

Avec les tarifs intermédiaires et sans mise en cache :

- Entrée : 262 800 × 2,00 $ par million = 0,53 $
- Sortie : 12 000 × 10,00 $ par million = 0,12 $
- **Total : 0,65 $ par exécution**

Avec la mise en cache, chaque appel lit depuis le cache tout ce qui a déjà été envoyé et n’écrit que les nouveaux éléments. Sur l’ensemble de l’exécution, cela représente 231 000 tokens lus dans le cache et 31 800 tokens nouvellement écrits :

- Écritures dans le cache : 31 800 × 2,50 $ par million = 0,08 $
- Lectures dans le cache : 231 000 × 0,20 $ par million = 0,05 $
- Sortie : 12 000 × 10,00 $ par million = 0,12 $
- **Total : 0,25 $ par exécution, soit 62 % de moins**

Observez l’évolution de la répartition. Avant la mise en cache, l’entrée représentait 81 % de la facture. Après la mise en cache, la sortie en représente presque la moitié, et les 8 400 tokens de raisonnement coûtent à eux seuls 0,08 $, soit environ un tiers de l’exécution.

### Choix du modèle ou mise en cache ?

Appliquez le même calcul à l’ensemble du tableau tarifaire : le classement obtenu n’est pas celui auquel la plupart des utilisateurs s’attendent.

![Graphique en barres du coût mensuel des tokens de modèle pour 300 exécutions d’agent : 387 $ avec un modèle haut de gamme sans cache, 194 $ avec un modèle intermédiaire sans cache, 134 $ avec un modèle haut de gamme mis en cache, 74 $ avec un modèle intermédiaire mis en cache et 37 $ avec un petit modèle mis en cache](https://crevio.co/vite/assets/model-and-caching-monthly-cost-bdzdq4na.svg)

Un modèle haut de gamme avec mise en cache (134 $) coûte moins cher qu’un modèle intermédiaire sans mise en cache (194 $). Avant de choisir un modèle moins performant pour réduire les coûts, vérifiez si la mise en cache est activée. La mise en cache des prompts est automatique chez certains fournisseurs et nécessite un paramètre chez d’autres. Une seule valeur variable placée près du début du prompt, comme un horodatage, peut discrètement la désactiver à chaque appel.

### La facture mensuelle complète

Ajoutons maintenant les postes qui ne concernent pas les tokens. La recherche web coûte [10 $ pour 1 000 recherches sur l’API Claude](https://platform.claude.com/docs/en/about-claude/pricing) et [sur OpenAI](https://developers.openai.com/api/docs/pricing). Le temps en sandbox est facturé 0,08 $ par heure d’exécution selon le [tarif publié des sessions d’agent d’Anthropic](https://platform.claude.com/docs/en/about-claude/pricing). Les intégrations reposent ici sur l’offre [Professional de Zapier](https://zapier.com/pricing), à 19,99 $ par mois avec facturation annuelle. Le temps de vérification humaine est valorisé à 33,54 $ de l’heure, soit le [salaire horaire moyen aux États-Unis en mai 2025](https://www.bls.gov/news.release/ocwage.nr0.htm) : 69 770 $ par an pour l’ensemble des professions, divisés par 2 080 heures de travail.

| Poste | Calcul | Mensuel |
|---|---|---|
| Tokens du modèle | 300 exécutions × 0,2457 $ | 73,71 $ |
| Boucles et nouvelles tentatives | 5 % des exécutions (15) vont jusqu’à 30 étapes, soit 0,43 $ supplémentaire chacune | 6,46 $ |
| Recherches web | 600 × 0,01 $ | 6,00 $ |
| Temps en sandbox | 15 heures × 0,08 $ | 1,20 $ |
| Offre d’intégration | Un abonnement d’automatisation | 19,99 $ |
| **Total machine** | | **107,36 $** |
| Vérification humaine | 5 heures × 33,54 $ | 167,70 $ |
| **Total général** | | **275,06 $** |

![Graphique en barres du coût mensuel de 275 $ d’un agent IA : 167,70 $ de temps de vérification, 73,71 $ de tokens de modèle, 19,99 $ d’offre d’intégration, 6,46 $ de boucles, 6,00 $ de recherches web et 1,20 $ de temps en sandbox](https://crevio.co/vite/assets/where-the-money-goes-jjla4krw.svg)

Cela représente 0,92 $ par tâche terminée. Le montant est intéressant ou non selon la valeur qu’avait la tâche auparavant. Si une personne consacrait six minutes à chaque demande, les mêmes 300 tâches auraient pris 30 heures, soit environ 1 006 $ au même taux horaire.

## Comment évoluent les coûts d’exploitation d’un agent IA

Les coûts n’augmentent pas tous de la même manière, et cette différence devient importante lorsque vous prévoyez une hausse du volume.

**Le nombre d’exécutions évolue de manière linéaire.** Deux fois plus d’exécutions signifie deux fois plus de tokens facturés. Les petites entreprises bénéficient de peu de remises sur le volume, même si le [traitement par lots](https://platform.claude.com/docs/en/about-claude/pricing) réduit de 50 % le prix des tokens pour les tâches qui peuvent attendre.

**Le nombre d’étapes augmente plus vite que linéairement.** Chaque étape supplémentaire renvoie tout ce qui précède : le coût augmente donc approximativement avec le carré de la longueur de l’exécution. Dans notre exemple, une exécution qui s’égare jusqu’à 30 étapes est 2,5 fois plus longue, mais coûte 0,68 $ au lieu de 0,25 $ avec la mise en cache, soit 2,75 fois plus. Sans mise en cache, elle coûte 2,59 $ au lieu de 0,65 $, soit quatre fois plus. Les longues exécutions sont celles qui font exploser les budgets, et la mise en cache permet également d’atténuer cette progression.

**Le coût des résultats d’outils dépend de la quantité de contenu que vous laissez passer.** Selon les chiffres d’Anthropic, une page web récupérée représente environ 2 500 tokens et un PDF de recherche environ 125 000. Un agent qui lit des documents entiers au lieu de la section pertinente paie ce texte à chaque étape restante de l’exécution.

**Le coût de la vérification dépend de votre niveau de confiance, pas du volume.** Contrôler chaque exécution fait de la vérification le principal poste pour toujours. Vérifier une exécution sur dix, une fois que l’agent a fait ses preuves, fait passer le total général de 275,06 $ à 124,13 $ par mois. C’est la plus grande économie réalisable en une seule action, et elle n’a rien à voir avec les modèles.

## Comment estimer les coûts de votre propre agent

Vous n’avez pas besoin d’un tableur. Il vous faut cinq chiffres, dont le quatrième est souvent oublié.

1. **Nombre d’exécutions par mois.** Comptez la fréquence réelle de la tâche aujourd’hui, pas celle que vous aimeriez atteindre
2. **Nombre d’étapes par exécution.** Comptez environ deux appels au modèle par appel d’outil, plus un appel de finalisation
3. **Nombre de tokens par étape.** Additionnez le contexte fixe et la taille d’un résultat d’outil type. La plupart des fournisseurs affichent l’utilisation par requête : exécutez la tâche dix fois et relevez le chiffre réel
4. **Minutes de vérification par exécution.** Chronométrez-vous pendant la vérification de cinq résultats. Ce chiffre influence davantage le total que le modèle
5. **Taux d’échec.** Part des exécutions qui bouclent, recommencent ou doivent être refaites, en tenant compte de leur longueur supérieure

Calculez ensuite : **coût mensuel ≈ exécutions × (tokens par exécution × prix moyen + appels d’outils payants) + exécutions × minutes de vérification × taux horaire.** Utilisez le tarif des tokens mis en cache pour le contexte réutilisé et le tarif complet pour tout ce qui est nouveau : vous devriez généralement obtenir un montant proche de la facture réelle.

## Comment plafonner les coûts d’un agent IA

Les estimations dérivent. Les plafonds, eux, tiennent. Voici les contrôles qui fonctionnent réellement :

- **Définissez une limite de dépenses sur le compte du fournisseur.** La plupart des consoles proposent une limite mensuelle, une alerte budgétaire, ou les deux. Définissez-la avant la première exécution programmée, pas après la première facture surprenante
- **Limitez le nombre d’étapes par exécution.** Un maximum de 20 ou 25 étapes transforme une boucle sans fin en exécution en échec que vous pouvez analyser, au lieu de créer une facture illimitée
- **Limitez l’effort de raisonnement et la longueur des sorties.** La plupart des modèles de raisonnement proposent un paramètre d’effort ou de budget. Réservez-le aux tâches complexes, pas aux recherches courantes
- **Gardez le début du prompt stable.** Tout élément qui change à chaque appel et qui est placé tôt dans le prompt désactive la mise en cache pour tout ce qui suit
- **Réduisez les résultats des outils avant de les transmettre au modèle.** Renvoyez les trois champs dont l’agent a besoin, pas l’enregistrement complet ni la page entière
- **Orientez les tâches selon leur difficulté.** Utilisez un petit modèle pour le tri et les recherches, et un modèle plus puissant pour l’étape qui exige du discernement
- **Passez d’une vérification complète à un échantillonnage** lorsque l’agent a démontré sa fiabilité sur la tâche concernée, tout en conservant une vérification complète pour les actions qui impliquent l’envoi d’argent ou de messages aux clients. C’est la même règle consistant à privilégier la rédaction avant l’envoi que nous recommandons pour [choisir les premières tâches à confier à un agent](/fr/blog/ai-agents-for-small-business)

## Ce que personne ne vous dit

- **Un même texte peut coûter plus cher sur un modèle plus récent.** [Anthropic précise](https://platform.claude.com/docs/en/about-claude/pricing) que son tokenizer plus récent « produit environ 30 % de tokens supplémentaires pour un même texte ». Comparez l’utilisation réelle, pas seulement le prix par token
- **Les tarifs promotionnels prennent fin.** [Gemini 3.8 Flash](https://ai.google.dev/gemini-api/docs/pricing) coûte 0,75 $ par million de tokens d’entrée jusqu’au 31 décembre 2026, puis 1,50 $ à partir du 1er janvier 2027. Établissez votre budget sur le prix que vous paierez l’année prochaine
- **Les tarifs des tokens mis en cache varient selon le modèle chez un même fournisseur.** Opus 5.5 lit le cache à 5 % du tarif d’entrée de base, tandis que la plupart des modèles le lisent à 10 %. La configuration la moins chère ne correspond donc pas toujours au modèle le moins cher
- **Les échecs sont également facturés.** Une exécution qui échoue à l’étape 9 a déjà payé les huit premières étapes. Recommencer depuis le début les facture une nouvelle fois, et basculer vers un [modèle de secours](/fr/blog/ai-agent-backup-models) en cours d’exécution repart avec un cache vide
- **Les mois calmes sont économiques, mais le mois chargé ne l’est pas.** Le coût d’un agent suit le volume de votre activité, précisément lorsque vous appréciez le moins une facture variable. Fixez le plafond en fonction de votre meilleur mois, pas de votre moyenne

## La place de Crevio

![Page de tarification de Crevio affichant l’offre Starter gratuite, l’offre Pro à 20 $ par mois avec 1 000 crédits et l’offre Business à 50 $ par mois avec 2 500 crédits](https://crevio.co/vite/assets/crevio-pricing-pe4bsahk.png)

Tout ce qui précède suppose que vous exécutez vous-même l’agent et payez séparément chaque fournisseur. [Crevio](https://crevio.co/) adopte une autre approche : il s’agit d’un [AI business builder](/fr/blog/ai-business-builder), et tout le travail d’IA qu’il réalise pour vous — créer votre site web et rédiger vos pages produit, générer des images, envoyer des e-mails marketing et effectuer des recherches web — est décompté d’un même solde de crédits. Les tâches complexes utilisent davantage de crédits que les petites, et la plateforme suit les tokens, la mise en cache et les appels d’outils en arrière-plan pour vous éviter de le faire.

L’offre Pro coûte 20 $ par mois pour 1 000 crédits et l’offre Business 50 $ pour 2 500 crédits. Toutes deux vous permettent de choisir une allocation mensuelle supérieure à mesure que votre activité se développe. L’offre Starter est gratuite et comprend une petite allocation pour tester la plateforme. Les crédits mensuels sont réinitialisés à chaque cycle de facturation, tandis que les crédits bonus obtenus lors de l’inscription ou par parrainage n’expirent pas. Avec une offre payante, vous pouvez acheter des crédits supplémentaires à tout moment ou activer le réapprovisionnement automatique. Si vos crédits sont épuisés, votre site et votre tunnel de paiement continuent de fonctionner : seules les nouvelles tâches d’IA sont suspendues.

Soyons transparents sur le compromis : un solde de crédits vous donne un chiffre prévisible, mais masque le détail du coût par token expliqué dans cet article. Si vous souhaitez contrôler vous-même le choix du modèle et les paramètres de mise en cache, exécuter votre propre stack d’agents vous en donne la possibilité. Aucun modèle tarifaire ne supprime toutefois le poste de vérification. Cette minute par exécution reste à votre charge jusqu’à ce que vous décidiez que l’agent mérite moins de supervision. Des frais de transaction s’appliquent également à toutes les offres : 5 % avec Starter, 2,5 % avec Pro et 1 % avec Business.

## FAQ sur les coûts d’exploitation d’un agent IA

### Combien coûte l’exécution d’un agent IA par mois ?

Pour un agent métier qui traite environ 300 tâches par mois, prévoyez environ 40 à 400 $ de tokens de modèle selon le modèle choisi et l’activation ou non de la mise en cache des prompts, auxquels s’ajoutent quelques dollars pour les outils et le calcul. Notre exemple détaillé aboutit à 107,36 $ de coûts machine et à 275,06 $ en incluant une minute de vérification humaine par tâche.

### Quel est le principal coût caché d’un agent IA ?

Le temps de vérification humaine. Dans notre exemple, vérifier chaque résultat pendant une minute au salaire horaire moyen américain coûte plus de deux fois la facture totale des tokens. Le deuxième coût est le contexte renvoyé à chaque étape : chaque étape d’une exécution facture à nouveau tout ce que l’agent a déjà lu, ce qui explique pourquoi les longues exécutions coûtent disproportionnellement plus cher.

### Les tokens de raisonnement coûtent-ils plus cher ?

Ils sont facturés comme des tokens de sortie au tarif de sortie du modèle, même si vous ne les voyez jamais. OpenAI et Google l’indiquent tous deux dans leur documentation et leurs pages de tarification. Dans notre exemple, le raisonnement représente environ un tiers du coût de chaque exécution mise en cache.

### Quelle économie la mise en cache des prompts permet-elle de réaliser sur les coûts d’un agent ?

Dans notre exemple, elle réduit la facture de tokens de 62 %, de 0,65 $ à 0,25 $ par exécution, car un agent renvoie les mêmes instructions et le même historique à chaque étape. Sur la plupart des modèles, les lectures dans le cache coûtent un dixième du prix des entrées nouvelles. La mise en cache ne fonctionne que si le début du prompt reste identique entre les appels.

### Un abonnement coûte-t-il moins cher qu’une facturation à l’usage pour un agent ?

Cela dépend de votre volume et de sa prévisibilité. Les offres forfaitaires limitent le risque de dépassement, mais peuvent coûter plus cher lorsque l’utilisation est faible, tandis que la tarification API à l’usage suit précisément la consommation. Pour les offres ChatGPT et Claude, nous avons calculé le [seuil de rentabilité entre un abonnement et l’API](/fr/blog/chatgpt-subscription-vs-api-for-agents) : environ 80 exécutions par mois pour une offre à 20 $. Nous avons comparé l’aspect plateforme dans notre [analyse des alternatives à Squad](/fr/blog/squad-so-alternatives), qui oppose la tarification à l’usage et la tarification forfaitaire.

Les tokens sont le coût que vous pouvez lire sur une facture. Votre attention est le coût que vous devez calculer vous-même, et c’est généralement le plus élevé.

## Articles associés

- [Agents IA pour les petites entreprises : quelles tâches leur confier en premier ?](/fr/blog/ai-agents-for-small-business)
- [Employé IA ou agent IA : la différence qui compte vraiment](/fr/blog/ai-employee-vs-ai-agent)
- [AI Business Builder ou recrutement d’une équipe : la comparaison honnête de 2026](/fr/blog/ai-business-builder-vs-hiring-a-team)
