# Wat kost een AI-agent per maand? De echte kosten

> De kosten van een AI-agent berekend met tokenprijzen van september 2026. Ontdek waar het geld naartoe gaat, hoe de kosten meegroeien en hoe u uw rekening inschat en begrenst.

Last updated: 2026-09-28T12:00:00

Canonical URL: https://crevio.co/nl/blog/ai-agent-running-costs

*Laatst bijgewerkt: september 2026. Alle prijzen zijn openbare catalogusprijzen, gecontroleerd op 28 september 2026.*

**De modelrekening is zelden de grootste kostenpost van een AI-agent. Uw controletijd is dat wel.** In het uitgewerkte voorbeeld hieronder kost één zakelijke agent die 300 taken per maand uitvoert $73,71 aan modeltokens en $167,70 aan uw tijd, uitgaande van één minuut controle per taak.

Dat betekent niet dat tokens onbelangrijk zijn. Dezelfde agent kan afhankelijk van twee instellingen waar de meeste mensen nooit naar kijken $37 of $387 per maand aan tokens kosten. Deze gids is bedoeld voor ondernemers en operators die een realistisch bedrag willen weten voordat ze een agent inschakelen, niet een bandbreedte van $15 tot $15.000.

- **Eén agentrun bestaat uit veel modelaanroepen, niet uit één.** Bij elke stap wordt het volledige gesprek opnieuw verstuurd. Daardoor nemen inputtokens de grootste plaats in en groeien de kosten sneller dan het aantal stappen
- **Prompt caching verlaagde de tokenrekening in ons voorbeeld met 62%**, meer dan overstappen naar een goedkopere modelklasse
- **Reasoning-tokens worden als output gefactureerd** en vormden na caching een derde van de kosten per run
- **Toolaanroepen en sandbox-tijd zijn bij gebruikelijke volumes beperkt:** hier samen $7,20 per maand
- **Menselijke controle is de grootste kostenpost** totdat u overstapt van elke run controleren naar een steekproef controleren

## Wat valt er precies onder de kosten van een AI-agent?

Een AI-agent is een model dat in een lus werkt: het leest de taak, roept een tool aan, leest het resultaat, bepaalt de volgende stap en herhaalt dit totdat de taak is afgerond. Elke lus is een afzonderlijke betaalde modelaanroep. Dat is het belangrijkste verschil tussen agentkosten en chatkosten.

[Het engineeringteam van Anthropic rapporteerde](https://www.anthropic.com/engineering/multi-agent-research-system) dat "agents doorgaans ongeveer 4× meer tokens gebruiken dan chatinteracties, en multi-agentsystemen ongeveer 15× meer tokens dan chats." Uit hetzelfde onderzoek bleek dat alleen tokengebruik 80% van de prestatieverschillen in hun evaluaties verklaarde; toolaanroepen en modelkeuze waren de andere twee factoren. Tokens zorgen ervoor dat agents betere antwoorden geven. Precies daarom moet u de rekening goed in de gaten houden.

Dit is de volledige lijst van kosten:

| Kostenlaag | Wat bepaalt de kosten? | Gebruikelijke omvang |
|---|---|---|
| **Inputtokens** | Instructies, tooldefinities, gespreksgeschiedenis en toolresultaten, bij elke stap opnieuw verstuurd | De grootste tokenpost |
| **Outputtokens** | Zichtbare antwoorden plus verborgen reasoning | Kleiner volume, 5× de prijs per eenheid |
| **Toolaanroepen** | Betaalde tools zoals websearch, per aanroep | Centen per run |
| **Sandbox- of computertijd** | Een werkruimte waarin de agent code of een browser uitvoert | Centen per uur |
| **Integraties** | De apps en automatiseringsabonnementen waarmee de agent verbinding maakt | Vaak een abonnement dat u al betaalt |
| **Retries en lussen** | Runs die mislukken, zich herhalen of afdwalen | Een staart die het gemiddelde kan overstijgen |
| **Menselijke controle** | De minuten die u nodig hebt om te controleren wat de agent heeft gedaan | Meestal de grootste kostenpost |

## Tokenprijzen in september 2026

Elke grote aanbieder rekent inmiddels afzonderlijke prijzen voor nieuwe input, gecachte input en output. De meeste rekenen ook kosten voor het schrijven naar de cache. De onderstaande bedragen komen rechtstreeks van de [prijsinformatie voor de Claude API](https://platform.claude.com/docs/en/about-claude/pricing), de [prijsinformatie voor de OpenAI API](https://developers.openai.com/api/docs/pricing) en de [prijsinformatie voor de Gemini API](https://ai.google.dev/gemini-api/docs/pricing), allemaal per miljoen tokens.

![Pagina met Claude API-prijzen voor input, output en prompt caching per miljoen tokens voor Claude Fable 5.1, Opus 5.5, Sonnet 5.5 en Haiku 4.5](https://crevio.co/vite/assets/claude-api-pricing-fbkhhf9h.png)

| Model | Input | Cache schrijven | Gecachte input | Output |
|---|---|---|---|---|
| Claude Opus 5.5 | $4,00 | $5,00 | $0,20 | $20,00 |
| Claude Sonnet 5.5 | $2,00 | $2,50 | $0,20 | $10,00 |
| GPT-6 Sol | $2,00 | $2,50 | $0,20 | $10,00 |
| Gemini 3.8 Flash | $0,75 | Opslag per uur gefactureerd | $0,075 | $3,75 |
| Claude Haiku 4.5 | $1,00 | $1,25 | $0,10 | $5,00 |

Drie details op die prijspagina's veranderen de berekening meer dan de hoofdtarieven.

**Gecachte input kost een tiende van nieuwe input of minder.** Anthropic rekent voor het lezen uit de cache 0,1× de basisprijs voor input, en 0,05× bij Opus 5.5. Het schrijven naar de cache kost 1,25× bij de cache van vijf minuten, waardoor caching zich al na één hergebruik terugverdient. De GPT-6-modellen van OpenAI volgen hetzelfde patroon.

**Reasoning-tokens zijn outputtokens.** In de [reasoning-gids van OpenAI](https://developers.openai.com/api/docs/guides/reasoning) staat dat reasoning-tokens "als outputtokens worden gefactureerd", ook al krijgt u ze nooit te zien. Google noemt zijn outputprijs "inclusief thinking-tokens". Een model dat 700 tokens nadenkt voordat het een antwoord van 300 tokens geeft, brengt 1.000 tokens in rekening.

**Tools voegen al tokens toe voordat ze iets doen.** Anthropic vermeldt voor Opus 5.5 een systeemprompt van 286 tokens voor toolgebruik, nog vóór uw eigen tooldefinities. De browsertoolset voegt ongeveer 6.600 inputtokens toe aan elk verzoek waarin u deze toolset activeert.

![Pagina met OpenAI API-prijzen met standaardtarieven per miljoen tokens voor GPT-6 Astra, Sol en Luna, inclusief prijzen voor gecachte input en cache schrijven](https://crevio.co/vite/assets/openai-api-pricing-di89bf36.png)

## Een uitgewerkt voorbeeld: één agent, 300 runs per maand

Voor een realistisch bedrag hebt u een realistische taak nodig. Neem een veelvoorkomende taak voor kleine bedrijven: een agent die een klantverzoek van begin tot eind afhandelt. De agent leest het bericht, zoekt de bestelling op, controleert het beleid, zoekt indien nodig een of twee keer op internet, stelt een antwoord op en registreert wat hij heeft gedaan.

**De aannames:**

- **12 modelaanroepen per run.** Ongeveer wat een taak met vijf toolaanroepen nodig heeft, plus één of twee stappen om af te ronden
- **12.000 tokens aan vaste context** per aanroep: instructies, bedrijfscontext en tooldefinities
- **1.800 tokens toegevoegd per stap:** 1.500 tokens aan toolresultaten en 300 tokens aan zichtbare modeloutput
- **1.000 outputtokens per stap,** waarvan 700 reasoning-tokens zijn
- **2 zoekopdrachten op internet, 3 minuten sandbox-tijd en 1 minuut controle** per run
- **300 runs per maand,** ongeveer 10 per dag

### De tokenberekening per run

Bij de eerste aanroep worden 12.000 tokens verstuurd. Bij de twaalfde aanroep bestaat de verzending uit de vaste context plus elf stappen aan geschiedenis: 12.000 + 11 × 1.800 = 31.800 tokens. Bij elkaar opgeteld verstuurt één run 262.800 **inputtokens** om 12.000 **outputtokens** te produceren. Het model leest zijn eigen geschiedenis veel vaker opnieuw dan het nieuwe tekst schrijft.

Bij tarieven uit de middencategorie, zonder caching:

- Input: 262.800 × $2,00 per miljoen = $0,53
- Output: 12.000 × $10,00 per miljoen = $0,12
- **Totaal: $0,65 per run**

Met caching leest elke aanroep alles wat al eerder is verstuurd uit de cache en schrijft hij alleen wat nieuw is. Over de hele run zijn dat 231.000 gecachte tokens en 31.800 nieuw geschreven tokens:

- Cache schrijven: 31.800 × $2,50 per miljoen = $0,08
- Cache lezen: 231.000 × $0,20 per miljoen = $0,05
- Output: 12.000 × $10,00 per miljoen = $0,12
- **Totaal: $0,25 per run, 62% minder**

Kijk wat er met de verhouding gebeurt. Voor caching vormde input 81% van de rekening. Na caching is output bijna de helft van de kosten, en de 8.400 reasoning-tokens kosten op zichzelf al $0,08: ongeveer een derde van de run.

### Modelkeuze versus caching

Voer dezelfde berekening uit voor de modellen in de prijstabel en de rangorde is niet wat de meeste mensen verwachten.

![Staafdiagram van de maandelijkse modeltokenkosten voor 300 agentruns: $387 frontier zonder caching, $194 middencategorie zonder caching, $134 frontier met caching, $74 middencategorie met caching en $37 klein model met caching](https://crevio.co/vite/assets/model-and-caching-monthly-cost-bdzdq4na.svg)

Een frontiermodel met caching ($134) kost minder dan een model uit de middencategorie zonder caching ($194). Controleer dus eerst of caching is ingeschakeld voordat u het model downgrade om geld te besparen. Prompt caching werkt bij sommige aanbieders automatisch, terwijl u dit bij andere aanbieders met een vlag moet activeren. Eén veranderende waarde bovenaan uw prompt, zoals een tijdstempel, kan caching bij elke aanroep ongemerkt verbreken.

### De volledige maandrekening

Tel nu de kostenlagen op die niets met tokens te maken hebben. Websearch kost [$10 per 1.000 zoekopdrachten bij de Claude API](https://platform.claude.com/docs/en/about-claude/pricing) en [bij OpenAI](https://developers.openai.com/api/docs/pricing). Voor sandboxtijd geldt het [gepubliceerde tarief voor agentsessies van Anthropic](https://platform.claude.com/docs/en/about-claude/pricing) van $0,08 per uur dat de sessie actief is. Voor integraties gebruiken we het [Professional-abonnement van Zapier](https://zapier.com/pricing) van $19,99 per maand bij jaarlijkse facturering. Voor controletijd gebruiken we $33,54 per uur: het [gemiddelde Amerikaanse uurloon van mei 2025](https://www.bls.gov/news.release/ocwage.nr0.htm) van $69.770 per jaar voor alle beroepen, gedeeld door 2.080 werkuren.

| Kostenpost | Berekening | Per maand |
|---|---|---|
| Modeltokens | 300 runs × $0,2457 | $73,71 |
| Lussen en retries | 5% van de runs (15) dwalen af naar 30 stappen, $0,43 extra per run | $6,46 |
| Zoekopdrachten op internet | 600 × $0,01 | $6,00 |
| Sandboxtijd | 15 uur × $0,08 | $1,20 |
| Integratieabonnement | Eén automatiseringsabonnement | $19,99 |
| **Totaal machines** | | **$107,36** |
| Menselijke controle | 5 uur × $33,54 | $167,70 |
| **Totaal** | | **$275,06** |

![Staafdiagram van de maandelijkse kosten van $275 voor één AI-agent: $167,70 controletijd, $73,71 modeltokens, $19,99 integratieabonnement, $6,46 lussen, $6,00 zoekopdrachten en $1,20 sandboxtijd](https://crevio.co/vite/assets/where-the-money-goes-jjla4krw.svg)

Dat is $0,92 per afgeronde taak. Of dat goedkoop is, hangt volledig af van de waarde van de taak. Als iemand zes minuten aan elk verzoek besteedde, kostten dezelfde 300 taken 30 uur, oftewel ongeveer $1.006 tegen hetzelfde uurloon.

## Hoe de kosten van een AI-agent meegroeien

Niet alle kosten groeien op dezelfde manier. Dat verschil is belangrijk wanneer u meer volume plant.

**Het aantal runs groeit lineair.** Verdubbel het aantal runs en u verdubbelt de tokenrekening. Bij volumes van kleine bedrijven is er weinig volumekorting, al verlaagt [batchverwerking](https://platform.claude.com/docs/en/about-claude/pricing) de tokenprijzen met 50% voor werk dat kan wachten.

**Het aantal stappen groeit sneller dan lineair.** Bij elke extra stap wordt alles wat daarvoor kwam opnieuw verstuurd. Daardoor groeien de kosten ongeveer met het kwadraat van de lengte van de run. In ons voorbeeld is een run die afdwaalt naar 30 stappen 2,5 keer zo lang, maar kost hij met caching $0,68 in plaats van $0,25: 2,75 keer zoveel. Zonder caching kost hij $2,59 in plaats van $0,65: vier keer zoveel. Lange runs zijn waar budgetten ontsporen, en caching dempt die curve ook.

**Toolresultaten groeien mee met wat u doorlaat.** Volgens de cijfers van Anthropic bevat één opgehaalde webpagina ongeveer 2.500 tokens en een research-pdf ongeveer 125.000. Een agent die hele documenten leest in plaats van de relevante sectie, betaalt op elke resterende stap van de run voor die tekst.

**Controletijd groeit mee met uw vertrouwen, niet met het volume.** Als u elke run controleert, blijft controle voor altijd de grootste kostenpost. Als u, nadat de agent zich heeft bewezen, één op de tien runs controleert, dalen de totale kosten van $275,06 naar $124,13 per maand. Dat is de grootste afzonderlijke besparing en heeft niets met modellen te maken.

## Uw eigen agentkosten inschatten

U hebt geen spreadsheet nodig. U hebt vijf cijfers nodig, en het vierde wordt vaak overgeslagen.

1. **Runs per maand.** Tel hoe vaak de taak vandaag echt voorkomt, niet hoe vaak u zou willen dat dit het geval was
2. **Stappen per run.** Reken grofweg op twee modelaanroepen per toolaanroep, plus één om af te ronden
3. **Tokens per stap.** Vaste context plus de omvang van een typisch toolresultaat. De meeste aanbieders tonen het gebruik per verzoek. Voer de taak dus tien keer uit en bekijk het werkelijke aantal
4. **Minuten controle per run.** Houd bij hoeveel tijd u nodig hebt om vijf resultaten te controleren. Dit getal heeft meer invloed op het totaal dan het model
5. **Uw foutpercentage.** Het aandeel runs dat in een lus terechtkomt, opnieuw moet worden uitgevoerd of opnieuw moet worden gedaan, berekend tegen de langere duur

Daarna geldt: **maandelijkse kosten ≈ runs × (tokens per run × blended prijs + betaalde toolaanroepen) + runs × minuten controle × uw uurloon.** Gebruik de cacheprijs voor herhaalde context en de volledige prijs voor alles wat nieuw is. Dan komt u meestal dicht bij de echte rekening uit.

## De kosten van een AI-agent begrenzen

Schattingen lopen uiteen. Limieten niet. Dit zijn de instellingen die echt helpen:

- **Stel een bestedingslimiet in voor uw provideraccount.** De meeste beheeromgevingen van providers bieden een maandlimiet, een budgetmelding of beide. Stel die in vóór de eerste geplande run, niet na de eerste onverwacht hoge factuur
- **Beperk het aantal stappen per run.** Met maximaal 20 of 25 stappen verandert een eindeloze lus in een mislukte run die u kunt onderzoeken, in plaats van een rekening zonder bovengrens
- **Beperk reasoning-inspanning en outputlengte.** De meeste reasoning-modellen bieden een instelling voor inspanning of budget. Gebruik die voor moeilijke taken; routinematige zoekopdrachten hebben dit niet nodig
- **Houd het begin van de prompt stabiel.** Alles wat bij elke aanroep verandert en vroeg in de prompt staat, verbreekt caching voor alles wat erop volgt
- **Beperk toolresultaten voordat het model ze ziet.** Stuur de drie velden terug die de agent nodig heeft, niet het volledige record of de hele pagina
- **Kies het model op basis van de moeilijkheid.** Gebruik een klein model voor sorteren en opzoekwerk en een sterker model voor de stap die beoordeling vereist
- **Stap over van volledige controle naar steekproeven** zodra de agent voor deze taak een goede staat van dienst heeft, en houd volledige controle aan voor alles wat geld overmaakt of berichten naar klanten verstuurt. Dit is dezelfde regel om eerst concepten te laten maken die we aanraden bij het [kiezen van taken om als eerste aan een agent over te dragen](/nl/blog/ai-agents-for-small-business)

## Wat niemand u vertelt

- **Dezelfde tekst kan op een nieuwer model meer kosten.** [Anthropic merkt op](https://platform.claude.com/docs/en/about-claude/pricing) dat de nieuwere tokenizer "voor dezelfde tekst ongeveer 30% meer tokens produceert". Vergelijk het werkelijke gebruik, niet alleen de prijs per token
- **Promotieprijzen lopen af.** [Gemini 3.8 Flash](https://ai.google.dev/gemini-api/docs/pricing) kost tot en met 31 december 2026 $0,75 per miljoen inputtokens en vanaf 1 januari 2027 $1,50. Maak uw begroting op basis van de prijs die u volgend jaar betaalt
- **Gecachte prijzen verschillen per model binnen één provider.** Opus 5.5 leest de cache voor 5% van de basisprijs voor input, terwijl de meeste modellen 10% rekenen. De goedkoopste configuratie gebruikt dus niet altijd het goedkoopste model
- **Mislukkingen kosten ook geld.** Als een run bij stap negen een fout geeft, hebt u al voor acht stappen betaald. Opnieuw beginnen betekent dat u die stappen nogmaals betaalt. Als u halverwege een run overstapt naar een [back-upmodel](/nl/blog/ai-agent-backup-models), begint u bovendien opnieuw met een lege cache
- **Rustige maanden zijn goedkoop, een drukke maand niet.** De kosten van een agent volgen uw bedrijfsvolume, precies wanneer een variabele rekening het minst welkom is. Stel de limiet in op uw drukste maand, niet op een gemiddelde maand

## De rol van Crevio

![Pagina met Crevio-prijzen: het gratis Starter-abonnement, Pro voor $20 per maand met 1.000 credits en Business voor $50 per maand met 2.500 credits](https://crevio.co/vite/assets/crevio-pricing-pe4bsahk.png)

Bij alles hierboven gaan we ervan uit dat u de agent zelf uitvoert en elke provider afzonderlijk betaalt. [Crevio](https://crevio.co/) kiest voor een andere aanpak: het is een [AI business builder](/nl/blog/ai-business-builder), waarbij al het AI-werk dat het platform voor u doet — van uw website bouwen en productpagina's schrijven tot afbeeldingen genereren, marketingmails versturen en op internet zoeken — uit één creditsaldo wordt betaald. Grotere taken gebruiken meer credits dan kleine, en het platform houdt de tokens, caching en toolaanroepen op de achtergrond bij, zodat u dat niet hoeft te doen.

Pro kost $20 per maand en bevat 1.000 credits. Business kost $50 per maand en bevat 2.500 credits. Bij beide abonnementen kunt u een grotere maandelijkse bundel kiezen naarmate uw bedrijf groeit. Starter is gratis en heeft een kleine bundel om het platform uit te proberen. Maandelijkse credits worden aan het begin van elke factureringsperiode opnieuw ingesteld; bonuscredits uit aanmelding en referrals verlopen niet. Met een betaald abonnement kunt u op elk moment credits bijkopen of automatische opwaarderingen inschakelen. Raken de credits op, dan blijven uw website en checkout gewoon werken. Alleen nieuw AI-werk wordt gepauzeerd.

Om eerlijk te zijn over de afweging: met een creditsaldo hebt u één voorspelbaar bedrag, maar ziet u niet de details per token die in dit artikel aan bod komen. Als u zelf controle wilt houden over modelkeuze en cachinginstellingen, biedt uw eigen agentstack die vrijheid. Geen enkel prijsmodel neemt de kosten voor controle weg. Die minuut per run blijft van u, totdat u besluit dat de agent minder toezicht verdient. Transactiekosten gelden bovendien voor elk abonnement: 5% bij Starter, 2,5% bij Pro en 1% bij Business.

## Veelgestelde vragen over de kosten van een AI-agent

### Wat kost het om een AI-agent per maand te gebruiken?

Voor één zakelijke agent die ongeveer 300 taken per maand uitvoert, kunt u rekenen op ongeveer $40 tot $400 aan modeltokens, afhankelijk van het model en of prompt caching is ingeschakeld. Tel daar enkele dollars voor tools en compute bij op. Ons uitgewerkte voorbeeld kwam uit op $107,36 aan machinekosten en $275,06 inclusief één minuut menselijke controle per taak.

### Wat zijn de grootste verborgen kosten van een AI-agent?

Menselijke controletijd. In ons voorbeeld kostte één minuut controle van elk resultaat tegen het gemiddelde Amerikaanse uurloon meer dan twee keer de volledige tokenrekening. De op één na grootste kostenpost is opnieuw verstuurde context: bij elke stap van een run betaalt u opnieuw voor alles wat de agent al heeft gelezen. Daarom zijn lange runs onevenredig duurder.

### Kosten reasoning-tokens extra?

Ze worden gefactureerd als outputtokens tegen de outputprijs van het model, ook al krijgt u ze nooit te zien. OpenAI en Google vermelden dit allebei in hun documentatie en op hun prijspagina's. In ons voorbeeld vormden reasoning-tokens ongeveer een derde van de kosten van elke gecachte run.

### Hoeveel besparen prompt caching en agentkosten?

In ons voorbeeld verlaagde caching de tokenrekening met 62%: van $0,65 naar $0,25 per run. Dat komt doordat een agent bij elke stap dezelfde instructies en geschiedenis opnieuw verstuurt. Gecachte input kost bij de meeste modellen een tiende van nieuwe input. Caching werkt alleen als het begin van de prompt tussen aanroepen identiek blijft.

### Is een abonnement goedkoper dan per token betalen voor een agent?

Dat hangt af van uw volume en hoe voorspelbaar dat is. Vaste abonnementen beperken uw maximale kosten, maar kunnen bij licht gebruik duurder uitvallen. API-prijzen op basis van verbruik volgen uw gebruik precies. Voor ChatGPT- en Claude-abonnementen hebben we specifiek het [omslagpunt tussen een abonnement en de API](/nl/blog/chatgpt-subscription-vs-api-for-agents) berekend: ongeveer 80 runs per maand bij een abonnement van $20. We hebben de platformkant hiervan vergeleken in onze [analyse van Squad-alternatieven](/nl/blog/squad-so-alternatives), waarin betalen op basis van verbruik wordt afgezet tegen vaste prijzen.

Tokens zijn de kosten die u op een factuur kunt terugvinden. Uw aandacht is de kostenpost die u zelf moet bijhouden — en meestal is die groter.

## Gerelateerde blogartikelen

- [AI-agents voor kleine bedrijven: welke taken draagt u als eerste over?](/nl/blog/ai-agents-for-small-business)
- [AI-werknemer versus AI-agent: het verschil dat er echt toe doet](/nl/blog/ai-employee-vs-ai-agent)
- [AI business builder versus een team aannemen: de eerlijke vergelijking van 2026](/nl/blog/ai-business-builder-vs-hiring-a-team)
