# Laufende Kosten von KI-Agenten: Was ein Agent pro Monat wirklich kostet

> Laufende Kosten von KI-Agenten, berechnet mit den Tokenpreisen vom September 2026. Erfahren Sie, wohin das Geld fließt, wie die Kosten skalieren und wie Sie Ihre Rechnung schätzen und begrenzen.

Last updated: 2026-09-28T12:00:00

Canonical URL: https://crevio.co/de/blog/ai-agent-running-costs

*Zuletzt aktualisiert: September 2026. Alle Preise sind öffentliche Listenpreise, die am 28. September 2026 überprüft wurden.*

**Die Modellrechnung ist bei den laufenden Kosten eines KI-Agenten selten der größte Posten. Ihre Prüfzeit ist es.** Im folgenden Rechenbeispiel kostet ein Business-Agent, der 300 Aufgaben pro Monat erledigt, 73,71 $ für Modell-Token und 167,70 $ für Ihre Arbeitszeit – bei einer Prüfminute pro Aufgabe.

Das macht Token nicht irrelevant. Derselbe Agent kann je nach zwei Einstellungen, die sich die meisten Menschen nie ansehen, 37 oder 387 $ pro Monat an Tokenkosten verursachen. Dieser Leitfaden richtet sich an Unternehmer und Betreiber, die vor der Aktivierung eines Agenten eine konkrete Zahl brauchen – keine Spanne von 15 bis 15.000 $.

- **Ein Agentenlauf besteht aus vielen Modellaufrufen, nicht aus einem.** Bei jedem Schritt wird die gesamte Unterhaltung erneut gesendet. Dadurch dominieren die Eingabe-Token und wachsen schneller als die Zahl der Schritte
- **Prompt Caching senkte die Tokenrechnung** in unserem Beispiel um 62 % – stärker als der Wechsel zu einer günstigeren Modellklasse
- **Reasoning-Token werden als Ausgabe abgerechnet** und machten nach dem Caching ein Drittel der Kosten pro Lauf aus
- **Tool-Aufrufe und Sandbox-Zeit fallen** bei typischen Volumen kaum ins Gewicht: hier zusammen 7,20 $ pro Monat
- **Die manuelle Prüfung ist der größte Posten**, solange Sie jeden Lauf kontrollieren statt nur eine Stichprobe

## Was zu den laufenden Kosten eines KI-Agenten tatsächlich gehört

Ein KI-Agent ist ein Modell, das in einer Schleife arbeitet: Es liest die Aufgabe, ruft ein Tool auf, liest das Ergebnis, entscheidet über den nächsten Schritt und wiederholt den Vorgang, bis die Aufgabe erledigt ist. Jede Schleife ist ein eigener kostenpflichtiger Modellaufruf. Das ist der erste wesentliche Unterschied zwischen Agentenkosten und Chatkosten.

Das [Engineering-Team von Anthropic berichtete](https://www.anthropic.com/engineering/multi-agent-research-system), dass „Agenten typischerweise etwa viermal mehr Token als Chat-Interaktionen verwenden und Multi-Agenten-Systeme etwa 15-mal mehr Token als Chats“. In derselben Veröffentlichung zeigte sich, dass der Tokenverbrauch allein 80 % der Leistungsunterschiede in den Forschungsbewertungen erklärte; Tool-Aufrufe und die Modellwahl waren die beiden anderen Faktoren. Token auszugeben ist der Weg zu besseren Antworten – genau deshalb muss man die Rechnung im Blick behalten.

Hier ist die vollständige Übersicht Ihrer Kosten:

| Kostenebene | Kostentreiber | Typische Größenordnung |
|---|---|---|
| **Eingabe-Token** | Anweisungen, Tool-Definitionen, Verlauf und Tool-Ergebnisse, die bei jedem Schritt erneut gesendet werden | Größter Tokenposten |
| **Ausgabe-Token** | Sichtbare Antworten plus verborgenes Reasoning | Geringeres Volumen, 5-mal höherer Stückpreis |
| **Tool-Aufrufe** | Kostenpflichtige Tools wie Websuche, pro Aufruf | Cent pro Lauf |
| **Sandbox- oder Rechenzeit** | Arbeitsumgebung, in der der Agent Code oder einen Browser ausführt | Cent pro Stunde |
| **Integrationen** | Apps und Automatisierungspläne, mit denen der Agent verbunden ist | Oft ein ohnehin bezahltes Abo |
| **Wiederholungen und Schleifen** | Läufe, die fehlschlagen, wiederholt werden oder sich verlaufen | Kann den Durchschnitt deutlich übersteigen |
| **Manuelle Prüfung** | Ihre Zeit für die Kontrolle der Agentenergebnisse | Meist der größte Posten |

## Tokenpreise im September 2026

Alle großen Anbieter berechnen frische Eingaben, gecachte Eingaben und Ausgaben inzwischen getrennt. Die meisten verlangen zusätzlich einen Preis für das Schreiben in den Cache. Die folgenden Zahlen stammen direkt von der [Claude-API-Preisseite](https://platform.claude.com/docs/en/about-claude/pricing), der [OpenAI-API-Preisseite](https://developers.openai.com/api/docs/pricing) und der [Gemini-API-Preisseite](https://ai.google.dev/gemini-api/docs/pricing) – jeweils pro einer Million Token.

![Claude-API-Preisseite mit Preisen pro einer Million Eingabe- und Ausgabe-Token sowie für Prompt Caching bei Claude Fable 5.1, Opus 5.5, Sonnet 5.5 und Haiku 4.5](https://crevio.co/vite/assets/claude-api-pricing-fbkhhf9h.png)

| Modell | Eingabe | Cache-Schreibvorgang | Gecachte Eingabe | Ausgabe |
|---|---|---|---|---|
| Claude Opus 5.5 | 4,00 $ | 5,00 $ | 0,20 $ | 20,00 $ |
| Claude Sonnet 5.5 | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| GPT-6 Sol | 2,00 $ | 2,50 $ | 0,20 $ | 10,00 $ |
| Gemini 3.8 Flash | 0,75 $ | Speicher wird stündlich abgerechnet | 0,075 $ | 3,75 $ |
| Claude Haiku 4.5 | 1,00 $ | 1,25 $ | 0,10 $ | 5,00 $ |

Drei Details auf diesen Seiten verändern die Rechnung stärker als die offensichtlichen Listenpreise.

**Gecachte Eingaben kosten ein Zehntel des Preises frischer Eingaben oder weniger.** Anthropic berechnet für das Lesen aus dem Cache das 0,1-Fache des Basiseingabepreises, bei Opus 5.5 sogar das 0,05-Fache. Das Schreiben in den Cache kostet beim Fünf-Minuten-Cache das 1,25-Fache – Caching rechnet sich also bereits nach einer einzigen Wiederverwendung. Auch die GPT-6-Modelle von OpenAI folgen diesem Muster.

**Reasoning-Token sind Ausgabe-Token.** Im [Reasoning-Leitfaden von OpenAI](https://developers.openai.com/api/docs/guides/reasoning) heißt es, Reasoning-Token „werden als Ausgabe-Token abgerechnet“, obwohl Sie sie nie sehen. Google bezeichnet seinen Ausgabepreis als „einschließlich Thinking-Token“. Wenn ein Modell vor einer Antwort mit 300 Token 700 Token lang nachdenkt, werden Ihnen 1.000 Token berechnet.

**Tools fügen Token hinzu, bevor sie überhaupt etwas tun.** Anthropic weist für Opus 5.5 eine Systemaufforderung für die Tool-Nutzung mit 286 Token aus – noch vor Ihren eigenen Tool-Definitionen. Das Browser-Toolset fügt jeder Anfrage, in der es angegeben wird, etwa 6.600 Eingabe-Token hinzu.

![OpenAI-API-Preisseite mit Standardpreisen pro einer Million Token für GPT-6 Astra, Sol und Luna, einschließlich Preisen für gecachte Eingaben und Cache-Schreibvorgänge](https://crevio.co/vite/assets/openai-api-pricing-di89bf36.png)

## Ein Rechenbeispiel: Ein Agent, 300 Läufe pro Monat

Für eine realistische Zahl brauchen Sie eine realistische Aufgabe. Nehmen wir einen typischen Anwendungsfall für kleine Unternehmen: Ein Agent bearbeitet eine Kundenanfrage von Anfang bis Ende. Er liest die Nachricht, ruft die Bestellung auf, prüft die Richtlinie, durchsucht bei Bedarf ein- oder zweimal das Web, formuliert eine Antwort und protokolliert seine Arbeit.

**Die Annahmen:**

- **12 Modellaufrufe pro Lauf.** Das entspricht ungefähr einer Aufgabe mit fünf Tool-Aufrufen plus ein oder zwei abschließenden Schritten
- **12.000 Token fester Kontext** pro Aufruf: Anweisungen, Geschäftskontext und Tool-Definitionen
- **1.800 zusätzliche Token pro Schritt:** 1.500 für Tool-Ergebnisse und 300 für sichtbare Modellausgaben
- **1.000 Ausgabe-Token pro Schritt,** davon 700 Reasoning-Token
- **2 Websuchen, 3 Minuten Sandbox-Zeit und 1 Minute Ihrer Prüfzeit** pro Lauf
- **300 Läufe pro Monat,** also ungefähr 10 pro Tag

### Die Tokenrechnung pro Lauf

Der erste Aufruf sendet 12.000 Token. Der zwölfte Aufruf sendet den festen Kontext plus elf Schritte Verlauf: 12.000 + 11 × 1.800 = 31.800 Token. Über alle zwölf Aufrufe hinweg sendet ein Lauf also **262.800 Eingabe-Token**, um **12.000 Ausgabe-Token** zu erzeugen. Das Modell liest seinen eigenen Verlauf deutlich häufiger erneut ein, als es schreibt.

Bei Preisen der mittleren Modellklasse und ohne Caching:

- Eingabe: 262.800 × 2,00 $ pro Million = 0,53 $
- Ausgabe: 12.000 × 10,00 $ pro Million = 0,12 $
- **Gesamt: 0,65 $ pro Lauf**

Mit Caching liest jeder Aufruf alles, was bereits gesendet wurde, aus dem Cache und schreibt nur die neuen Inhalte. Über den gesamten Lauf sind das 231.000 gecachte Token und 31.800 neu geschriebene Token:

- Cache-Schreibvorgänge: 31.800 × 2,50 $ pro Million = 0,08 $
- Cache-Lesevorgänge: 231.000 × 0,20 $ pro Million = 0,05 $
- Ausgabe: 12.000 × 10,00 $ pro Million = 0,12 $
- **Gesamt: 0,25 $ pro Lauf, 62 % weniger**

Beachten Sie, was sich bei der Zusammensetzung verändert hat: Vor dem Caching entfielen 81 % der Rechnung auf Eingaben. Danach macht die Ausgabe fast die Hälfte aus. Allein die 8.400 Reasoning-Token kosten 0,08 $ – etwa ein Drittel des Laufs.

### Modellwahl im Vergleich zu Caching

Wenn Sie dieselbe Rechnung auf die Preistabelle anwenden, ergibt sich eine Rangfolge, die die meisten Menschen nicht erwarten.

![Balkendiagramm zu den monatlichen Tokenkosten für 300 Agentenläufe: 387 $ Frontier-Modell ohne Caching, 194 $ mittlere Modellklasse ohne Caching, 134 $ Frontier-Modell mit Caching, 74 $ mittlere Modellklasse mit Caching und 37 $ kleines Modell mit Caching](https://crevio.co/vite/assets/model-and-caching-monthly-cost-bdzdq4na.svg)

Ein Frontier-Modell mit Caching (134 $) kostet weniger als ein Modell der mittleren Klasse ohne Caching (194 $). Bevor Sie zur Kostensenkung das Modell herabstufen, prüfen Sie, ob Caching aktiviert ist. Bei manchen Anbietern ist Prompt Caching automatisch aktiv, bei anderen müssen Sie es per Flag einschalten. Ein einziger veränderlicher Wert weit oben im Prompt – etwa ein Zeitstempel – kann den Cache bei jedem Aufruf unbemerkt ungültig machen.

### Die vollständige Monatsrechnung

Jetzt kommen die Kosten hinzu, die nicht auf Token entfallen. Die Websuche kostet [10 $ pro 1.000 Suchanfragen in der Claude API](https://platform.claude.com/docs/en/about-claude/pricing) und [bei OpenAI](https://developers.openai.com/api/docs/pricing). Für Sandbox-Zeit gilt der [veröffentlichte Preis für Agentensitzungen von Anthropic](https://platform.claude.com/docs/en/about-claude/pricing) von 0,08 $ pro laufender Stunde. Für die Integrationslogik setzen wir [Zapiers Professional-Tarif](https://zapier.com/pricing) mit 19,99 $ pro Monat bei jährlicher Abrechnung an. Für die Prüfzeit verwenden wir 33,54 $ pro Stunde – den [US-Durchschnittslohn von 69.770 $ im Mai 2025](https://www.bls.gov/news.release/ocwage.nr0.htm) über alle Berufe, geteilt durch 2.080 Arbeitsstunden.

| Kostenposten | Berechnung | Monatlich |
|---|---|---|
| Modell-Token | 300 Läufe × 0,2457 $ | 73,71 $ |
| Schleifen und Wiederholungen | 5 % der Läufe (15) kommen auf 30 Schritte, je 0,43 $ zusätzlich | 6,46 $ |
| Websuchen | 600 × 0,01 $ | 6,00 $ |
| Sandbox-Zeit | 15 Stunden × 0,08 $ | 1,20 $ |
| Integrationsplan | Ein Automatisierungsabo | 19,99 $ |
| **Maschinenkosten gesamt** | | **107,36 $** |
| Manuelle Prüfung | 5 Stunden × 33,54 $ | 167,70 $ |
| **Gesamtkosten** | | **275,06 $** |

![Balkendiagramm zu den monatlichen Kosten von 275 $ für einen KI-Agenten: 167,70 $ Prüfzeit, 73,71 $ Modell-Token, 19,99 $ Integrationsplan, 6,46 $ Schleifen, 6,00 $ Websuchen und 1,20 $ Sandbox-Zeit](https://crevio.co/vite/assets/where-the-money-goes-jjla4krw.svg)

Das entspricht 0,92 $ pro erledigter Aufgabe. Ob das günstig ist, hängt vollständig davon ab, welchen Wert die Aufgabe vorher hatte. Wenn eine Person sechs Minuten pro Anfrage benötigte, dauerten dieselben 300 Aufgaben 30 Stunden – bei demselben Lohn also etwa 1.006 $.

## So skalieren die laufenden Kosten eines KI-Agenten

Nicht alle Kosten wachsen gleich, und der Unterschied ist wichtig, wenn Sie ein höheres Volumen planen.

**Die Zahl der Läufe skaliert linear.** Doppelt so viele Läufe bedeuten doppelte Tokenkosten. Im Maßstab kleiner Unternehmen gibt es kaum Mengenrabatte, auch wenn [Batch-Verarbeitung](https://platform.claude.com/docs/en/about-claude/pricing) die Tokenpreise bei Aufgaben, die warten können, um 50 % senkt.

**Die Zahl der Schritte skaliert schneller als linear.** Jeder zusätzliche Schritt sendet alles Vorherige erneut. Dadurch wachsen die Kosten ungefähr mit dem Quadrat der Lauflänge. In unserem Beispiel ist ein Lauf mit 30 Schritten 2,5-mal länger, kostet mit Caching aber 0,68 $ statt 0,25 $ – also 2,75-mal mehr. Ohne Caching kostet er 2,59 $ statt 0,65 $, also viermal mehr. Lange Läufe bringen Budgets aus dem Gleichgewicht; Caching mildert diese Kurve ebenfalls.

**Die Kosten für Tool-Ergebnisse skalieren mit dem Umfang der Inhalte, die Sie zulassen.** Eine abgerufene Webseite umfasst laut den Angaben von Anthropic etwa 2.500 Token, ein Forschungs-PDF etwa 125.000. Ein Agent, der ganze Dokumente statt des relevanten Abschnitts liest, bezahlt diesen Text bei jedem verbleibenden Schritt des Laufs erneut.

**Die Prüfkosten skalieren mit Ihrem Vertrauen, nicht mit dem Volumen.** Wenn Sie jeden Lauf prüfen, bleibt die Prüfung dauerhaft der größte Posten. Prüfen Sie nach einer Bewährungsphase nur jeden zehnten Lauf, sinken die Gesamtkosten von 275,06 $ auf 124,13 $ pro Monat. Das ist die größte einzelne Einsparmöglichkeit und hat nichts mit den Modellen zu tun.

## So schätzen Sie Ihre eigenen Agentenkosten

Sie brauchen keine Tabelle. Sie brauchen fünf Zahlen – und die vierte wird am häufigsten ausgelassen.

1. **Läufe pro Monat.** Zählen Sie, wie oft die Aufgabe heute tatsächlich anfällt, nicht wie oft sie Ihrer Wunschvorstellung nach anfallen sollte
2. **Schritte pro Lauf.** Grob zwei Modellaufrufe pro Tool-Aufruf plus ein abschließender Aufruf
3. **Token pro Schritt.** Fester Kontext plus die Größe eines typischen Tool-Ergebnisses. Die meisten Anbieter zeigen die Nutzung pro Anfrage. Führen Sie die Aufgabe also zehnmal aus und lesen Sie den echten Wert ab
4. **Prüfminuten pro Lauf.** Stoppen Sie die Zeit, während Sie fünf Ergebnisse kontrollieren. Diese Zahl beeinflusst die Gesamtkosten stärker als das Modell
5. **Ihre Fehlerquote.** Der Anteil der Läufe, die sich wiederholen, in einer Schleife landen oder erneut ausgeführt werden müssen – berechnet anhand ihrer längeren Laufzeit

Dann gilt: **Monatliche Kosten ≈ Läufe × (Token pro Lauf × Mischpreis + kostenpflichtige Tool-Aufrufe) + Läufe × Prüfminuten × Ihr Stundensatz.** Verwenden Sie für wiederholten Kontext den gecachten Preis und für alle neuen Inhalte den vollen Preis. So landen Sie meist ziemlich nahe an der tatsächlichen Rechnung.

## So begrenzen Sie die Kosten von KI-Agenten

Schätzungen können abweichen. Limits tun das nicht. Mit diesen Kontrollen halten Sie die Kosten tatsächlich im Zaum:

- **Legen Sie ein Ausgabenlimit für das Providerkonto fest.** Die meisten Anbieter bieten im Dashboard ein Monatslimit, eine Budgetwarnung oder beides. Legen Sie das Limit vor dem ersten geplanten Lauf fest – nicht erst nach der ersten überraschenden Rechnung
- **Begrenzen Sie die Schritte pro Lauf.** Ein Maximum von 20 oder 25 Schritten macht aus einer außer Kontrolle geratenen Schleife einen fehlgeschlagenen Lauf, den Sie untersuchen können, statt eine endlose Rechnung zu erzeugen
- **Begrenzen Sie Reasoning-Aufwand und Ausgabelänge.** Die meisten Reasoning-Modelle bieten eine Einstellung für Aufwand oder Budget. Anspruchsvolle Aufgaben verdienen mehr davon, routinemäßige Abfragen nicht
- **Halten Sie den Anfang des Prompts stabil.** Alles, was sich bei jedem Aufruf ändert und weit oben steht, macht das Caching für alle folgenden Inhalte zunichte
- **Kürzen Sie Tool-Ergebnisse, bevor das Modell sie sieht.** Geben Sie die drei Felder zurück, die der Agent braucht – nicht den vollständigen Datensatz oder die ganze Seite
- **Wählen Sie das Modell nach Schwierigkeitsgrad.** Ein kleines Modell für Sortierungen und Abfragen, ein leistungsfähigeres für den Schritt, der Urteilsvermögen erfordert
- **Wechseln Sie von vollständiger Prüfung zu Stichproben**, sobald der Agent bei dieser Aufgabe zuverlässig arbeitet. Behalten Sie die vollständige Prüfung für alles bei, was Geld sendet oder Kunden Nachrichten schickt. Das ist dieselbe „Entwurf zuerst“-Regel, die wir bei der [Auswahl der ersten Aufgaben für einen Agenten](/de/blog/ai-agents-for-small-business) empfehlen

## Was Ihnen niemand sagt

- **Derselbe Text kann auf einem neueren Modell mehr kosten.** [Anthropic weist darauf hin](https://platform.claude.com/docs/en/about-claude/pricing), dass sein neuerer Tokenizer „für denselben Text etwa 30 % mehr Token erzeugt“. Vergleichen Sie den tatsächlichen Verbrauch, nicht nur den Preis pro Token
- **Aktionspreise enden.** [Gemini 3.8 Flash](https://ai.google.dev/gemini-api/docs/pricing) kostet bis zum 31. Dezember 2026 0,75 $ pro Million Eingabe-Token, ab dem 1. Januar 2027 dann 1,50 $. Planen Sie mit dem Preis, den Sie im nächsten Jahr zahlen werden
- **Gecachte Preise unterscheiden sich je nach Modell innerhalb eines Anbieters.** Opus 5.5 liest den Cache für 5 % des Basiseingabepreises, die meisten anderen Modelle für 10 %. Das günstigste Setup ist daher nicht immer das günstigste Modell
- **Auch Fehlschläge werden berechnet.** Wenn ein Lauf bei Schritt neun fehlschlägt, wurden die ersten acht Schritte bereits bezahlt. Ein Neustart von vorn kostet dafür erneut, und der Wechsel zu einem [Ersatzmodell](/de/blog/ai-agent-backup-models) mitten im Lauf beginnt mit einem leeren Cache
- **Die ruhigen Monate sind günstig, der geschäftige Monat nicht.** Die Agentenkosten folgen Ihrem Geschäftsvolumen – genau dann ist eine variable Rechnung am wenigsten willkommen. Setzen Sie das Limit für Ihren stärksten Monat, nicht für den Durchschnitt

## Welche Rolle Crevio spielt

![Crevio-Preisseite mit dem kostenlosen Starter-Tarif, Pro für 20 $ im Monat mit 1.000 Credits und Business für 50 $ im Monat mit 2.500 Credits](https://crevio.co/vite/assets/crevio-pricing-pe4bsahk.png)

Bei allen bisherigen Beispielen gehen wir davon aus, dass Sie den Agenten selbst betreiben und jeden Anbieter separat bezahlen. [Crevio](https://crevio.co/) verfolgt einen anderen Ansatz: Crevio ist ein [KI-Business-Builder](/de/blog/ai-business-builder), und alle KI-Arbeiten, die die Plattform für Sie erledigt – vom Erstellen Ihrer Website und Schreiben von Produktseiten bis zum Generieren von Bildern, Versenden von Marketing-E-Mails und Durchsuchen des Webs – werden aus einem gemeinsamen Credit-Guthaben bezahlt. Größere Aufgaben verbrauchen mehr Credits als kleinere. Die Plattform verfolgt Token, Caching und Tool-Aufrufe im Hintergrund, sodass Sie sich darum nicht kümmern müssen.

Pro kostet 20 $ pro Monat und umfasst 1.000 Credits, Business kostet 50 $ und umfasst 2.500 Credits. Bei beiden Tarifen können Sie das monatliche Kontingent mit wachsendem Unternehmen erhöhen. Starter ist kostenlos und bietet ein kleines Kontingent zum Ausprobieren. Monats-Credits werden mit jedem Abrechnungszeitraum zurückgesetzt, Bonus-Credits aus Registrierung und Empfehlungen verfallen dagegen nicht. Bei einem kostenpflichtigen Tarif können Sie jederzeit Credits nachkaufen oder automatische Aufladungen aktivieren. Wenn die Credits aufgebraucht sind, bleiben Website und Checkout aktiv – nur neue KI-Arbeiten werden pausiert.

Um den Kompromiss offen anzusprechen: Ein Credit-Guthaben liefert Ihnen eine planbare Zahl, verbirgt aber die Details zu den Kosten pro Token, die dieser Artikel erläutert. Wenn Sie Modellwahl und Caching-Einstellungen selbst kontrollieren möchten, bietet Ihnen ein eigener Agenten-Stack diese Möglichkeit. Kein Preismodell beseitigt jedoch den Posten für die Prüfung. Diese Minute pro Lauf bleibt Ihre Zeit, bis Sie entscheiden, dass der Agent weniger Aufsicht verdient. Transaktionsgebühren fallen bei jedem Tarif zusätzlich an: 5 % bei Starter, 2,5 % bei Pro und 1 % bei Business.

## FAQ zu den laufenden Kosten von KI-Agenten

### Wie viel kostet der Betrieb eines KI-Agenten pro Monat?

Für einen einzelnen Business-Agenten, der etwa 300 Aufgaben pro Monat bearbeitet, sollten Sie je nach Modell und aktiviertem Prompt Caching mit ungefähr 40 bis 400 $ für Modell-Token rechnen, zuzüglich einiger Dollar für Tools und Rechenleistung. Unser Rechenbeispiel kam auf 107,36 $ Maschinenkosten und 275,06 $ einschließlich einer manuellen Prüfminute pro Aufgabe.

### Was ist der größte versteckte Kostenfaktor eines KI-Agenten?

Die Zeit für die manuelle Prüfung. In unserem Beispiel kostete die Kontrolle jedes Ergebnisses für eine Minute bei einem US-Durchschnittslohn mehr als doppelt so viel wie die gesamte Tokenrechnung. Der zweitgrößte Faktor ist erneut gesendeter Kontext: Bei jedem Schritt eines Laufs bezahlen Sie erneut für alles, was der Agent bereits gelesen hat. Deshalb kosten lange Läufe überproportional mehr.

### Kosten Reasoning-Token extra?

Sie werden zum Ausgabepreis des Modells als Ausgabe-Token abgerechnet, obwohl Sie sie nie sehen. OpenAI und Google weisen beide in ihrer Dokumentation und auf ihren Preisseiten darauf hin. In unserem Beispiel machten Reasoning-Token etwa ein Drittel der Kosten jedes gecachten Laufs aus.

### Wie viel spart Prompt Caching bei Agentenkosten?

In unserem Beispiel senkte es die Tokenrechnung um 62 % – von 0,65 auf 0,25 $ pro Lauf –, weil ein Agent bei jedem Schritt dieselben Anweisungen und denselben Verlauf erneut sendet. Gecachte Lesevorgänge kosten bei den meisten Modellen ein Zehntel frischer Eingaben. Caching funktioniert nur, wenn der Anfang des Prompts zwischen den Aufrufen identisch bleibt.

### Ist ein Abonnement günstiger als die Tokenabrechnung für einen Agenten?

Das hängt von Ihrem Volumen und dessen Planbarkeit ab. Pauschaltarife begrenzen Ihr Kostenrisiko, können bei geringer Nutzung aber teurer sein. Eine nutzungsabhängige API-Abrechnung bildet den tatsächlichen Verbrauch exakt ab. Für ChatGPT- und Claude-Tarife haben wir den [Break-even zwischen Abonnement und API](/de/blog/chatgpt-subscription-vs-api-for-agents) berechnet: Bei einem 20-$-Tarif liegt er bei etwa 80 Läufen pro Monat. Die Plattformseite dieses Vergleichs haben wir in unserer [Analyse zu Squad-Alternativen](/de/blog/squad-so-alternatives) betrachtet, die nutzungsabhängige und pauschale Preise gegenüberstellt.

Token sind die Kosten, die Sie auf der Rechnung lesen können. Ihre Aufmerksamkeit ist der Kostenfaktor, den Sie selbst erfassen müssen – und meistens ist er größer.

## Weitere Blogbeiträge

- [KI-Agenten für kleine Unternehmen: Welche Aufgaben Sie zuerst abgeben sollten](/de/blog/ai-agents-for-small-business)
- [KI-Mitarbeiter oder KI-Agent: Der Unterschied, auf den es wirklich ankommt](/de/blog/ai-employee-vs-ai-agent)
- [KI-Business-Builder oder ein Team einstellen: Der ehrliche Vergleich für 2026](/de/blog/ai-business-builder-vs-hiring-a-team)
