# KI-Agenten für Web Scraping: 9 Tools im Vergleich – Preise, Sperren und Rechtslage

> Vergleichen Sie 9 Web-Scraping-Tools für KI-Agenten – von Firecrawl bis Bright Data. Funktionen, echte Preise, gesperrte Websites und die wichtigsten rechtlichen Grenzen.

Last updated: 2026-09-29T10:00:00

Canonical URL: https://crevio.co/de/blog/ai-agent-web-scraping-tools

*Zuletzt aktualisiert: September 2026*

**Cloudflare, das nach eigenen Angaben den Datenverkehr für [20 % des Webs](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/) abwickelt, fragt inzwischen jede neue Website bei der Registrierung, ob KI-Crawler sie auslesen dürfen.** Das Web, auf das Ihr KI-Agent zugreifen möchte, schließt eine Tür nach der anderen. Die Tools, die Agenten durch diese Türen bringen, sind deshalb zu einer eigenen Kategorie geworden. Bei der Auswahl geht es heute genauso darum, was Sie überhaupt lesen dürfen und was es in großem Maßstab kostet, wie um die technischen Möglichkeiten des Tools.

Dieser Leitfaden vergleicht neun Web-Scraping-Tools für KI-Agenten: Exa, Tavily, Firecrawl, Jina Reader, Crawl4AI, Apify, Browserbase, Browser Use und Bright Data. Er richtet sich an Gründer und kleine Teams, die einen Agenten für Wettbewerbsrecherche, Preisüberwachung oder das Abrufen von Websitedaten einsetzen möchten – und wissen wollen, welches Tool passt, was es tatsächlich kostet und wo die rechtlichen Grenzen liegen.

- **Die Tools übernehmen vier unterschiedliche Aufgaben:** das Web durchsuchen, eine Seite lesen, eine komplette Website crawlen oder einen echten Browser bedienen. Für die meisten Recherchen im geschäftlichen Umfeld reichen die ersten beiden
- **Zum Einstieg genügt meist der günstigste Tarif.** Jedes Tool hier bietet einen kostenlosen Tarif, kostenlose Credits oder eine Open-Source-Version
- **Die Kosten steigen durch Multiplikatoren,** nicht durch den Preis auf der Startseite: komplette Website-Crawls, strukturierte Ausgaben und tägliche Wiederholungen summieren sich schnell auf Hunderttausende Credits
- **„Anti-Bot-Handhabung“ bedeutet, eine Website zu umgehen, die Nein gesagt hat.** Das ist nützlich – und zugleich der Punkt, an dem das rechtliche Risiko steigt

### Schnellvergleich

| Tool | Hauptaufgabe | Kostenloser Einstieg | Kostenpflichtig ab | Umgang mit gesperrten Websites | Ausgabe |
|------|--------------|----------------------|---------------------|-------------------------------|---------|
| [Exa](https://exa.ai/pricing) | Suche | $10 kostenlose Credits | $7 pro 1.000 Suchen | Nicht der Zweck des Tools | Ergebnisse, Seitentext, Highlights |
| [Tavily](https://www.tavily.com/pricing) | Suche plus Extraktion | 1.000 Credits pro Monat | $30 pro Monat für 4.000 Credits | Eingeschränkt | Ergebnisse, kurze Antwort, Seiteninhalt |
| [Jina Reader](https://jina.ai/reader/) | Eine Seite lesen | 10 Mio. Tokens mit kostenlosem Schlüssel | Abrechnung nach Tokens | Rendert JavaScript, optionale Proxys | Markdown |
| [Firecrawl](https://www.firecrawl.dev/pricing) | Lesen und Crawlen | 1.000 Credits pro Monat | $16 pro Monat bei jährlicher Abrechnung | Ja, im gehosteten Dienst | Markdown, HTML, JSON, Screenshots |
| [Crawl4AI](https://github.com/unclecode/crawl4ai) | Crawlen, Self-Hosted | Kostenlos, Open Source | Eigene Server oder Cloud-Version | Proxys müssen Sie selbst bereitstellen | Markdown |
| [Apify](https://apify.com/pricing) | Fertige Scraper | $5 Nutzung pro Monat | $19 pro Monat | Proxy-Pools | JSON, CSV, Excel |
| [Browserbase](https://www.browserbase.com/pricing) | Cloud-Browser | 1 Browserstunde | $20 pro Monat für 100 Stunden | Stealth und CAPTCHA-Lösung in kostenpflichtigen Tarifen | Alles, was Ihr Agent extrahiert |
| [Browser Use](https://browser-use.com/pricing) | Browser-Agent | Open Source, $15 Cloud-Credits | $0,02 pro Browserstunde | Stealth-Browser in der Cloud | Aufgabenergebnisse |
| [Bright Data](https://brightdata.com/pricing/web-unlocker) | Entsperren in großem Maßstab | 5.000 Anfragen pro Monat | $1,50 pro 1.000 erfolgreichen Anfragen | Am stärksten, einschließlich CAPTCHAs | HTML, Markdown, JSON |

Die Preise stammen aus den jeweiligen Preisübersichten der Tools und beziehen sich auf September 2026. Da sie sich häufig ändern, sollten Sie die Angaben prüfen, bevor Sie sich festlegen.

## Die vier Aufgaben von Web-Scraping-Tools für KI-Agenten

„Web Scraping“ umfasst vier sehr unterschiedliche Aufgaben. Die meisten Fehlentscheidungen entstehen, weil ein Tool für die falsche Aufgabe gekauft wird.

1. **Das Web durchsuchen.** Der Agent hat eine Frage und braucht Quellen. Eine Search API liefert sortierte Links samt Seitentext, sodass der Agent etwa die Frage „Was verlangen Wettbewerber für X?“ beantworten kann, ohne zehn Websites aufzurufen
2. **Eine Seite lesen.** Der Agent hat eine URL und braucht deren Inhalt als sauberen Text. Ein Reader entfernt Menüs, Werbung und Skripte und liefert Markdown, mit dem ein Modell arbeiten kann
3. **Eine komplette Website crawlen.** Der Agent benötigt jede Produktseite, jeden Blogbeitrag oder jedes Angebot einer Domain. Ein Crawler folgt Links, hält die von Ihnen gesetzten Grenzen ein und liefert Hunderte oder Tausende Seiten
4. **Einen echten Browser bedienen.** Die Seite benötigt einen Login, einen Klick, ein Suchfeld oder einen Scrollvorgang, bevor die Daten erscheinen. Nur ein echter Browser, den der Agent steuert, kommt hier weiter

![Matrix zur Einordnung von neun Web-Scraping-Tools für KI-Agenten nach Aufgabe – von der Suche bis zum echten Browser – und danach, wie gut sie mit Websites umgehen, die sich wehren](https://crevio.co/vite/assets/web-scraping-tools-matrix-ee17vcn3.svg)

Der schattierte Bereich ist am wichtigsten. Wettbewerberpreise prüfen, Marktrecherche betreiben, Lieferanten suchen und Dokumentationen lesen bedeutet fast immer: „Eine Seite finden und lesen.“ Erst wenn eine bestimmte Website Sie dazu zwingt, bewegen Sie sich nach rechts und oben.

## Suchtools: Exa und Tavily

### Exa

![Exa-Startseite, eine Web-Search-API für KI-Agenten mit eigenem Index des öffentlichen Webs](https://crevio.co/vite/assets/exa-homepage-amdi649m.png)

[Exa](https://exa.ai/) betreibt einen eigenen, speziell für KI entwickelten Suchindex, statt eine Suchmaschine für Endnutzer einzubinden. Sie senden eine Suchanfrage und erhalten Ergebnisse bereits mit Seitentext, Highlights oder einer Zusammenfassung. So kann der Agent auf einen separaten Abrufschritt verzichten. Außerdem gibt es Kategoriefilter für Nachrichten, Unternehmen, wissenschaftliche Arbeiten und Personen.

**Preise:** Neue Konten erhalten $10 kostenlose Credits. Eine Standardsuche kostet laut [Preisübersicht](https://exa.ai/pricing) $7 pro 1.000 Anfragen, im schnellsten Tarif $4. Das Abrufen von Seiteninhalten kostet $1 pro 1.000 Seiten.

**Am besten geeignet für:** Recherchefragen, bei denen das Finden der richtigen Quellen die größte Herausforderung ist. **Achtung:** Exa ist ein Suchtool. Wenn die benötigte Seite nicht im Index steht oder hinter einem Login liegt, kommt Exa nicht an sie heran.

### Tavily

![Tavily-Startseite, eine Web-Access-API für KI-Agenten mit Such-, Extract-, Crawl- und Research-Modi](https://crevio.co/vite/assets/tavily-homepage-ekzxxp81.png)

[Tavily](https://www.tavily.com/) ist eine für Agenten entwickelte Search API und bietet inzwischen auch Endpunkte für Extract, Map und Crawl. Im Februar 2026 [vereinbarte der Cloud-Anbieter Nebius die Übernahme](https://nebius.com/newsroom/nebius-announces-agreement-to-acquire-tavily-to-add-agentic-search-to-its-ai-cloud-platform) des Unternehmens für angeblich 275 Millionen US-Dollar.

**Preise:** Sie erhalten monatlich 1.000 kostenlose Credits – ohne Kreditkarte. Eine einfache Suche kostet 1 Credit, eine erweiterte 2 Credits. Das Extrahieren von Inhalten kostet 1 Credit pro 5 URLs. Der Project-Tarif kostet $30 pro Monat für 4.000 Credits; die nutzungsbasierte Abrechnung liegt laut [Credit-Dokumentation](https://docs.tavily.com/documentation/api-credits) bei $0,008 pro Credit.

**Am besten geeignet für:** eine günstige API, die Suche und einfaches Lesen von Seiten kombiniert. **Achtung:** Der Research-Endpunkt kann bis zu 250 Credits pro Anfrage verbrauchen. Eine „Deep Research“-Schleife leert einen kostenlosen Tarif daher schnell.

## Tools zum Lesen und Crawlen

### Firecrawl

![Firecrawl-Startseite, eine Webdaten-API, die Websites in LLM-taugliches Markdown und JSON umwandelt](https://crevio.co/vite/assets/firecrawl-homepage-izqwq5z7.png)

[Firecrawl](https://www.firecrawl.dev/) gehört zu den beliebtesten Möglichkeiten, Webinhalte in Text umzuwandeln, den ein Modell verwenden kann. Das Open-Source-Repository hat mehr als 186.000 GitHub-Sterne. Geben Sie eine URL an, erhalten Sie sauberes Markdown, HTML, strukturiertes JSON oder einen Screenshot. Geben Sie eine Domain an, kartiert oder crawlt Firecrawl die komplette Website. Im gehosteten Dienst rendert es JavaScript und kommt mit vielen geschützten Websites zurecht.

**Preise:** Der kostenlose Tarif umfasst 1.000 Credits pro Monat. Scraping, Crawling und Mapping kosten 1 Credit pro Seite; eine Suche kostet 2 Credits pro 10 Ergebnisse. Strukturierte JSON-Ausgabe kostet zusätzlich 4 Credits pro Seite. Hobby kostet $16 pro Monat, Standard $83 pro Monat für 100.000 Credits – jeweils bei jährlicher Abrechnung –, laut [Preisübersicht](https://www.firecrawl.dev/pricing).

**Am besten geeignet für:** bekannte Websites mit einer einzigen API in sauberen Text oder strukturierte Daten umzuwandeln. **Achtung:** der JSON-Multiplikator. Damit geben Sie am einfachsten fünfmal mehr aus als geplant, wie der folgende Kostenabschnitt zeigt.

### Jina Reader

![Jina-Reader-Seite, die jede URL durch das Voranstellen von r.jina.ai in LLM-taugliche Eingaben umwandelt](https://crevio.co/vite/assets/jina-reader-homepage-op8nvxr3.png)

[Jina Reader](https://jina.ai/reader/) hat die einfachste Schnittstelle in dieser Liste: Setzen Sie `r.jina.ai/` vor eine beliebige URL, und Sie erhalten die Seite als Markdown zurück. Standardmäßig rendert der Dienst die Seite in einem Headless-Browser, sodass JavaScript zuerst ausgeführt wird. Außerdem gibt es einen begleitenden Such-Endpunkt. Jina AI ist inzwischen [Teil von Elastic](https://www.elastic.co/blog/elastic-jina-ai), das das Unternehmen im Oktober 2025 übernommen hat.

**Preise:** Ohne Schlüssel sind 20 Anfragen pro Minute möglich. Ein kostenloser API-Schlüssel umfasst 10 Millionen Tokens. Danach zahlen Sie nach der Anzahl der verarbeiteten Tokens. Fehlgeschlagene Anfragen werden nicht berechnet.

**Am besten geeignet für:** einzelne Seiten ohne Einrichtungsaufwand zu lesen. Außerdem kann Jina vor dem Abruf die robots.txt einer Website prüfen – eine sinnvolle Standardeinstellung. **Achtung:** Jina liest Seiten, crawlt aber keine Websites. Stark geschützte Seiten erfordern einen eigenen Proxy.

### Crawl4AI

![Crawl4AI-GitHub-Repository, ein Open-Source-Webcrawler und -Scraper, der Websites in LLM-taugliches Markdown umwandelt](https://crevio.co/vite/assets/crawl4ai-github-ct9bldh3.png)

[Crawl4AI](https://github.com/unclecode/crawl4ai) ist die kostenlose Open-Source-Option. Die Software steht unter der Apache-2.0-Lizenz und hat mehr als 84.000 GitHub-Sterne. Sie crawlt Websites, wandelt sie in Markdown um und läuft auf dem eigenen Rechner oder Server. Inzwischen gibt es auch eine gehostete Cloud-Version.

**Preise:** kostenlos im Self-Hosting. Sie zahlen für den Server und bei Bedarf für Proxys.

**Am besten geeignet für:** technische Teams, die vollständige Kontrolle und keine Abrechnung pro Seite wünschen. **Achtung:** „Kostenlos“ verlagert die Kosten in Ihre Arbeitszeit. Gesperrte Websites, fehlerhafte Selektoren und Proxy-Rotation werden zu Ihrem Problem.

### Apify

![Apify-Startseite, ein Marktplatz mit mehr als 77.000 fertigen Scrapern und Tools für KI-Agenten](https://crevio.co/vite/assets/apify-homepage-lz8ivswq.png)

[Apify](https://apify.com/) verfolgt einen anderen Ansatz: Statt eines einzelnen Scrapers betreibt der Dienst einen Marktplatz mit fertigen Scrapern, den sogenannten Actors. Auf der Startseite finden sich mehr als 77.000 davon – von Scrapern für Google Maps und TikTok bis zu einem allgemeinen Website-Content-Crawler. Über den MCP-Server können Agenten sie aufrufen. Die Ergebnisse werden als Datensätze bereitgestellt und lassen sich nach JSON, CSV oder Excel exportieren.

**Preise:** Der kostenlose Tarif umfasst monatlich $5 Plattformnutzung. Starter kostet $19 pro Monat, Scale $199 – jeweils einschließlich dieses Nutzungsbetrags. Residential Proxies kosten in den günstigeren Tarifen laut [Preisübersicht](https://apify.com/pricing) etwa $8 pro GB. Viele Actors berechnen zusätzlich pro Ergebnis.

**Am besten geeignet für:** bekannte Websites, für die bereits jemand einen Scraper entwickelt und pflegt. **Achtung:** Die Qualität der Actors variiert. Viele beliebte Actors zielen auf Plattformen, deren Nutzungsbedingungen Scraping untersagen. Lesen Sie die Bedingungen der Zielplattform – nicht nur die Bewertung des Actors.

## Browser-Tools: Browserbase und Browser Use

### Browserbase

![Browserbase-Startseite, die Cloud-Browser für KI-Agenten mit Zugriff auf das gesamte Web anbietet](https://crevio.co/vite/assets/browserbase-homepage-cy4luvqg.png)

[Browserbase](https://www.browserbase.com/) führt echte Chrome-Browser in der Cloud aus, die Ihr Agent steuern kann. Sitzungsaufzeichnungen zeigen Ihnen, was der Agent getan hat. Außerdem entwickelt das Unternehmen Stagehand, ein Open-Source-Toolkit, mit dem Sie Browser-Schritte in Alltagssprache statt in Code formulieren.

**Preise:** Der kostenlose Tarif umfasst 1 Browserstunde. Developer kostet $20 pro Monat für 100 Stunden, danach $0,12 pro Stunde, sowie 1 GB Proxy-Datenverkehr, danach $12 pro GB. Einfaches Stealth und CAPTCHA-Lösung beginnen im Developer-Tarif; erweitertes Stealth gibt es laut [Preisübersicht](https://www.browserbase.com/pricing) im individuellen Scale-Tarif. Außerdem bietet Browserbase einfachere Fetch- und Search-APIs an.

**Am besten geeignet für:** Agenten, die sich auf Websites ohne API anmelden, klicken und Formulare ausfüllen müssen. **Achtung:** die Proxy-Bandbreite. Browserstunden sind günstig; bildlastige Seiten über Residential Proxies für $12 pro GB abzurufen, ist es nicht.

### Browser Use

![Browser-Use-Startseite, ein Open-Source-Framework für KI-Agenten, die den Browser verwenden, mit $15 kostenlosen Credits](https://crevio.co/vite/assets/browser-use-homepage-bhju390c.png)

[Browser Use](https://browser-use.com/) ist ein Open-Source-Framework (MIT-Lizenz, etwa 117.000 GitHub-Sterne), mit dem ein KI-Modell einen Browser bedienen kann: Seite lesen, nächsten Klick bestimmen und wiederholen, bis die Aufgabe erledigt ist. Die Cloud-Version bietet Stealth-Browser und Proxys. Die [README des Projekts](https://github.com/browser-use/browser-use) empfiehlt sie, um Bot-Erkennung und CAPTCHAs zu reduzieren.

**Preise:** Die Bibliothek ist kostenlos. Cloud-Browser kosten $0,02 pro Stunde, Residential Proxies $5 pro GB. Für verwaltete Agenten zahlen Sie die Kosten des KI-Modells plus 20 %. Berechtigte neue Konten erhalten $15 Credits ohne Ablaufdatum.

**Am besten geeignet für:** mehrstufige Aufgaben in Alltagssprache, etwa „Finde die drei günstigsten Lieferanten und fülle ihre Angebotsformulare aus.“ **Achtung:** Jeder Schritt ist ein Modellaufruf. Eine Aufgabe mit 40 Schritten auf einem großen Modell kostet deutlich mehr als die reine Browserzeit.

## Entsperren in großem Maßstab: Bright Data

![Bright-Data-Startseite, eine Webdatenplattform mit Scraper-APIs, Unblocking-Browsern und mehr als 400 Millionen Proxy-IPs](https://crevio.co/vite/assets/bright-data-homepage-hacggvko.png)

[Bright Data](https://brightdata.com/) ist das Schwergewicht. Das Unternehmen verkauft Proxys aus nach eigenen Angaben mehr als 400 Millionen IPs, eine Unblocker-API, die CAPTCHAs löst und Identitäten wechselt, Remote-Browser, fertige Scraper-APIs und vorab erstellte Datensätze. Der Web-MCP-Server bietet Agenten Suche, Scraping und Browsing über eine einzige Verbindung.

**Preise:** Web MCP bietet ohne Kreditkarte einen kostenlosen Tarif mit 5.000 Anfragen pro Monat. Web Unlocker kostet laut [Preisübersicht](https://brightdata.com/pricing/web-unlocker) $1,50 pro 1.000 Anfragen; berechnet werden nur erfolgreiche Anfragen. Ausgabenlimits können Sie selbst festlegen.

**Am besten geeignet für:** Websites, die sich stark wehren, und Volumen, bei dem die Erfolgsquote wichtiger ist als der Preis. **Achtung:** Das Tool bringt Sie an Sperren vorbei. Damit liegt die Verantwortung bei Ihnen, ob Sie dort überhaupt sein sollten. Mehr dazu weiter unten.

## Wie die Kosten für Web Scraping mit KI-Agenten explodieren

Niemand ist überrascht, weil eine einzelne Seite zu viel gekostet hat. Überraschend wird die Rechnung, wenn ein Agent aus einer Anweisung Tausende Anfragen macht. Dafür sorgen vier Multiplikatoren:

![Beispielrechnung, wie die Firecrawl-Credits von 1 Credit für eine Seite auf 300.000 Credits für einen täglichen Crawl mit JSON-Ausgabe steigen](https://crevio.co/vite/assets/scraping-cost-multiplier-lrg3dbyh.svg)

- **Umfang:** „Prüfe deren Preise“ wird zu „Crawle deren Website“, wenn der Agent die Preisseite nicht findet
- **Format:** Strukturierte Ausgaben kosten oft ein Mehrfaches von einfachem Text
- **Häufigkeit:** Eine täglich geplante Aufgabe läuft 30-mal pro Monat, eine stündliche 720-mal
- **Wiederholungen:** Wenn eine Seite fehlschlägt, versuchen Agenten es erneut – manchmal mit einem aufwendigeren Tool. Browser-Tools berechnen außerdem das Nachdenken des Modells bei jedem Schritt

Die Gegenmaßnahmen sind unspektakulär, aber wirksam. Kartieren Sie eine Website vor dem Crawlen und rufen Sie nur Seiten ab, die sich geändert haben. Fordern Sie JSON nur dort an, wo Sie die Felder tatsächlich verwenden. Begrenzen Sie die Aufgabe („höchstens 50 Seiten“) und setzen Sie das monatliche Ausgabenlimit, das die meisten dieser Tools anbieten. Suchen Sie außerdem möglichst zuerst: Eine Suche mit zurückgegebenem Seitentext ersetzt oft zehn einzelne Abrufe. Unser Überblick zu den [Betriebskosten von KI-Agenten](/de/blog/ai-agent-running-costs) behandelt die Modellseite derselben Rechnung.

## Gesperrte Websites: Was „Anti-Bot-Handhabung“ wirklich bedeutet

Websites sperren Agenten auf mehreren Ebenen. Manche prüfen den User-Agent und lehnen alles ab, was kein bekannter Browser ist. Manche liefern Inhalte erst nach der Ausführung von JavaScript. Andere begrenzen die Anfragezahl pro IP, zeigen CAPTCHAs oder verlangen einen Login. Die oben genannten Tools reagieren auf diese Ebenen mit zunehmend aufwendigeren Verfahren: Browser-Rendering, Residential Proxies, Fingerprint-„Stealth“ und CAPTCHA-Lösung.

Zwei Dinge sollten Sie wissen, bevor Sie für die aufwendigen Optionen bezahlen.

**Websites wehren sich stärker.** Seit Juli 2025 fordert Cloudflare jede neue Domain bei der Registrierung auf, den Zugriff von KI-Crawlern festzulegen. Außerdem testet das Unternehmen eine Möglichkeit, mit der Betreiber [Crawler pro Seite abrechnen können](https://blog.cloudflare.com/introducing-pay-per-crawl/). Der optionale [AI Labyrinth](https://blog.cloudflare.com/ai-labyrinth/) geht noch weiter: Bots, die No-Crawl-Regeln ignorieren, werden in ein endloses Labyrinth aus KI-generierten Täuschungsseiten geschickt. Ein darin gefangener Agent verbraucht Credits für nutzlose Daten, ohne dass die Ausgabe erkennen lässt, was passiert ist. Prüfen Sie stichprobenartig, was zurückkommt.

**Eine Sperre zu umgehen, ist eine Entscheidung mit Folgen.** Ein CAPTCHA oder eine Login-Wand bedeutet: Der Betreiber sagt Nein. Das Umgehen kann unproblematisch sein – etwa bei einer Website, die alle Bots blockiert, aber öffentlich zugängliche Preise veröffentlicht, die Sie vergleichen dürfen. Es kann aber auch genau das sein, was zu einer Klage führt, wie der nächste Abschnitt zeigt. Der leistungsstärkste Unblocker ist deutlich seltener das richtige Tool, als sein Marketing vermuten lässt.

## Ist Web Scraping mit KI-Agenten legal?

Dies ist keine Rechtsberatung. Die Antwort hängt von Ihrem Land, der Website und den Daten ab. Die wichtigsten Grenzen sind jedoch klarer als noch vor fünf Jahren.

### robots.txt ist eine Bitte, kein Schloss

[RFC 9309](https://www.rfc-editor.org/rfc/rfc9309.html), der Standard hinter robots.txt, sagt ausdrücklich, dass deren Regeln keine Zugriffsberechtigung darstellen. Sie zu ignorieren ist kein Hacking. Es kann bei einem späteren Rechtsstreit jedoch als Hinweis auf Ihre Absicht gewertet werden, und seriöse Crawler halten sich daran. Die einfache Regel: Befolgen Sie robots.txt, sofern es keinen konkreten Grund dagegen gibt, und dokumentieren Sie diesen Grund.

### Öffentliche Daten sind kein „Hacking“, aber Nutzungsbedingungen sind ein Vertrag

Der lange Rechtsstreit hiQ Labs gegen LinkedIn entwickelte sich in zwei Richtungen. Im Hinblick auf das US-amerikanische Anti-Hacking-Gesetz entschied der Ninth Circuit im April 2022, dass das Scraping [öffentlich zugänglicher Seiten wahrscheinlich keinen Zugriff „ohne Autorisierung“ darstellt](https://www.jenner.com/en/news-insights/publications/client-alert-data-scraping-in-hiq-v-linkedin-the-ninth-circuit-reaffirms-narrow-interpretation-of-cfaa). Vertragsrechtlich verlor hiQ dennoch, weil das Unternehmen LinkedIns Bedingungen akzeptiert und Fake-Accounts verwendet hatte. Das Verfahren endete mit einem Urteil gegen hiQ. Wir haben diesen Ausgang und die Gründe, warum Sie einen Agenten niemals LinkedIn scrapen lassen sollten, in unserem Leitfaden zum [Erstellen von Interessentenlisten mit KI-Agenten](/de/blog/build-prospect-lists-with-ai-agents) behandelt.

Die Gegenrichtung zeigte sich im Januar 2024: In Meta gegen Bright Data entschied ein Gericht, dass die Bedingungen von Facebook und Instagram [das Scraping öffentlicher Daten im ausgeloggten Zustand nicht untersagen](https://newmedialaw.proskauer.com/2024/01/24/california-court-issues-noteworthy-decision-on-breach-of-contract-claims-in-web-scraping-dispute/). Die praktische Regel aus beiden Fällen lautet: **Öffentliche Seiten im ausgeloggten Zustand zu scrapen ist deutlich weniger riskant als im eingeloggten Zustand.** Sobald sich Ihr Agent anmeldet, akzeptiert er die Bedingungen der Website.

### Umgehung technischer Schutzmaßnahmen und Urheberrecht

Fakten zu lesen ist etwas anderes, als eine sprachliche Darstellung zu kopieren. Das US-Urheberrecht schützt die Art, wie etwas geschrieben ist, nicht die [zugrunde liegenden Fakten](https://www.law.cornell.edu/supremecourt/text/499/340). Preise, Öffnungszeiten oder Produktdaten zu sammeln ist daher etwas anderes, als die Artikel anderer zu veröffentlichen. Das Umgehen technischer Schutzmaßnahmen birgt ein eigenes Risiko: Im Oktober 2025 [verklagte Reddit Perplexity und drei Scraping-Anbieter](https://searchengineland.com/reddit-sues-perplexity-serpapi-scraping-google-463681). Reddit argumentierte, dass wechselnde IPs und das Verschleiern von Bots zur Umgehung von Sperren gegen die Anti-Umgehungsregeln des DMCA verstießen. Der Fall ist noch nicht abgeschlossen, die Argumentation zielt jedoch direkt auf „Anti-Bot-Handhabung“ ab.

### Personenbezogene Daten ändern alles

Wenn die von Ihnen gescrapten Daten Personen identifizieren, gilt Datenschutzrecht – unabhängig davon, wie öffentlich die Seite ist. Die niederländische Datenschutzbehörde verhängte 2024 gegen Clearview AI eine Geldstrafe von [30,5 Millionen €](https://www.autoriteitpersoonsgegevens.nl/en/current/dutch-dpa-imposes-a-fine-on-clearview-because-of-illegal-data-collection-for-facial-recognition), weil das Unternehmen ohne Einwilligung eine Datenbank aus gescrapten Fotos aufgebaut hatte. Unternehmensdaten sind weniger riskant; Personenlisten benötigen eine Rechtsgrundlage, einen Zweck und einen Plan für Löschanfragen.

Eine Richtlinie in fünf Zeilen deckt die meisten Scraping-Szenarien kleiner Unternehmen ab:

1. Nur öffentliche Seiten und ausgeloggt – außer Sie haben ein eigenes Konto und die Bedingungen erlauben es
2. robots.txt befolgen und in angemessenem Tempo arbeiten: wenige Anfragen pro Minute und Website
3. Fakten sammeln, keine vollständigen Artikel oder Bilder zur erneuten Veröffentlichung
4. Keine personenbezogenen Daten ohne klare Rechtsgrundlage
5. Wenn eine Website Sie blockiert, prüfen Sie zuerst, ob sie eine API oder einen Datenfeed anbietet, bevor Sie zu einem Unblocker greifen

## Welches Web-Scraping-Tool sollte Ihr Agent verwenden?

Beginnen Sie mit der Aufgabe, nicht mit der Marke:

- **Fragen zum Web beantworten:** Exa oder Tavily. Die kostenlosen Tarife decken jeweils Hunderte Suchen pro Monat ab
- **Bestimmte, bereits bekannte Seiten lesen:** Jina Reader für einzelne Seiten, Firecrawl für strukturierte Daten oder komplette Websites
- **Eine beliebte Plattform mit fertigem Scraper:** Apify – nachdem Sie die Bedingungen der Plattform geprüft haben
- **Kostenlos und vollständig unter eigener Kontrolle:** Crawl4AI, wenn jemand im Team den Betrieb übernehmen kann
- **Logins, Formulare und Klicks:** Browserbase, wenn Sie Code schreiben; Browser Use, wenn der Agent die Schritte selbst planen soll
- **Geschützte Websites in großem Umfang:** Bright Data – nachdem Sie die rechtlichen Fragen geklärt haben

Bei allen diesen Optionen gehen Sie davon aus, dass Sie Ihren eigenen Agenten bauen und die Tools integrieren. Wenn Sie lieber einen Agenten hätten, der bereits über einen Browser und eine Möglichkeit zum Lesen des Webs verfügt, gibt es einen anderen Weg.

## Wie Crevios Agent das Web liest

![Crevio-Startseite, ein KI-Business-Builder, bei dem Sie beschreiben, was Sie möchten, und die KI es erstellt und ausführt](https://crevio.co/vite/assets/crevio-homepage-lkh6c7o3.png)

[Crevio](https://crevio.co/) ist ein [KI-Business-Builder](/de/blog/ai-business-builder): ein KI-Agent, der die täglichen Aufgaben Ihres Unternehmens übernimmt – von Website und Produkten bis hin zu Marketing und Recherche. Für das Lesen des Webs bietet er drei integrierte Funktionen:

- **Websuche mit Quellenangaben.** Der Agent durchsucht das Web und liefert eine Antwort mit den Links, aus denen sie stammt. Diese kann er anschließend öffnen und vollständig lesen
- **Einen Seiten-Reader.** Er liest jede öffentliche URL als Text, einschließlich JSON-Feeds, und wandelt PDFs, Word-Dokumente und Tabellen in lesbaren Text um. Dabei gibt er sich als Crevio-Agent zu erkennen, statt sich als Browser einer Person auszugeben
- **Einen eigenen Computer mit echtem Browser.** Seiten, die JavaScript, Klicks, Formulare oder einen Login benötigen, bearbeitet der Agent in Chrome auf seinem eigenen Computer. Sie können den Bildschirm live verfolgen, und Logins bleiben zwischen Chats erhalten. Der Agent kann eine Liste von Seiten in einer Schleife abarbeiten und die Ergebnisse in einer Tabelle speichern

Damit deckt Crevio den schattierten Bereich der Matrix ab – plus das eingeloggte Browsing, das viele kleine Unternehmen für eigene Lieferantenportale und Dashboards benötigen. Eine [geplante Aufgabe](/de/blog/schedule-recurring-ai-agent-tasks) kann jeden Morgen dieselbe Prüfung ausführen, etwa eine Wettbewerber-Preisseite oder die Lagerbestände eines Lieferanten.

Und die ehrlichen Grenzen:

- **Kein Proxy-Netzwerk und keine CAPTCHA-Lösung.** Wenn eine Website ein CAPTCHA anzeigt oder einen Code verlangt, der an Ihr Telefon gesendet wird, übergibt der Agent Ihnen den Live-Bildschirm, damit Sie den Schritt abschließen. Gespeicherte Passwörter werden ausgefüllt, ohne im Chat zu erscheinen
- **Der Seiten-Reader führt kein JavaScript aus.** Seiten, die sich erst im Browser aufbauen, können leer zurückkommen. Dafür benötigen Sie den Browser, der langsamer ist und mehr Credits verbraucht
- **Kein Bulk-Crawler.** Einige Hundert Seiten sind eine realistische Aufgabe. Zehntausende Seiten pro Tag sind der Anwendungsfall für die oben genannten spezialisierten Tools
- **robots.txt und die Nutzungsbedingungen einer Website werden nicht automatisch geprüft.** Nehmen Sie die Richtlinie in fünf Zeilen in die Aufgabenanweisung auf
- **Recherche verbraucht KI-Credits.** Die 20 Credits pro Monat im kostenlosen Starter-Tarif sind zum Ausprobieren gedacht; für regelmäßige Überwachung benötigen Sie einen kostenpflichtigen Tarif

Wenn ein Scraping-Dienst, für den Sie bereits bezahlen, im Katalog mit mehr als 3.000 Integrationen von Crevio enthalten ist, können Sie ihn verbinden. Standardmäßig fragt der Agent, bevor er in einer verbundenen App etwas ändert.

## FAQ

### Was ist das beste Web-Scraping-Tool für KI-Agenten?

Das eine beste Tool gibt es nicht, weil die Tools unterschiedliche Aufgaben übernehmen. Für Recherchefragen eignet sich eine Search API wie Exa oder Tavily. Für bekannte Seiten als sauberen Text sind Firecrawl oder Jina Reader geeignet. Für Logins und Klicks bieten sich Browser-Tools wie Browserbase oder Browser Use an. Für stark geschützte Websites ist Bright Data eine Option. Die meisten kleinen Unternehmen benötigen nur eine Suche und einen Seiten-Reader.

### Können KI-Agenten Websites scrapen, die Bots blockieren?

Oft ja. Tools mit Residential Proxies, Stealth-Browsern und CAPTCHA-Lösung überwinden die meisten Sperren. Ob Sie das tun sollten, ist eine andere Frage: Eine Sperre bedeutet, dass der Betreiber Nein sagt, und das Umgehen technischer Schutzmaßnahmen ist Gegenstand laufender Klagen. Prüfen Sie zuerst, ob eine offizielle API oder ein Datenfeed verfügbar ist.

### Ist es legal, eine Website mit KI zu scrapen?

Das Scrapen öffentlicher Seiten im ausgeloggten Zustand ist in den USA nach den Entscheidungen hiQ und Meta gegen Bright Data generell weniger riskant. Das Risiko steigt, wenn Sie sich anmelden und Bedingungen akzeptieren, die Scraping untersagen, technische Sperren umgehen, urheberrechtlich geschützte Inhalte erneut veröffentlichen oder personenbezogene Daten sammeln. Datenschutzgesetze wie die DSGVO gelten auch dann, wenn diese Daten öffentlich zugänglich sind.

### Wie viel kostet Web Scraping mit KI-Agenten?

Bei geringer Nutzung ist es oft kostenlos: Die meisten Tools hier enthalten monatliche Gratis-Credits. Kostenpflichtige Tarife beginnen bei etwa $16 bis $30 pro Monat. Die tatsächlichen Kosten hängen von Umfang, Format und Häufigkeit ab. Bei Firecrawl kostet eine Seite 1 Credit, während ein täglicher Crawl einer Website mit 2.000 Seiten und strukturierter Ausgabe 300.000 Credits pro Monat erreichen kann.

## Fazit

Das richtige Web-Scraping-Tool für KI-Agenten ist das einfachste, mit dem sich die Aufgabe erledigen lässt. Suchen Sie, bevor Sie lesen; lesen Sie, bevor Sie crawlen; und crawlen Sie, bevor Sie zu einem Browser greifen. Wenn eine Website Sie zu Stealth-Proxys und CAPTCHA-Lösung zwingt, halten Sie inne und fragen Sie sich, ob sie Ihnen damit etwas sagen will. Der beste Scraper ist der, den Sie nie erklären müssen.

## Verwandte Blogbeiträge

- [So erstellen Sie mit KI-Agenten Interessentenlisten (ohne Ihre Domain zu verbrennen)](/de/blog/build-prospect-lists-with-ai-agents)
- [Betriebskosten von KI-Agenten: Was ein Agent pro Monat wirklich kostet](/de/blog/ai-agent-running-costs)
- [So planen Sie wiederkehrende KI-Agenten-Aufgaben, die ohne Sie laufen](/de/blog/schedule-recurring-ai-agent-tasks)
