# Tools voor webscraping met AI-agents: 9 opties vergeleken op prijs, blokkades en legaliteit

> Vergelijk 9 tools voor webscraping met AI-agents, van Firecrawl tot Bright Data. Wat elke tool doet, wat ze echt kosten, welke sites ze blokkeren en waar de juridische grenzen liggen.

Last updated: 2026-09-29T10:00:00

Canonical URL: https://crevio.co/nl/blog/ai-agent-web-scraping-tools

*Laatst bijgewerkt: september 2026*

**Cloudflare, dat zegt verkeer voor [20% van het web](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/) af te handelen, vraagt nu aan elke nieuwe site die zich aanmeldt of AI-crawlers de site mogen lezen.** Het web dat je AI-agent wil lezen, sluit langzaam de ene deur na de andere. De tools die agents door die deuren helpen, zijn daardoor een categorie op zich geworden. Bij de keuze gaat het nu net zo goed om wat je mag lezen en wat het op grote schaal kost, als om wat de tool technisch kan.

In deze gids vergelijken we negen tools voor webscraping met AI-agents: Exa, Tavily, Firecrawl, Jina Reader, Crawl4AI, Apify, Browserbase, Browser Use en Bright Data. De gids is bedoeld voor oprichters en kleine teams die een agent concurrenten willen laten onderzoeken, prijzen willen monitoren of gegevens van websites willen halen — en willen weten welke tool past, wat die echt kost en waar de juridische grenzen liggen.

- **De tools doen vier verschillende dingen:** het web doorzoeken, een pagina lezen, een hele site crawlen of een echte browser bedienen. Voor de meeste zakelijke onderzoeken zijn alleen de eerste twee nodig
- **De goedkoopste versie is meestal genoeg om te beginnen.** Elke tool in dit overzicht heeft een gratis abonnement, gratis credits of een opensourceversie
- **De kosten lopen op door vermenigvuldigers,** niet door de prijs op de voorpagina: crawls van hele sites, gestructureerde output en dagelijkse herhalingen stapelen zich op tot honderdduizenden credits
- **‘Anti-bot-afhandeling’ betekent dat je langs een site komt die nee heeft gezegd.** Dat is nuttig, maar ook het punt waarop het juridische risico toeneemt

### Snel vergelijken

| Tool | Belangrijkste taak | Gratis starten | Betaald vanaf | Omgaan met geblokkeerde sites | Output |
|------|----------|---------------|-----------|----------------------|--------|
| [Exa](https://exa.ai/pricing) | Zoeken | $10 gratis credits | $7 per 1.000 zoekopdrachten | Niet waarvoor het bedoeld is | Resultaten, pagin tekst, highlights |
| [Tavily](https://www.tavily.com/pricing) | Zoeken en extraheren | 1.000 credits per maand | $30 per maand voor 4.000 credits | Beperkt | Resultaten, kort antwoord, pagina-inhoud |
| [Jina Reader](https://jina.ai/reader/) | Eén pagina lezen | 10 miljoen tokens met een gratis sleutel | Betalen per token | JavaScript renderen, optionele proxy’s | Markdown |
| [Firecrawl](https://www.firecrawl.dev/pricing) | Lezen en crawlen | 1.000 credits per maand | $16 per maand, jaarlijks gefactureerd | Ja, op de gehoste service | Markdown, HTML, JSON, schermafbeeldingen |
| [Crawl4AI](https://github.com/unclecode/crawl4ai) | Crawlen, zelf gehost | Gratis, opensource | Je eigen servers of de cloudversie | Je regelt zelf de proxy’s | Markdown |
| [Apify](https://apify.com/pricing) | Kant-en-klare scrapers | $5 gebruik per maand | $19 per maand | Proxypools | JSON, CSV, Excel |
| [Browserbase](https://www.browserbase.com/pricing) | Cloudbrowsers | 1 browseruur | $20 per maand voor 100 uur | Stealth en CAPTCHA-oplossing in betaalde abonnementen | Wat je agent ook extraheert |
| [Browser Use](https://browser-use.com/pricing) | Browseragent | Opensource, $15 cloudcredits | $0,02 per browseruur | Stealthbrowsers in de cloud | Taakresultaten |
| [Bright Data](https://brightdata.com/pricing/web-unlocker) | Op grote schaal blokkades omzeilen | 5.000 aanvragen per maand | $1,50 per 1.000 geslaagde aanvragen | Het sterkst, inclusief CAPTCHA’s | HTML, Markdown, JSON |

De prijzen komen van de prijspagina van elke tool en zijn gecontroleerd in september 2026. Ze veranderen vaak, dus controleer ze voordat je je vastlegt.

## De vier taken van tools voor webscraping met AI-agents

‘Webscraping’ omvat vier behoorlijk verschillende taken. De meeste verkeerde toolkeuzes ontstaan doordat mensen een tool voor de verkeerde taak aanschaffen.

1. **Het web doorzoeken.** De agent heeft een vraag en bronnen nodig. Een search-API geeft gerangschikte links met bijbehorende pagin tekst, zodat de agent bijvoorbeeld kan beantwoorden wat concurrenten voor X vragen zonder tien sites te bezoeken
2. **Een pagina lezen.** De agent heeft een URL en de inhoud als schone tekst nodig. Een reader verwijdert menu’s, advertenties en scripts en levert Markdown op waarmee een model kan werken
3. **Een hele site crawlen.** De agent heeft elke productpagina, elk blogbericht of elke vermelding op een domein nodig. Een crawler volgt links, houdt zich aan de limieten die je instelt en levert honderden of duizenden pagina’s op
4. **Een echte browser bedienen.** De pagina vereist een login, klik, zoekveld of scroll voordat de gegevens verschijnen. Alleen een echte browser die door de agent wordt bestuurd, komt daar

![Matrix die negen tools voor webscraping met AI-agents positioneert op taak — van zoeken tot een echte browser — en op de mate waarin ze omgaan met sites die tegenwerken](https://crevio.co/vite/assets/web-scraping-tools-matrix-ee17vcn3.svg)

De gearceerde hoek is het belangrijkst. Concurrentieprijzen controleren, marktonderzoek doen, leveranciers opzoeken en documentatie lezen komt bijna altijd neer op ‘een pagina vinden en die lezen’. Je schuift pas naar rechts en omhoog als een specifieke site je daartoe dwingt.

## Zoektools: Exa en Tavily

### Exa

![Homepage van Exa, een websearch-API voor AI-agents met een eigen index van het openbare web](https://crevio.co/vite/assets/exa-homepage-amdi649m.png)

[Exa](https://exa.ai/) heeft een eigen zoekindex die voor AI is gebouwd, in plaats van een zoekmachine voor consumenten te omwikkelen. Je stuurt een zoekopdracht en krijgt resultaten terug met de pagin tekst, highlights of een samenvatting al inbegrepen. De agent hoeft daardoor geen aparte fetch-stap uit te voeren. Exa biedt ook categoriefilters voor nieuws, bedrijven, onderzoeksartikelen en personen.

**Prijs:** nieuwe accounts krijgen $10 aan gratis credits. Standard Search kost $7 per 1.000 aanvragen, de snelste versie $4 en het ophalen van pagina-inhoud $1 per 1.000 pagina’s, volgens de [prijspagina](https://exa.ai/pricing).

**Het meest geschikt voor:** onderzoeksvragen waarbij de juiste bronnen vinden het lastigste onderdeel is. **Let op:** het is een zoektool. Staat de pagina die je nodig hebt niet in de index of zit die achter een login, dan komt Exa er niet bij.

### Tavily

![Homepage van Tavily, een webtoegangs-API voor AI-agents met modi voor zoeken, extraheren, crawlen en onderzoek](https://crevio.co/vite/assets/tavily-homepage-ekzxxp81.png)

[Tavily](https://www.tavily.com/) is een search-API voor agents en is inmiddels uitgebreid met endpoints voor extract, map en crawl. In februari 2026 [sprak cloudprovider Nebius af Tavily over te nemen](https://nebius.com/newsroom/nebius-announces-agreement-to-acquire-tavily-to-add-agentic-search-to-its-ai-cloud-platform) voor naar verluidt $275 miljoen.

**Prijs:** 1.000 gratis credits per maand zonder creditcard. Een eenvoudige zoekopdracht kost 1 credit en een geavanceerde 2; inhoud extraheren kost 1 credit per 5 URL’s. Het abonnement Project kost $30 per maand voor 4.000 credits. Betalen naar gebruik kost $0,008 per credit, volgens de [documentatie over credits](https://docs.tavily.com/documentation/api-credits).

**Het meest geschikt voor:** één goedkope API voor zoeken en licht pagina’s lezen. **Let op:** het research-endpoint kan tot 250 credits per aanvraag gebruiken. Een ‘deep-research’-lus verbruikt een gratis abonnement dus snel.

## Tools voor lezen en crawlen

### Firecrawl

![Homepage van Firecrawl, een webdata-API die websites omzet in Markdown en JSON die klaar zijn voor LLM’s](https://crevio.co/vite/assets/firecrawl-homepage-izqwq5z7.png)

[Firecrawl](https://www.firecrawl.dev/) is een van de populairste manieren om webpagina’s om te zetten in tekst waarmee een model kan werken. De opensourcerepository heeft meer dan 186.000 GitHub-sterren. Geef een URL op en je krijgt schone Markdown, HTML, gestructureerde JSON of een schermafbeelding. Geef een domein op en de tool brengt de hele site in kaart of crawlt die. Op de gehoste service rendert Firecrawl JavaScript en verwerkt het veel beveiligde sites.

**Prijs:** het gratis abonnement bevat 1.000 credits per maand. Scrapen, crawlen of in kaart brengen kost 1 credit per pagina. Een zoekopdracht kost 2 credits per 10 resultaten en gestructureerde JSON-output voegt 4 credits per pagina toe. Hobby kost $16 per maand en Standard $83 per maand voor 100.000 credits; beide worden jaarlijks gefactureerd, volgens de [prijspagina](https://www.firecrawl.dev/pricing).

**Het meest geschikt voor:** bekende websites met één API omzetten in schone tekst of gestructureerde gegevens. **Let op:** de JSON-vermenigvuldiger. Daarmee geef je gemakkelijk vijf keer zoveel uit als gepland, zoals het kostenoverzicht hieronder laat zien.

### Jina Reader

![Pagina van Jina Reader, dat elke URL omzet in LLM-vriendelijke invoer door r.jina.ai ervoor te zetten](https://crevio.co/vite/assets/jina-reader-homepage-op8nvxr3.png)

[Jina Reader](https://jina.ai/reader/) heeft de eenvoudigste interface in dit overzicht: zet `r.jina.ai/` vóór een URL en je krijgt de pagina terug als Markdown. Standaard rendert de tool de pagina in een headless browser, zodat JavaScript eerst wordt uitgevoerd. Er is ook een bijbehorend search-endpoint. Jina AI maakt nu [deel uit van Elastic](https://www.elastic.co/blog/elastic-jina-ai), dat het bedrijf in oktober 2025 overnam.

**Prijs:** zonder sleutel werkt de tool met 20 aanvragen per minuut. Een gratis API-sleutel bevat 10 miljoen tokens. Daarna betaal je per verwerkt token. Mislukte aanvragen worden niet in rekening gebracht.

**Het meest geschikt voor:** zonder configuratie telkens één pagina lezen. Je kunt ook instellen dat de tool vóór het ophalen het robots.txt-bestand van een site controleert — een goede standaardinstelling. **Let op:** de tool leest pagina’s, maar crawlt geen sites. Voor sterk beveiligde pagina’s heb je een eigen proxy nodig.

### Crawl4AI

![GitHub-repository van Crawl4AI, een opensource-webcrawler en scraper die websites omzet in Markdown voor LLM’s](https://crevio.co/vite/assets/crawl4ai-github-ct9bldh3.png)

[Crawl4AI](https://github.com/unclecode/crawl4ai) is de gratis opensourceoptie, met een Apache 2.0-licentie en meer dan 84.000 GitHub-sterren. De tool crawlt sites, zet ze om in Markdown en draait op je eigen computer of server. Inmiddels is er ook een gehoste cloudversie.

**Prijs:** gratis als je de tool zelf host. Je betaalt wel voor de server en voor proxy’s als je die nodig hebt.

**Het meest geschikt voor:** technische teams die volledige controle willen en geen bedrag per pagina willen betalen. **Let op:** ‘gratis’ verplaatst de kosten naar je tijd. Geblokkeerde sites, kapotte selectors en het rouleren van proxy’s worden jouw probleem.

### Apify

![Homepage van Apify, een marktplaats met meer dan 77.000 kant-en-klare scrapers en tools voor AI-agents](https://crevio.co/vite/assets/apify-homepage-lz8ivswq.png)

[Apify](https://apify.com/) kiest voor een andere aanpak: in plaats van één scraper biedt het een marktplaats met kant-en-klare scrapers, die Actors heten. Op de homepage staan er meer dan 77.000, van scrapers voor Google Maps en TikTok tot een algemene crawler voor website-inhoud. Agents kunnen ze aanroepen via de MCP-server. Resultaten komen terug als datasets die je naar JSON, CSV of Excel kunt exporteren.

**Prijs:** het gratis abonnement bevat $5 aan platformgebruik per maand. Starter kost $19 per maand en Scale $199; bij beide is dat bedrag inbegrepen als gebruik. Residential proxies kosten op de goedkopere abonnementen ongeveer $8 per GB, volgens de [prijspagina](https://apify.com/pricing). Veel Actors brengen daarnaast kosten per resultaat in rekening.

**Het meest geschikt voor:** bekende sites waarvoor iemand al een scraper heeft gebouwd en onderhoudt. **Let op:** de kwaliteit verschilt per Actor. Veel populaire Actors zijn gericht op platforms waarvan de voorwaarden scrapen verbieden. Lees de voorwaarden van het doelplatform, niet alleen de beoordeling van de Actor.

## Browsertools: Browserbase en Browser Use

### Browserbase

![Homepage van Browserbase, dat cloudbrowsers biedt waarmee AI-agents toegang krijgen tot het hele web](https://crevio.co/vite/assets/browserbase-homepage-cy4luvqg.png)

[Browserbase](https://www.browserbase.com/) draait echte Chrome-browsers in de cloud die je agent kan besturen. Met session replays kun je zien wat de agent heeft gedaan. Het bedrijf onderhoudt ook Stagehand, een opensourcetoolkit waarmee je browserstappen in gewone taal schrijft in plaats van code.

**Prijs:** het gratis abonnement bevat 1 browseruur. Developer kost $20 per maand voor 100 uur, daarna $0,12 per uur, en 1 GB proxyverkeer, daarna $12 per GB. Basic stealth en CAPTCHA-oplossing beginnen bij Developer. Geavanceerde stealth zit in het aangepaste Scale-abonnement, volgens de [prijspagina](https://www.browserbase.com/pricing). Browserbase verkoopt ook eenvoudigere fetch- en search-API’s.

**Het meest geschikt voor:** agents die moeten inloggen, klikken en formulieren invullen op sites zonder API. **Let op:** proxybandbreedte. Browseruren zijn goedkoop; pagina’s vol afbeeldingen via residential proxies ophalen voor $12 per GB niet.

### Browser Use

![Homepage van Browser Use, een opensourceframework voor AI-agents die de browser gebruiken, met $15 aan gratis credits](https://crevio.co/vite/assets/browser-use-homepage-bhju390c.png)

[Browser Use](https://browser-use.com/) is een opensourceframework (MIT-licentie, ongeveer 117.000 GitHub-sterren) waarmee een AI-model een browser kan bedienen: de pagina lezen, de volgende klik bepalen en doorgaan tot de taak klaar is. De cloudversie voegt stealthbrowsers en proxy’s toe. De [README van het project](https://github.com/browser-use/browser-use) raadt die aan om botdetectie en CAPTCHA’s te verminderen.

**Prijs:** de library is gratis. Cloudbrowsers kosten $0,02 per uur en residential proxies $5 per GB. De beheerde agents brengen de kosten van het AI-model plus 20% in rekening. In aanmerking komende nieuwe accounts krijgen $15 aan credits die niet verlopen.

**Het meest geschikt voor:** taken met meerdere stappen die je in gewone taal beschrijft, zoals ‘zoek de drie goedkoopste leveranciers en vul hun offerteformulieren in’. **Let op:** elke stap is een modelaanroep. Een taak van 40 stappen met een groot model kost veel meer dan alleen de browseruren.

## Op grote schaal blokkades omzeilen: Bright Data

![Homepage van Bright Data, een webdataplatform met scraper-API’s, browsers voor het omzeilen van blokkades en meer dan 400 miljoen proxy-IP’s](https://crevio.co/vite/assets/bright-data-homepage-hacggvko.png)

[Bright Data](https://brightdata.com/) is de zwaargewicht. Het verkoopt proxy’s van naar eigen zeggen meer dan 400 miljoen IP-adressen, een unblocker-API die CAPTCHA’s oplost en identiteiten wisselt, externe browsers, kant-en-klare scraper-API’s en vooraf verzamelde datasets. De Web MCP-server geeft agents zoeken, scrapen en browsen via één verbinding.

**Prijs:** Web MCP heeft een gratis versie met 5.000 aanvragen per maand, zonder creditcard. Web Unlocker kost $1,50 per 1.000 aanvragen. Je betaalt alleen voor geslaagde aanvragen en kunt bestedingslimieten instellen, volgens de [prijspagina](https://brightdata.com/pricing/web-unlocker).

**Het meest geschikt voor:** sites die hard tegenwerken, op volumes waarbij het slagingspercentage belangrijker is dan de prijs. **Let op:** de tool brengt je langs blokkades, dus jij moet bepalen of je daar wel hoort te zijn. Daarover hieronder meer.

## Hoe de kosten van webscraping met AI-agents oplopen

Niemand schrikt van een rekening omdat één pagina te duur was. Rekeningen vallen tegen omdat een agent één opdracht omzet in duizenden aanvragen. Dat gebeurt door vier vermenigvuldigers:

![Voorbeeld waarin de kosten in Firecrawl-credits oplopen van 1 credit voor één pagina tot 300.000 credits voor dagelijks crawlen met JSON-output](https://crevio.co/vite/assets/scraping-cost-multiplier-lrg3dbyh.svg)

- **Omvang:** ‘controleer hun prijzen’ wordt ‘crawl hun site’ wanneer de agent de prijspagina niet kan vinden
- **Formaat:** gestructureerde output kost vaak meerdere keren zoveel als platte tekst
- **Frequentie:** een dagelijkse geplande taak draait 30 keer per maand; elk uur is dat 720 keer
- **Pogingen opnieuw uitvoeren:** als een pagina mislukt, proberen agents het opnieuw, soms met een zwaardere tool. Browsertools rekenen bovendien bij elke stap de kosten van het denkwerk van het model aan

De oplossingen zijn niet spannend, maar wel effectief. Breng een site eerst in kaart voordat je gaat crawlen en scrape alleen pagina’s die zijn veranderd. Vraag alleen JSON op voor velden die je echt gebruikt. Zet een aanvraaglimiet in de taak (‘maximaal 50 pagina’s’) en stel de maandelijkse bestedingslimiet in die de meeste van deze tools bieden. Kies bovendien eerst voor zoeken: één zoekopdracht die pagin tekst teruggeeft, vervangt vaak tien fetches. Onze uitleg over [de gebruikskosten van AI-agents](/nl/blog/ai-agent-running-costs) behandelt de modelkant van dezelfde rekening.

## Geblokkeerde sites: wat betekent ‘anti-bot-afhandeling’ echt?

Sites blokkeren agents in verschillende lagen. Sommige controleren de user-agent en weigeren alles wat geen bekende browser is. Andere leveren pas inhoud nadat JavaScript is uitgevoerd. Weer andere beperken het aantal aanvragen per IP-adres, tonen CAPTCHA’s of vereisen een login. De tools hierboven beantwoorden elke laag met een zwaardere techniek: browserrendering, residential proxies, fingerprint-‘stealth’ en CAPTCHA-oplossing.

Voordat je voor de zwaarste variant betaalt, zijn twee dingen het weten waard.

**Sites slaan harder terug.** Sinds juli 2025 vraagt Cloudflare elk nieuw domein bij het aanmelden om te beslissen over toegang voor AI-crawlers. Het test bovendien een manier waarop eigenaren [crawlers per pagina kunnen laten betalen](https://blog.cloudflare.com/introducing-pay-per-crawl/). Het opt-inprogramma [AI Labyrinth](https://blog.cloudflare.com/ai-labyrinth/) gaat nog verder: bots die no-crawl-regels negeren, krijgen een eindeloos doolhof met door AI gegenereerde lokpagina’s voorgeschoteld. Een agent die daarin vastloopt, verbrandt credits aan het verzamelen van rommel — en niets in de output vertelt je dat dit is gebeurd. Controleer steekproefsgewijs wat er terugkomt.

**Een blokkade omzeilen is een keuze met gevolgen.** Een CAPTCHA of loginmuur is de manier waarop de eigenaar van de site nee zegt. Die omzeilen kan prima zijn — bijvoorbeeld bij een site die alle bots blokkeert maar openbare prijzen publiceert die je mag vergelijken — maar het kan ook precies de reden zijn waarom je wordt aangeklaagd, zoals het volgende gedeelte laat zien. De sterkste unblocker is veel minder vaak de juiste tool dan de marketing doet vermoeden.

## Is webscraping met AI-agents legaal?

Dit is geen juridisch advies. Het antwoord hangt af van je land, de site en de gegevens. Maar de belangrijkste grenzen zijn duidelijker dan vijf jaar geleden.

### robots.txt is een verzoek, geen slot

[RFC 9309](https://www.rfc-editor.org/rfc/rfc9309.html), de standaard achter robots.txt, zegt duidelijk dat de regels geen vorm van toegangsautorisatie zijn. Ze negeren is geen hacken. Het is echter wel bewijs van intentie als een geschil ooit voor de rechter komt, en gerenommeerde crawlers houden zich eraan. Het eenvoudige beleid: volg robots.txt tenzij je een specifieke reden hebt om dat niet te doen, en leg die reden vast.

### Openbare gegevens zijn geen ‘hacking’, maar servicevoorwaarden zijn wel een contract

De langlopende zaak hiQ Labs vs. LinkedIn viel in twee delen uiteen. Wat betreft de Amerikaanse anti-hackingwet oordeelde het Ninth Circuit in april 2022 dat het scrapen van [openbaar beschikbare pagina’s waarschijnlijk geen toegang ‘zonder toestemming’ is](https://www.jenner.com/en/news-insights/publications/client-alert-data-scraping-in-hiq-v-linkedin-the-ninth-circuit-reaffirms-narrow-interpretation-of-cfaa). Op contractgebied verloor hiQ alsnog, omdat het de voorwaarden van LinkedIn had geaccepteerd en nepaccounts gebruikte. De zaak eindigde in een vonnis tegen hiQ. We bespraken die uitkomst en waarom je een agent nooit LinkedIn moet laten scrapen in onze gids over [prospectlijsten maken met AI-agents](/nl/blog/build-prospect-lists-with-ai-agents).

De andere kant van de medaille kwam in januari 2024, toen een rechter in Meta vs. Bright Data oordeelde dat de voorwaarden van Facebook en Instagram [scrapen van openbare gegevens terwijl je bent uitgelogd niet verbieden](https://newmedialaw.proskauer.com/2024/01/24/california-court-issues-noteworthy-decision-on-breach-of-contract-claims-in-web-scraping-dispute/). De praktische regel uit beide zaken: **openbare pagina’s scrapen terwijl je bent uitgelogd is veel veiliger dan scrapen terwijl je bent ingelogd.** Zodra je agent inlogt, heeft die de voorwaarden van de site geaccepteerd.

### Omzeiling en auteursrecht

Feiten lezen is iets anders dan uitdrukkingsvormen kopiëren. Het Amerikaanse auteursrecht beschermt de manier waarop iets is geschreven, niet de [onderliggende feiten](https://www.law.cornell.edu/supremecourt/text/499/340). Prijzen, openingstijden of productspecificaties verzamelen is dus iets anders dan iemands artikelen opnieuw publiceren. Technische bescherming omzeilen brengt een eigen risico mee. In oktober 2025 [klaagde Reddit Perplexity en drie scrapingproviders aan](https://searchengineland.com/reddit-sues-perplexity-serpapi-scraping-google-463681). Reddit stelde dat IP-adressen rouleren en bots vermommen om blokkades te omzeilen in strijd was met de anti-omzeilingsregels van de DMCA. Die zaak loopt nog, maar de theorie richt zich rechtstreeks op ‘anti-bot-afhandeling’.

### Persoonsgegevens veranderen alles

Als de gegevens die je scrapt mensen identificeren, geldt de privacywet ongeacht hoe openbaar de pagina is. De Nederlandse privacytoezichthouder legde Clearview AI in 2024 een boete op van [€30,5 miljoen](https://www.autoriteitpersoonsgegevens.nl/en/current/dutch-dpa-imposes-a-fine-on-clearview-because-of-illegal-data-collection-for-facial-recognition) voor het opbouwen van een database met gescrapete foto’s zonder toestemming. Gegevens over bedrijven brengen minder risico mee; lijsten met personen vereisen een wettelijke grondslag, een doel en een plan voor verwijderingsverzoeken.

Met een beleid van vijf regels dek je het meeste scrapen door kleine bedrijven af:

1. Alleen openbare pagina’s, terwijl je bent uitgelogd, tenzij je een eigen account hebt en de voorwaarden het toestaan
2. Volg robots.txt en hanteer een bescheiden tempo: enkele aanvragen per minuut per site
3. Verzamel feiten, geen volledige artikelen of afbeeldingen om opnieuw te publiceren
4. Geen persoonsgegevens zonder duidelijke wettelijke grondslag
5. Als een site je blokkeert, kijk dan eerst of er een officiële API of datafeed is voordat je een unblocker gebruikt

## Welke webscrapingtool moet je agent gebruiken?

Begin bij de taak, niet bij het merk:

- **Vragen over het web beantwoorden:** Exa of Tavily. Beide hebben gratis versies die honderden zoekopdrachten per maand dekken
- **Specifieke pagina’s lezen die je al kent:** Jina Reader voor één pagina tegelijk; Firecrawl als je structuur of hele sites wilt
- **Een populair platform met een kant-en-klare scraper:** Apify, nadat je de voorwaarden van dat platform hebt gecontroleerd
- **Gratis en volledig onder eigen beheer:** Crawl4AI, als je iemand hebt om de tool te beheren
- **Logins, formulieren en klikken:** Browserbase als je code schrijft; Browser Use als je wilt dat de agent de stappen plant
- **Beschermde sites op grote schaal:** Bright Data, maar doe eerst je juridische huiswerk

Bij al deze opties ga je ervan uit dat je zelf een agent bouwt en de tools daarin koppelt. Wil je liever een agent die al een browser en een manier om het web te lezen heeft, dan is er een andere route.

## Hoe de agent van Crevio het web leest

![Homepage van Crevio, een AI-businessbuilder waarbij je beschrijft wat je wilt en AI het bouwt en uitvoert](https://crevio.co/vite/assets/crevio-homepage-lkh6c7o3.png)

[Crevio](https://crevio.co/) is een [AI-businessbuilder](/nl/blog/ai-business-builder): een AI-agent die het dagelijkse werk voor je bedrijf uitvoert, van je website en producten tot marketing en onderzoek. Voor het lezen van het web heeft de agent drie functies ingebouwd:

- **Websearch met bronverwijzingen.** De agent doorzoekt het web en geeft een antwoord met de links naar de bronnen. Die kan hij vervolgens openen en volledig lezen
- **Een paginareader.** De agent leest elke openbare URL als tekst, inclusief JSON-feeds, en zet pdf’s, Word-documenten en spreadsheets om in leesbare tekst. Hij identificeert zich als de agent van Crevio in plaats van zich voor te doen als de browser van een persoon
- **Een eigen computer met een echte browser.** Voor pagina’s die JavaScript, klikken, formulieren of een login vereisen, gebruikt de agent Chrome op zijn eigen computer. Je kunt het scherm live bekijken en logins blijven tussen chats bewaard. De agent kan een lijst pagina’s in een lus verwerken en de resultaten in een spreadsheet opslaan

Daarmee dekt Crevio de gearceerde hoek van de matrix en het ingelogd browsen dat de meeste kleine bedrijven nodig hebben voor hun eigen leveranciersportalen en dashboards. Een [geplande taak](/nl/blog/schedule-recurring-ai-agent-tasks) kan elke ochtend dezelfde controle uitvoeren, bijvoorbeeld van de prijzen van een concurrent of de voorraad van een leverancier.

En de eerlijke beperkingen:

- **Geen proxynetwerk of CAPTCHA-oplossing.** Als een site een CAPTCHA toont of om een code vraagt die naar je telefoon wordt gestuurd, geeft de agent je het live scherm zodat je die stap zelf kunt afronden. Opgeslagen wachtwoorden worden ingevuld zonder in de chat te verschijnen
- **De paginareader voert geen JavaScript uit.** Pagina’s die zichzelf in de browser opbouwen, kunnen leeg terugkomen. Daarvoor heb je de browser nodig, die langzamer is en meer credits gebruikt
- **Het is geen bulkcrawler.** Een paar honderd pagina’s is een redelijke taak. Tienduizenden pagina’s per dag zijn werk voor de gespecialiseerde tools hierboven
- **De agent controleert robots.txt of de voorwaarden van een site niet voor je.** Zet het beleid van vijf regels hierboven in de taakomschrijving
- **Onderzoek gebruikt AI-credits.** De 20 credits per maand van het gratis Starter-abonnement zijn bedoeld om de functie uit te proberen; voor regelmatige monitoring heb je een betaald abonnement nodig

Als een scrapingservice waarvoor je al betaalt in de catalogus met meer dan 3.000 integraties van Crevio staat, kun je die koppelen. Standaard vraagt de agent toestemming voordat hij iets wijzigt in een gekoppelde app.

## Veelgestelde vragen

### Wat is de beste webscrapingtool voor AI-agents?

Er is niet één beste tool, omdat ze verschillende taken uitvoeren. Voor onderzoeksvragen gebruik je een search-API zoals Exa of Tavily. Voor bekende pagina’s als schone tekst Firecrawl of Jina Reader. Voor logins en klikken een browsertool zoals Browserbase of Browser Use. Voor sterk beveiligde sites Bright Data. De meeste kleine bedrijven hebben alleen een zoektool en een paginareader nodig.

### Kunnen AI-agents websites scrapen die bots blokkeren?

Vaak wel. Tools met residential proxies, stealthbrowsers en CAPTCHA-oplossing komen langs de meeste blokkades. Of je dat ook moet doen, is een andere vraag: een blokkade is de manier waarop de eigenaar van de site nee zegt, en het omzeilen van technische beveiliging vormt de basis van lopende rechtszaken. Controleer eerst of er een officiële API of datafeed is.

### Is het legaal om met AI een website te scrapen?

Openbare pagina’s scrapen terwijl je bent uitgelogd brengt in de VS over het algemeen minder risico mee, na de uitspraken in hiQ en Meta vs. Bright Data. Het risico neemt toe wanneer je inlogt en voorwaarden accepteert die scrapen verbieden, technische blokkades omzeilt, auteursrechtelijk beschermd materiaal opnieuw publiceert of persoonsgegevens verzamelt. Privacywetten zoals de AVG gelden ook wanneer die gegevens openbaar zijn.

### Hoeveel kost webscraping met een AI-agent?

Licht gebruik is vaak gratis: de meeste tools in dit overzicht bevatten gratis maandelijkse credits. Betaalde abonnementen beginnen rond $16 tot $30 per maand. De werkelijke kosten hangen af van omvang, formaat en frequentie. Bij Firecrawl kost één pagina één credit, terwijl dagelijks crawlen van een site met 2.000 pagina’s en gestructureerde output kan oplopen tot 300.000 credits per maand.

## De conclusie

De juiste tool voor webscraping met AI-agents is de lichtste tool die de klus klaart. Zoek voordat je leest, lees voordat je crawlt en crawl voordat je een browser inzet. Dwingt een site je tot stealthproxies en CAPTCHA-oplossing, stop dan en vraag je af wat de site je daarmee probeert te vertellen. De beste scraper is degene die je nooit hoeft uit te leggen.

## Gerelateerde blogposts

- [Prospectlijsten maken met AI-agents (zonder je domein op het spel te zetten)](/nl/blog/build-prospect-lists-with-ai-agents)
- [Kosten van AI-agents: wat kost één agent echt per maand?](/nl/blog/ai-agent-running-costs)
- [Terugkerende taken voor AI-agents plannen die zonder jou worden uitgevoerd](/nl/blog/schedule-recurring-ai-agent-tasks)
