AI-crawlers toestaan en sturen: robots.txt en llms.txt voor je therapie-praktijk
AI-zoekmachines lezen je site alleen als je hun crawlers toestaat. Dit artikel legt uit wat GPTBot, ClaudeBot, PerplexityBot, Google-Extended en Grok doen, hoe je ze toestaat via robots.txt en hoe llms.txt je content beter laat citeren.
Citeren: Ramos, M. (2025). AI-crawlers toestaan en sturen: robots.txt en llms.txt voor je therapie-praktijk. InnerBloom. Herzien op 1 augustus 2026. https://innerbloom-agency.com/kennisbank/ai-crawlers-toestaan-therapeut
Dit artikel hoort bij: Vindbaar Worden als Therapeut: Het Complete SEO Handboek
Hoofdgids: dit artikel is een onderdeel van SEO en GEO voor therapeuten, met het volledige fundament voor Google, Google AI Mode en de grote AI-modellen, plus onze eigen metingen met de aantallen erbij.
- +Therapeuten met een werkende website die zichtbaar willen zijn in AI-zoekmachines
- +Praktijken die net hun robots.txt of llms.txt nog niet hebben ingericht
- +Wie wil snappen welke crawler wat doet, zonder de techniek over te laten aan een ontwikkelaar
- -Wie zijn content juist wil beschermen tegen AI-training (kies dan bewust de tegenovergestelde route)
- -Therapeuten zonder eigen website (een Therapieland-profiel heb je geen robots.txt-controle over)
Veel websites blokkeren AI-crawlers zonder het door te hebben. Een standaard WordPress-installatie, een Squarespace-thema of een oude robots.txt uit 2022 kan ChatGPT, Claude en Perplexity domweg buitensluiten. Resultaat: je site bestaat voor klassieke Google nog wel, maar in een AI-antwoord wordt je nooit geciteerd. Dit artikel laat zien hoe je dat checkt en oplost.
Welke crawler doet wat
Niet elke AI-bot doet hetzelfde. Sommige crawlen voor training (je content wordt opgenomen in een toekomstig model), andere crawlen live voor zoekantwoorden. Je wilt ze meestal allebei toestaan, maar het is goed om het verschil te kennen.
OpenAI (ChatGPT)
GPTBot crawlt voor model-training. OAI-SearchBot crawlt live wanneer iemand in ChatGPT een vraag stelt waar web-search bij hoort. ChatGPT-User crawlt wanneer een gebruiker expliciet een URL deelt of bezoek vraagt. Voor zichtbaarheid in ChatGPT-antwoorden is OAI-SearchBot het belangrijkst.
Anthropic (Claude)
ClaudeBot crawlt voor model-training. anthropic-ai is de bredere bot-categorie. Claude-SearchBot en Claude-User crawlen live voor web-search en directe URL-opvragingen. Sinds 2025 gebruikt Claude actief web-search bij vragen waar dat nuttig is.
Perplexity
PerplexityBot crawlt voor zowel indexering als live antwoorden. Perplexity-User crawlt wanneer een gebruiker iets aanklikt. Perplexity is van alle engines de meest transparante in welke bronnen ze gebruiken.
Googlebot doet de klassieke indexering en bedient ook AI Overviews. Google-Extended is de aparte opt-in voor gebruik in Bard, Gemini en toekomstige AI-producten. Wil je in Gemini gevonden worden, sta dan Google-Extended expliciet toe.
xAI (Grok)
Grok is anders dan de rest: het is verweven met X (Twitter) en gebruikt Live Search om bij iedere vraag het actuele web op te halen. De crawler heet Grok (sommige bronnen zien ook GrokBot). Voor therapeut-praktijken betekent dit twee dingen: sta Grok expliciet toe in je robots.txt en zorg dat je content versheid uitstraalt (recente datum, regelmatige updates). Een actief en eerlijk X-profiel helpt bovendien, omdat Grok sociale signalen vanuit X zwaarder meeweegt dan andere engines.
Stap 1: check je huidige robots.txt
Type in je browser: jouwdomein.nl/robots.txt. Krijg je een 404 (niet gevonden), dan blokkeert je site niets en wordt iedereen toegelaten. Krijg je een bestand met Disallow regels, lees die dan goed door. Een regel als 'User-agent: GPTBot' gevolgd door 'Disallow: /' blokkeert ChatGPT volledig. Zoek naar regels voor GPTBot, ClaudeBot, PerplexityBot, Google-Extended en anthropic-ai.
Stap 2: sta de AI-crawlers expliciet toe
Voeg het volgende blok bovenaan je robots.txt toe (vervang of vul aan, maar laat geen tegengestelde Disallow staan):
User-agent: GPTBot: Allow: / | User-agent: OAI-SearchBot: Allow: / | User-agent: ChatGPT-User: Allow: / | User-agent: ClaudeBot: Allow: / | User-agent: anthropic-ai: Allow: / | User-agent: PerplexityBot: Allow: / | User-agent: Google-Extended: Allow: / | User-agent: Grok: Allow: / | User-agent: GrokBot: Allow: /. Sluit af met een Sitemap-regel die naar je sitemap.xml verwijst.
Een opmerking: deze allow-regels zijn een vriendelijk verzoek, geen technische barriere. Wie kwaad wil kan ze negeren. Het echte doel is dat de officiele crawlers van OpenAI, Anthropic, Perplexity, Google en xAI zien dat ze welkom zijn en niet vooraf afhaken.
Stap 3: voeg een llms.txt toe
llms.txt is een voorgesteld standaardformaat (zie llmstxt.org) dat een leesbare kaart van je site geeft aan AI-modellen. In tegenstelling tot sitemap.xml (puur URLs voor crawlers) bevat llms.txt korte beschrijvingen per pagina, gegroepeerd per thema. Een AI-model kan het in een halve seconde inlezen en weet meteen waar het wat moet zoeken.
Bouw llms.txt zo op: H1 met je praktijknaam, blockquote met een one-liner over wat je doet, korte intro-paragraaf, vervolgens H2-secties (bijvoorbeeld Diensten, Werkwijze, Veelgestelde vragen, Kennisbank) met daaronder een bullet-lijst van markdown-links met een korte uitleg per stuk. Plaats het bestand op jouwdomein.nl/llms.txt.
Stap 4: test of je echt vindbaar bent
Wacht een week (crawlers hebben tijd nodig om de nieuwe regels te zien) en test dan in Perplexity, Claude, ChatGPT en Grok (op X) een zoekvraag die je clienten ook zouden stellen. Wordt je geciteerd? Zo niet, kijk dan eerst of de hierboven genoemde crawlers nog ergens anders in je site geblokkeerd staan (CDN-instellingen, Cloudflare-firewall, Vercel-configuratie kunnen alsnog blokkeren ondanks een correcte robots.txt).
Wanneer je juist NIET wilt dat AI je content gebruikt
Een eerlijke kanttekening: er zijn therapeuten die principieel niet willen dat hun werk in AI-training belandt. Bijvoorbeeld omdat ze waarde hechten aan menselijk-tot-menselijk contact, of omdat ze betaalde content beschermen. In dat geval blokkeer je GPTBot, ClaudeBot, Google-Extended en Grok (training-bots) maar laat je OAI-SearchBot, Claude-SearchBot en PerplexityBot toe. Zo blijf je vindbaar in AI-antwoorden, maar wordt je content niet opgenomen in toekomstige modellen. Let wel: Grok haalt content vooral live op, dus volledig blokkeren betekent ook geen citaties in Grok-antwoorden.
Je zei ja tegen AI-crawlers. Zegt je host dat ook?
Dit is de laag die bijna niemand controleert. Je robots.txt kan perfect staan en toch komt er geen enkele AI-crawler binnen. Want robots.txt is een verzoek aan de bot, terwijl je hosting, CDN of firewall een deur is die daadwerkelijk open of dicht staat. Staat die deur dicht, dan leest de crawler je robots.txt nooit. Hij krijgt een 403 of een captcha en gaat weer weg.
Het effect is vervelend precies omdat het onzichtbaar is: in Google blijf je gewoon staan, je site voelt gezond, en in ChatGPT of Perplexity besta je niet. Er is geen melding, geen waarschuwing, geen rood vinkje.
Wat er sinds 1 juli 2026 anders is
Cloudflare zette AI-crawler-blocking per 1 juli 2026 standaard aan voor nieuwe domeinen. Dat is beleidsmatig te begrijpen, want het geeft site-eigenaren onderhandelingsmacht over hun content. Maar voor een therapiepraktijk die juist gevonden wil worden in AI-antwoorden werkt het tegen je, en het gebeurt zonder dat je er iets voor doet. Ook bij andere partijen zie je vergelijkbare bot-management-standaarden: managed WordPress-hosting met bot-protectie, Vercel en Netlify met firewall-regels, en securityplugins die alles blokkeren wat geen browser lijkt.
De check van tien minuten
- Open je hostingpaneel of Cloudflare-dashboard en zoek naar Bot Management, AI Crawler Control, AI Scrapers, of Super Bot Fight Mode. Staat daar iets op blokkeren, zet de AI-crawlers die je wilt toelaten op toestaan.
- Controleer de firewall- of WAF-regels op ruime patronen zoals blokkeren op user-agent of op datacenter-IP. Die vangen GPTBot en PerplexityBot mee zonder ze bij naam te noemen.
- Vraag om je serverlogs of accesslog van de afgelopen dertig dagen en zoek op GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot en Google-Extended. Nul hits terwijl je robots.txt ze toestaat is het bewijs dat de blokkade een laag hoger zit.
- Kijk naar de statuscodes bij die hits. Een 200 is goed. Een 403, 429 of een challenge-pagina betekent dat de crawler wel aanklopte en werd tegengehouden.
- Heb je een securityplugin op WordPress, controleer dan of die een eigen bot-blocklist heeft. Zet de AI-crawlers daar expliciet op de whitelist.
- Test na de aanpassing met een simpele opdracht aan ChatGPT of Perplexity: laat een concrete pagina van je site samenvatten. Kan het model de pagina niet openen, dan is er nog een deur dicht.
Deze check hoort thuis in je kwartaalonderhoud, niet in je eenmalige opleverlijst. Bot-beleid bij hosts en CDN's verandert zonder aankondiging, en een migratie of een nieuw securitypakket kan de deur opnieuw sluiten.
Wat je vastlegt zodra het werkt
Schrijf op welke crawlers je bewust toelaat, waar dat is ingesteld (robots.txt, CDN, firewall, plugin) en wanneer je het voor het laatst hebt gecontroleerd. Zo hoeft niemand, ook je webbouwer niet, later te gokken of een blokkade een keuze was of een standaardinstelling.
Verder lezen
Dit artikel is onderdeel van de pillar Vindbaar Worden als Therapeut. Voor de inhoudelijke kant van vindbaarheid lees je E-E-A-T voor zorgcontent. Wil je daarna ook meten of het werkt, kijk dan naar AI-citaties meten. En zorg dat je niet per ongeluk afgestraft wordt door GEO-fouten vermijden door te lezen.
Google's officiële resources voor AI-optimalisatie
Google Search Central publiceerde in juli 2026 een set officiële resources over optimaliseren voor generatieve AI, inclusief het nieuwe Generative AI-prestatierapport in Search Console. Voor je crawler-instellingen betekent dat: naast toegang toestaan moet je nu ook kunnen laten zien wat het oplevert.
- Combineer je robots.txt-instellingen met een maandelijkse check van het Generative AI-rapport in Search Console. Zie je geen impressies terwijl je crawlers wel toestaat? Dan zit het probleem in structuur of autoriteit, niet in toegang.
- Google's officiële gids benadrukt: alleen toestaan is niet genoeg als je content niet indexeerbaar en canoniek helder is. Controleer per pagina dat er één canonical is en dat de kop de zoekvraag beantwoordt.
- Overweeg logbestanden van je hosting één keer per kwartaal te laten scannen op crawler-hits van GPTBot, ClaudeBot, PerplexityBot en Google-Extended. Dat vertelt je of je toegang praktisch werkt, niet alleen op papier.
Wil je zien welke zoekwoorden cliënten in jouw stad gebruiken?
Het Cliënt Kompas geeft je in 5 minuten een live overzicht van zoekvolumes en drukte op zoektermen voor jouw praktijk.
Start het Cliënt KompasGerelateerde pagina's
Verder lezen in deze pilaar
Veelgestelde vragen
Moet ik mijn robots.txt zelf bewerken of doet mijn webbouwer dat?
Op WordPress kun je het meestal zelf via een SEO-plugin (Yoast, Rank Math). Op Squarespace en Wix kan robots.txt deels via instellingen. Bij een custom site of als je twijfelt: vraag je webbouwer om de drie blokken hierboven toe te voegen. Het is een wijziging van een minuut.
Is een llms.txt verplicht?
Nee. Het is een voorgesteld standaardformaat dat steeds meer AI-modellen gebruiken, maar het is geen officiele W3C-standaard. We zien dat sites met een goed gestructureerde llms.txt meetbaar vaker geciteerd worden, dus de moeite is laag en het rendement positief.
Wat gebeurt er als ik niets doe?
Als je robots.txt nu geen Disallow-regels voor AI-crawlers bevat, ben je waarschijnlijk al toegankelijk. Maar zonder llms.txt en zonder expliciete Allow-regels mis je het signaal dat je content welkom is om geciteerd te worden. Op korte termijn geen drama, op middellange termijn een gemiste kans.
Kan ik later nog van mening veranderen?
Ja. robots.txt en llms.txt zijn live wijzigbaar. Voeg een Disallow toe en de meeste crawlers respecteren dat binnen een week. Let wel: content die al in een AI-model is opgenomen blijft daar zitten tot het model opnieuw getraind wordt. Daarom is het beter om de keuze nu bewust te maken.
Waarom is Grok anders dan ChatGPT, Claude of Perplexity?
Grok van xAI is verweven met X (Twitter) en gebruikt Live Search om bij elke vraag het actuele web op te halen. Twee dingen tellen daardoor extra zwaar: versheid van je content (recente datum, regelmatige updates) en je aanwezigheid op X. Voor therapeut-praktijken die niet op X actief zijn, blijft de winst beperkt; voor wie wel rustig en eerlijk op X deelt, kan Grok een groeiend kanaal worden.
Mijn robots.txt staat goed, waarom word ik nog niet geciteerd in ChatGPT?
Een veelvoorkomende oorzaak is dat je hosting, CDN of firewall de crawler al tegenhoudt voordat robots.txt gelezen wordt. Controleer Bot Management of AI Crawler Control in je hostingpaneel en zoek in je serverlogs op GPTBot, OAI-SearchBot en PerplexityBot. Nul hits of alleen 403-codes wijst op een blokkade een laag hoger dan robots.txt.
Wat veranderde er op 1 juli 2026 bij Cloudflare?
Cloudflare zette AI-crawler-blocking standaard aan voor nieuwe domeinen. Wil je vindbaar zijn in AI-antwoorden, dan moet je die instelling zelf aanpassen. Je robots.txt overschrijft de blokkade niet, want de crawler komt niet zover.
Hoe vaak moet ik deze host-check doen?
Eén keer per kwartaal, plus altijd na een migratie, een nieuwe securityplugin of een wijziging van je hostingpakket. Bot-beleid verandert zonder dat je een melding krijgt.