Een AI-assistent zoals ChatGPT, Claude of Perplexity kan je pagina alleen als bron noemen als die assistent de pagina eerst kan ophalen. Dat klinkt vanzelfsprekend. Toch kan een regel in robots.txt, een instelling in je firewall of een vergeten meta-tag ervoor zorgen dat je site voor AI-assistenten onzichtbaar is, terwijl dezelfde site in Google gewoon goed scoort. Met een paar controles zie je snel of dat bij jou speelt.

Daarna komt de tweede vraag: als een assistent je site kan lezen, vindt die assistent er dan iets om te noemen? Ook daar lees je hieronder meer over.

Zoekbots en trainingsbots zijn verschillende bots

ChatGPT, Claude en Perplexity halen pagina's op met een eigen zoekbot: OAI-SearchBot, Claude-SearchBot en PerplexityBot. Voor het trainen van taalmodellen gebruiken OpenAI en Anthropic andere bots, namelijk GPTBot en ClaudeBot. Dat onderscheid is handig. Wil je niet dat je teksten worden gebruikt om modellen te trainen, dan blokkeer je de trainingsbots en laat je de zoekbots toe. Zo kun je in ChatGPT en Claude als bron verschijnen zonder je content voor training af te staan.

In robots.txt ziet dat er zo uit:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Staat er in je huidige robots.txt een algemene regel als User-agent: * met Disallow: /, dan sluit je alle bots uit die geen eigen regel hebben, ook de zoekbots van AI-assistenten.

Kijk verder dan robots.txt

Firewall, hosting en CDN. Een bot die robots.txt mag lezen, kan alsnog worden tegengehouden door een firewall of een instelling voor botbescherming bij je hosting of CDN. Kijk in je serverlogs welke statuscode deze bots krijgen. Een 403 betekent dat er iets tussen zit.

Meta-tags voor fragmenten. Met nosnippet of max-snippet beperk je wat Google in AI-overzichten mag gebruiken. Bij Bing, waar Microsoft Copilot zijn bronnen vandaan haalt, zorgt NOARCHIVE ervoor dat Copilot je content niet gebruikt. NOCACHE beperkt Copilot tot de URL, de titel en het fragment. NOCACHE heeft overigens niets met je browsercache te maken, ook al doet de naam dat vermoeden. Zulke tags blijven soms achter van een oude plugin, dus kijk in de broncode van een paar pagina's wat je site werkelijk uitstuurt.

Bing Webmaster Tools. Omdat Copilot de index van Bing gebruikt, is het de moeite waard om je site daar aan te melden als je dat nog niet gedaan hebt.

Een wijziging werkt niet meteen

Ook crawlers bewaren dingen in een cache. Google bewaart de inhoud van robots.txt volgens de eigen documentatie doorgaans tot 24 uur voordat het bestand opnieuw wordt opgehaald, en bij time-outs of serverfouten soms langer. Andere crawlers hanteren hun eigen termijn. Daarna moet een pagina ook nog opnieuw bezocht worden. Pas je vandaag iets aan, verwacht het effect dan niet morgen in een AI-antwoord.

Andere bestanden in de root van je site

Robots.txt is niet het enige bestand dat op een vaste plek op je domein staat. In dit verband kom je er nog twee tegen.

llms.txt. Dit bestand werd in 2024 voorgesteld als een soort inhoudsopgave voor taalmodellen: een markdownbestand op /llms.txt met een korte beschrijving van je site en links naar de belangrijkste pagina's. Het is een voorstel en geen vastgelegde standaard. Google zegt dat je geen speciale AI-bestanden nodig hebt om in AI-overzichten te verschijnen. Een llms.txt maken kost weinig tijd, maar verwacht er geen wonderen van. De controles hierboven doen meer.

security.txt. Dit bestand heeft niets met AI te maken, maar werkt volgens hetzelfde idee als robots.txt: een vaste plek, een vast formaat, en leesbaar voor zowel mensen als scripts. In /.well-known/security.txt staat hoe iemand een beveiligingsprobleem bij je organisatie kan melden. Het formaat is vastgelegd in RFC 9116, en alleen een contactadres en een vervaldatum zijn verplicht. Ben je toch met de bestanden van je site bezig, dan is dit er een die je in een paar minuten toevoegt. Wat erin hoort en wat er in de praktijk misgaat, lees je in dit artikel over hoe je security.txt goed instelt.

Geef de assistent iets om te noemen

Met de controles hierboven kan een AI-assistent je site lezen. Of de assistent je pagina daarna ook als bron kiest, hangt af van de inhoud.

Een assistent werkt anders dan een gewone zoekmachine. Een vraag als "welke warmtepomp past bij een huis uit de jaren dertig?" splitst de assistent op in meerdere zoekopdrachten, en daarna kiest de assistent de pagina's die op die deelvragen het beste antwoord geven. In onderzoek van Ahrefs stond maar 12% van de pagina's die ChatGPT, Gemini, Copilot en Perplexity als bron noemden in de top 10 van Google voor dezelfde vraag. Een artikel dat een smalle vraag grondig beantwoordt, kan dus als bron verschijnen zonder dat het op de hoofdvraag hoog staat.

Wat zo'n artikel nodig heeft, is niet ingewikkeld:

Een vraag per pagina. Een artikel dat vijf vragen half beantwoordt, levert zelden een passage op die een assistent goed kan overnemen.

Het antwoord bovenaan. Zet direct onder de titel een kort antwoord, en daarna de uitleg. Een assistent zoekt een passage die de vraag beantwoordt. Staat die passage pas na drie alinea's aanloop, dan kiest de assistent eerder een pagina die meteen ter zake komt.

Iets wat alleen jij weet. Een taalmodel kan zelf uitleggen wat een warmtepomp is. Een bron zoekt het model voor wat het model niet weet: welke fout een installateur bij oplevering vaak ziet, of wat een regeling in de praktijk betekent.

Een bron bij elke bewering. Een assistent die een bewering overneemt, heeft liever een pagina die laat zien waar die bewering vandaan komt.

Hoe je zulke pagina's opbouwt en waar ChatGPT, Claude, Perplexity en Copilot van elkaar verschillen, lees je in dit artikel over gevonden worden door AI.

Eén goed artikel is niet genoeg

Als een assistent kiest op deelvragen, heb je meer aan tien artikelen over tien specifieke vragen dan aan één lang stuk dat alles probeert te dekken. Elk artikel dat een eigen vraag beantwoordt, is een extra kans om genoemd te worden. Vooraf weet je niet welk artikel die kans krijgt. Ahrefs onderzocht ongeveer 14 miljard pagina's en zag dat 96,55% daarvan geen enkele bezoeker uit Google krijgt. Een deel van je artikelen levert dus weinig op, en welk deel zie je pas achteraf.

Dat betekent niet dat je elke dag moet publiceren. Google heeft gezegd dat een vaste publicatiefrequentie op zichzelf niet helpt om hoger te komen. Wat wel helpt, is dat er regelmatig een artikel bijkomt dat een vraag van je klanten goed beantwoordt. Voor een bedrijf zonder eigen redactie is een artikel per week of per twee weken vaak een haalbaar ritme. Hoe je dat ritme kiest en volhoudt, lees je in hoe vaak moet je bloggen om gevonden te worden.

Begin bij de techniek

De technische controle doe je een keer, en daarna hoef je er alleen bij een nieuwe plugin of een andere hosting opnieuw naar te kijken. Begin daar. Een artikel dat een assistent niet kan ophalen, wordt ook niet genoemd, hoe goed het ook is.