Två bottar, samma företag, två helt olika jobb
GPTBot och OAI-SearchBot kommer båda från OpenAI, och namnen liknar varandra tillräckligt för att de ofta behandlas som ett och samma problem i en robots.txt-fil. Det är de inte. GPTBot hämtar innehåll för att bygga framtida modeller – ett bakgrundsjobb som inte har någon enskild användare som väntar på resultatet där och då. OAI-SearchBot hämtar innehåll för att det behövs i ett svar som ska levereras nu, på samma sätt som en sökmotor hämtar en sida för att avgöra om den är relevant för en träff.
Skriver du en regel som ”blockera allt som innehåller GPT” för att du inte vill bidra gratis till träning av en framtida modell träffar regeln som regel båda – inte för att du bestämde dig för det, utan för att namnlikheten gjorde det till samma rad i konfigurationen.
Den tredje kategorin: användarinitierad hämtning
ChatGPT-User är varken en tränings- eller en bakgrunds-retrieval-bot. Den används när en faktisk användare, mitt i ett samtal, ber ChatGPT hämta eller läsa något direkt från en specifik sida. Detta är den mest direkta form av AI-trafik som finns – en människa väntar bokstavligen på just den här sidan just nu. Blockerar du den tillsammans med de två andra stoppar du inte bara ett bakgrundsjobb; du stoppar en intressent mitt i handlingen.
Samma mönster hos Anthropic, något enklare hos Google
Anthropic följer exakt samma tredelning som OpenAI: ClaudeBot till träning, Claude-SearchBot till retrieval, Claude-User till användarinitierad hämtning. Google har valt en enklare modell med två bottar i stället för tre: Googlebot täcker både klassisk indexering och retrieval-liknande hämtning, medan Google-Extended uteslutande är samtyckesreglaget för träning av Googles generativa modeller.
| Leverantör | Träning (bygger framtida modeller) | Retrieval (hämtar till ett svar nu) | Användarinitierad hämtning |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Google-Extended | Googlebot | — |
Missförståndet de flesta går på: Google-Extended och AI Overviews
Eftersom Google-Extended i praktiken har ”AI” i namnet (den styr användning till generativa AI-produkter) antar många att det är reglaget som avgör om deras sida kan dyka upp i AI Overviews. Det stämmer inte. Google har varit tydliga med att AI Overviews bygger på samma underliggande sökindex som vanlig Google-sökning, drivet av Googlebot – inte av samtycket i Google-Extended. Blockerar du bara Google-Extended ändrar du inte din närvaro i AI Overviews. Ska du bort därifrån måste du i stället styra den vanliga indexeringen via Googlebot, med de konsekvenser det får för hela din klassiska sökning också.
Beslutsmatris: vad vill du uppnå, och vad blockerar det faktiskt
Det finns inte ett rätt svar för alla webbplatser. Det som finns är fyra olika mål, och fyra olika uppsättningar bottar att blockera för vart och ett av dem:
| Vad du vill uppnå | Blockera | Släpp igenom |
|---|---|---|
| Mitt innehåll ska inte användas för att träna framtida modeller, men jag vill gärna bli citerad nu | GPTBot, ClaudeBot, Google-Extended | OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, Googlebot |
| Jag vill inte förekomma i AI-svar över huvud taget – ett medvetet val | Alla AI-bottar ovan, inklusive retrieval- och användarinitierade varianter | Inga – detta är en fullständig opt-out, inte en delvis |
| Jag vill ha bådadera: citeras nu och sannolikt också forma senare träning | Inga namngivna, verifierade AI-bottar | Alla AI-bottar ovan |
| Jag har begränsad serverkapacitet och vill bara stoppa oseriös/overifierad bottrafik | Allt som inte klarar reverse DNS- eller IP-verifiering, oavsett namn i user agent-strängen | Alla officiellt verifierade AI-bottar, oavsett vilken av de tre rollerna de har |
Varför namnet i user agent-strängen inte räcker
En HTTP-förfrågan skickar med sig en user agent-sträng som klienten själv väljer fritt – ingenting hindrar ett godtyckligt skript från att presentera sig som ”GPTBot” utan att vara det. För rena disallow-regler i robots.txt spelar detta inte så stor roll, eftersom oseriösa aktörer ändå inte bryr sig om robots.txt. Men i samma ögonblick som du bygger något som ger kända AI-crawlers en fördel – en rymligare rate limit, ett undantag i en geo-regel, åtkomst genom en annars strikt WAF – måste identiteten bekräftas med reverse DNS-uppslag mot förfrågans IP-adress, eller mot leverantörens officiellt publicerade IP-listor. Utan det undantaget är ”ge AI-crawlers fördelar” exakt samma öppning som ”ge alla som skriver rätt namn i ett textfält fördelar”.
Självkoll: läs din robots.txt högt
Självkoll. Öppna din robots.txt-fil och läs varje rad högt, en i taget. För varje rad: vet du varför den står där, och minns någon i organisationen vem som satte den och vad de försökte uppnå? En regel som ingen kan förklara syftet med är inte ett medvetet skydd – den är en tillfällighet som en dag blev stående, och som nu kanske kostar dig synlighet i precis de AI-svar där dina köpare letar efter dig.
Vanliga frågor
Om jag blockerar GPTBot, försvinner jag då från ChatGPT?
Är det fel att blockera alla AI-bottar med en regel för att slippa tänka på detta?
Betyder det att Googlebot inte kan användas till träning?
Hur vet jag att en förfrågan som utger sig för att vara GPTBot faktiskt är det?
Var detta till hjälp?
