Hoppa till innehåll
CitationLab
Tillbaka till Mätning och verktyg
Tysta citeringstjuvar

GPTBot vs OAI-SearchBot – branschens dyraste missförstånd

Två bottar, två helt olika syften. GPTBot bygger framtida modeller. OAI-SearchBot hämtar innehåll som ska citeras i ett svar just nu. De flesta som tror att de har skyddat sitt innehåll genom att blockera ”AI-crawlers” under ett har egentligen bara gjort sig osynliga.

KR
Krister Ross
Grundare och VD, CitationLab
Publicerad 4 min läsning
Vet du om dina AI-crawlers faktiskt kommer igenom?Kör en gratis synlighetskoll

Två bottar, samma företag, två helt olika jobb

GPTBot och OAI-SearchBot kommer båda från OpenAI, och namnen liknar varandra tillräckligt för att de ofta behandlas som ett och samma problem i en robots.txt-fil. Det är de inte. GPTBot hämtar innehåll för att bygga framtida modeller – ett bakgrundsjobb som inte har någon enskild användare som väntar på resultatet där och då. OAI-SearchBot hämtar innehåll för att det behövs i ett svar som ska levereras nu, på samma sätt som en sökmotor hämtar en sida för att avgöra om den är relevant för en träff.

Skriver du en regel som ”blockera allt som innehåller GPT” för att du inte vill bidra gratis till träning av en framtida modell träffar regeln som regel båda – inte för att du bestämde dig för det, utan för att namnlikheten gjorde det till samma rad i konfigurationen.

Den tredje kategorin: användarinitierad hämtning

ChatGPT-User är varken en tränings- eller en bakgrunds-retrieval-bot. Den används när en faktisk användare, mitt i ett samtal, ber ChatGPT hämta eller läsa något direkt från en specifik sida. Detta är den mest direkta form av AI-trafik som finns – en människa väntar bokstavligen på just den här sidan just nu. Blockerar du den tillsammans med de två andra stoppar du inte bara ett bakgrundsjobb; du stoppar en intressent mitt i handlingen.

Samma mönster hos Anthropic, något enklare hos Google

Anthropic följer exakt samma tredelning som OpenAI: ClaudeBot till träning, Claude-SearchBot till retrieval, Claude-User till användarinitierad hämtning. Google har valt en enklare modell med två bottar i stället för tre: Googlebot täcker både klassisk indexering och retrieval-liknande hämtning, medan Google-Extended uteslutande är samtyckesreglaget för träning av Googles generativa modeller.

LeverantörTräning (bygger framtida modeller)Retrieval (hämtar till ett svar nu)Användarinitierad hämtning
OpenAIGPTBotOAI-SearchBotChatGPT-User
AnthropicClaudeBotClaude-SearchBotClaude-User
GoogleGoogle-ExtendedGooglebot
Samma tredelning återkommer hos alla tre: en bot för träning, en för hämtning till ett svar, och (hos OpenAI och Anthropic) en för hämtning som initieras direkt av en väntande användare. Google slår ihop retrieval och indexering i Googlebot och bryter bara ut träning som eget samtycke.

Missförståndet de flesta går på: Google-Extended och AI Overviews

Eftersom Google-Extended i praktiken har ”AI” i namnet (den styr användning till generativa AI-produkter) antar många att det är reglaget som avgör om deras sida kan dyka upp i AI Overviews. Det stämmer inte. Google har varit tydliga med att AI Overviews bygger på samma underliggande sökindex som vanlig Google-sökning, drivet av Googlebot – inte av samtycket i Google-Extended. Blockerar du bara Google-Extended ändrar du inte din närvaro i AI Overviews. Ska du bort därifrån måste du i stället styra den vanliga indexeringen via Googlebot, med de konsekvenser det får för hela din klassiska sökning också.

Beslutsmatris: vad vill du uppnå, och vad blockerar det faktiskt

Det finns inte ett rätt svar för alla webbplatser. Det som finns är fyra olika mål, och fyra olika uppsättningar bottar att blockera för vart och ett av dem:

Vad du vill uppnåBlockeraSläpp igenom
Mitt innehåll ska inte användas för att träna framtida modeller, men jag vill gärna bli citerad nuGPTBot, ClaudeBot, Google-ExtendedOAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, Googlebot
Jag vill inte förekomma i AI-svar över huvud taget – ett medvetet valAlla AI-bottar ovan, inklusive retrieval- och användarinitierade varianterInga – detta är en fullständig opt-out, inte en delvis
Jag vill ha bådadera: citeras nu och sannolikt också forma senare träningInga namngivna, verifierade AI-bottarAlla AI-bottar ovan
Jag har begränsad serverkapacitet och vill bara stoppa oseriös/overifierad bottrafikAllt som inte klarar reverse DNS- eller IP-verifiering, oavsett namn i user agent-strängenAlla officiellt verifierade AI-bottar, oavsett vilken av de tre rollerna de har
Välj raden som matchar vad du faktiskt försöker uppnå, inte en generisk ”blockera all AI”-regel som gör valet åt dig utan att du bett om det.

Varför namnet i user agent-strängen inte räcker

En HTTP-förfrågan skickar med sig en user agent-sträng som klienten själv väljer fritt – ingenting hindrar ett godtyckligt skript från att presentera sig som ”GPTBot” utan att vara det. För rena disallow-regler i robots.txt spelar detta inte så stor roll, eftersom oseriösa aktörer ändå inte bryr sig om robots.txt. Men i samma ögonblick som du bygger något som ger kända AI-crawlers en fördel – en rymligare rate limit, ett undantag i en geo-regel, åtkomst genom en annars strikt WAF – måste identiteten bekräftas med reverse DNS-uppslag mot förfrågans IP-adress, eller mot leverantörens officiellt publicerade IP-listor. Utan det undantaget är ”ge AI-crawlers fördelar” exakt samma öppning som ”ge alla som skriver rätt namn i ett textfält fördelar”.

Självkoll: läs din robots.txt högt

Självkoll. Öppna din robots.txt-fil och läs varje rad högt, en i taget. För varje rad: vet du varför den står där, och minns någon i organisationen vem som satte den och vad de försökte uppnå? En regel som ingen kan förklara syftet med är inte ett medvetet skydd – den är en tillfällighet som en dag blev stående, och som nu kanske kostar dig synlighet i precis de AI-svar där dina köpare letar efter dig.

Vanliga frågor

Om jag blockerar GPTBot, försvinner jag då från ChatGPT?
Inte nödvändigtvis. GPTBot samlar data till träning av framtida modeller. Om ChatGPT citerar dig i ett svar just nu beror i stället på retrieval-botten OAI-SearchBot och på användarinitierad hämtning via ChatGPT-User. Blockerar du bara GPTBot och släpper igenom de två andra kan du fortfarande bli citerad i svar, även om du har reserverat dig mot att bidra till framtida träning.
Är det fel att blockera alla AI-bottar med en regel för att slippa tänka på detta?
Det är inte fel, men det är ett medvetet val med en konsekvens du bör känna till: du blir fullständigt osynlig i AI-genererade svar, inte bara skyddad från träning. För vissa webbplatser är det rätt val. För de flesta som vill bli hittade och citerade är det ett mycket dyrare beslut än de trodde att de fattade när de klistrade in en generisk ”disallow AI”-regel.
Betyder det att Googlebot inte kan användas till träning?
Google har brutit ut samtycket till att använda innehåll för träning av sina generativa AI-produkter i en egen bot, Google-Extended, just för att hålla det åtskilt från klassisk indexering och sök. Googlebot själv är inte opt-in/opt-out-mekanismen för träning – det jobbet gör Google-Extended. Blockerar du bara Google-Extended påverkar du inte din närvaro i vanlig Google-sökning.
Hur vet jag att en förfrågan som utger sig för att vara GPTBot faktiskt är det?
User agent-strängen i en HTTP-förfrågan är ren text som avsändaren själv bestämmer – vem som helst kan sätta den till ”GPTBot” utan att vara GPTBot. Ska du bygga regler som litar på vem botten är (till exempel en rymligare rate limit för verifierade AI-crawlers) måste du bekräfta identiteten med reverse DNS-uppslag eller mot leverantörens officiellt publicerade IP-listor, inte bara läsa namnet i strängen.

Var detta till hjälp?

Dela:

Hold deg oppdatert

Få fagartikler, produktnyheter og analyser rett i innboksen.