Reranking är det andra steget i hur en AI väljer vilka källor som faktiskt ska användas i ett svar. Efter att ett snabbt första steg har hämtat in en bred hög möjliga källor ger en egen, mer precis modell var och en av dem en ny relevanspoäng och sorterar om dem. Kort sagt: hämtningen hittar kandidaterna, reranking bestämmer ordningen — och bara toppen når fram till svaret.
Varför hämtningen delas i två steg
Detta handlar om en avvägning mellan fart och precision. Den första sökningen använder embeddings och en vektordatabas för att hitta kandidater blixtsnabbt bland miljontals dokument — men målet där är att inte missa något relevant, inte att rangordna perfekt. Därför hämtar den gärna 50–100 kandidater som ligger ungefär i rätt område. Reranking tar sedan bara denna lilla hög och använder en tyngre modell på var och en för att avgöra den verkliga relevansen. Att köra den tunga modellen på hela databasen vore alldeles för långsamt; att köra den på 100 kandidater är överkomligt. Detta mönster kallas tvåstegshämtning.
Hur reranking fungerar
Rerankers är i regel cross-encoders. Där den snabba vektorsökningen embeddar fråga och dokument var för sig och jämför dem i efterhand, läser en cross-encoder frågan och kandidattexten samtidigt och ger ut en relevanspoäng för paret. Eftersom den ser båda texterna på en gång fångar den upp nyanser i sammanhanget — vilken av två skenbart lika bitar som faktiskt svarar på det som frågades. Det gör den långsam men precis, och det är just därför den används sist, på en liten hög. Kommersiella rerankers som Cohere Rerank är vanliga val i produktion.
Varför det spelar roll för AI-synlighet
Här ligger den viktigaste lärdomen: att bli hämtad räcker inte — du måste överleva reranking. Ditt innehåll kan mycket väl hamna i den första högen på 100 kandidater, men om en konkurrent svarar mer precist och direkt på själva frågan sorteras du ned under reranking och når aldrig fram till svaret. Två bitar kan ligga lika nära frågan i embedding-rummet, men rerankern väljer den som besvarar frågan mest precist. Därför räcker det inte att vara ”i närheten” av ämnet — du måste träffa frågan.
Hur du själv kan använda detta
Skriv så att varje stycke besvarar en konkret fråga direkt och fullständigt, utan att läsaren måste leta. Lägg svaret först (BLUF), använd det språk frågan faktiskt ställs i, och undvik att packa in det viktigaste i långa, allmänna stycken. Ju mer precist en chunk svarar på frågan, desto bättre klarar den sig genom reranking. CitationLab Monitor med Chunkalyzer hjälper dig att se vilka stycken som är relevanta nog att klara sig — och vilka som hämtas men sorteras bort. Vill du veta om ditt innehåll överlever reranking i dag? Börja med en genomgång av din AI-synlighet.
Vanliga frågor
Vad är reranking i RAG?
Varför behövs reranking när man redan har hämtat källor?
Vad är en cross-encoder?
Vad betyder reranking för AI-synlighet?
Begrepp som används i artikeln
- Reranking
- Reranking är andra steget i en RAG-pipeline, där de hämtade kandidaterna får en mer precis relevanspoäng och sorteras om innan modellen svarar. Bara de högst rangordnade når fram till svaret.
- Cross-encoder
- En cross-encoder är en modell som läser fråga och kandidattext samtidigt och ger ut en precis relevanspoäng för paret. Den är långsammare men mer träffsäker än vektorsökning, och används därför till reranking av en liten hög kandidater.
- Tvåstegshämtning
- Tvåstegshämtning är mönstret där ett snabbt första steg hämtar en bred hög kandidater, och ett långsammare, mer precist andra steg (reranking) sorterar om dem innan svaret genereras.
Var detta till hjälp?
