Hvad betyder Contextual retrieval?
Contextual retrieval er her betegnelsen for den metode, Anthropic beskriver, hvor hvert dokumentuddrag får en kort, specifik kontekstforklaring. Forklaringen placerer uddraget i det større dokument, før teksten bruges til embeddings og eventuelt ordsøgning.
Et isoleret afsnit kan indeholde “denne ordning” uden at nævne ordningens navn. Hvis navnet kun står flere sider tidligere, kan uddraget være svært at finde gennem et selvstændigt søgespørgsmål. En korrekt kontekstforklaring kan gøre forbindelsen synlig i det indekserede materiale.
Den ekstra tekst er afledt materiale. Hvis den genereres af en model, kan den være forkert eller for bred. Den bør derfor ikke erstatte originalen eller behandles som en ny autoritativ kilde. Dens værdi skal vurderes gennem de spørgsmål, vidensbasen faktisk skal besvare.
Tilføj det, uddraget behøver for at stå alene
En generisk sammenfatning af hele dokumentet er ikke nødvendigvis nyttig ved alle afsnit. Konteksten bør forklare netop det enkelte uddrags emne, relevante enhed og afgrænsning uden at drukne teksten i ekstra information.
Bevar en tydelig forskel mellem originaltekst og den tilføjede forklaring. Det gør det muligt at kontrollere en fejl og vise læseren det faktiske kildeafsnit. En kildehenvisning bør pege på originalen frem for alene på modellens beskrivelse af den.
Afledt kontekst skal følge dokumentets ændringer
Når originalen ændres, kan forklaringen blive forældet, selv om selve uddraget stadig ligner sig selv. En ny definition tidligere i dokumentet kan eksempelvis ændre, hvad et senere “denne løsning” henviser til.
Planlæg derfor genberegning og versionskobling. Test metoden mod en enklere løsning, hvor overskrift og eksisterende metadata følger uddraget. Hvis disse oplysninger allerede løser problemet, er genereret kontekst måske unødvendig. Mere forbehandling er kun værdifuld, hvis den forbedrer det relevante kildegrundlag.
Et eksempel fra praksis
En kursusudbyder har et langt dokument med flere undervisningsforløb. Et afsnit beskriver “materialerne til anden dag”, mens forløbets navn står i kapiteloverskriften. En prototype tilføjer en kort kontekst med det korrekte forløb og dag.
Teamet sammenligner søgning med originaltekst, med almindelig overskriftsmetadata og med den genererede kontekst. Et testspørgsmål handler om et andet forløb med samme ordvalg. Den ekstra forklaring skal hjælpe med adskillelsen og må ikke få materialer fra de to forløb til at blive blandet sammen.
Typiske faldgruber
- Genereret kontekst vises som om den var et ordret kildeafsnit.
- Den samme brede dokumentsammenfatning sættes foran alle uddrag.
- Kontekstforklaringer opdateres ikke, når originalens betydning ændres.
Det skal I afklare
- Hold originaltekst, tilføjet kontekst og version adskilt.
- Kontrollér referencer, enheder og afgrænsninger i forklaringen.
- Sammenlign med overskrifter og metadata før mere generering indføres.
Spørgsmål og svar
Er contextual retrieval det samme som et større tekstuddrag?
Nej. Metoden tilføjer en forklaring før indeksering. Et større uddrag eller parent document retrieval bevarer i stedet mere originaltekst omkring et fund.
Er forbedringen garanteret?
Nej. Kilderne beskriver metoden og egne forsøg. Jeres dokumenter, spørgsmål og kontrol af den genererede kontekst afgør, om den hjælper i praksis.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Anthropic: Contextual Retrieval ↗Afsnitsspecifik kontekst før embeddings og BM25-indeksering.
- Anthropic: Contextual embeddings cookbook ↗Forfatternes implementeringseksempel; gennemgået via notebookens rå indhold.

