Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Retrieval & data

Cross-encoder

En cross-encoder behandler to tekster samlet, eksempelvis et spørgsmål og et dokumentuddrag, og beregner en vurdering af deres forhold eller relevans.

Også kaldet: Cross encoder

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
En papirrulle og en dokumentstak forbindes med sammenflettede grønne rør.
Den fælles behandling illustrerer vurdering af spørgsmål og kandidat sammen.

Hvad betyder Cross-encoder?

En cross-encoder er en modelopsætning, hvor et tekstpar indgår samlet i vurderingen. Ved søgning kan parret bestå af brugerens spørgsmål og et kandidatdokument. Modellen kan dermed behandle forbindelser mellem de to tekster direkte.

Det adskiller sig fra en bi-encoder, som omsætter teksterne til separate vektorer, der bagefter sammenlignes. Cross-encoderen giver ikke på samme måde én genbrugelig dokumentvektor til alle fremtidige spørgsmål. Det konkrete par skal vurderes, når spørgsmålet er kendt.

Derfor bruges cross-encodere ofte til reranking af et begrænset kandidatfelt. De kan være relevante, når små sproglige forskelle betyder meget, men arbejdet pr. kandidat gør det vigtigt at kontrollere ventetid og mængden af materiale.

Spørgsmålet og dokumentet påvirker samme beregning

Et uddrag om at opsige en aftale og et uddrag om at forlænge den kan indeholde mange af de samme ord. En parvis relevansmodel kan undersøge forholdet til brugerens konkrete spørgsmål mere detaljeret end en løs sammenligning af ordlister.

Hvor godt det virker, afhænger af modellen og dens træningsgrundlag. En model, der er stærk på engelske websøgninger, er ikke automatisk lige god til danske kontraktuddrag eller interne forkortelser. Det skal prøves med virksomhedens egne relevante eksempler.

En score skal vurderes i sin sammenhæng

Modellen har en grænse for, hvor meget tekst den kan behandle i et par. Hvis et dokument bliver afkortet, kan den afgørende undtagelse ligge uden for inputtet. En høj score siger da kun noget om den tekst, der faktisk blev vurderet.

Scorer bør heller ikke uden videre læses som sandsynligheder for et korrekt svar. Brug dem til den funktion, modellen er beregnet til, og fastlæg eventuelle tærskler ud fra repræsentative data. Bevar en vej for spørgsmål, hvor ingen kandidat er dækkende.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Et internt HR-spørgesystem finder afsnit om ferieoverførsel. Flere uddrag deler nøgleord, men beskriver forskellige medarbejdergrupper og frister. En cross-encoder afprøves som sidste rangering før besvarelsen.

Testspørgsmålene angiver medarbejdergruppe og den relevante periode. Teamet kontrollerer, at disse afgrænsninger faktisk indgår i den tekst, modellen ser. Resultater fra en forkert gruppe udelukkes gennem de relevante adgangs- og udvælgelsesregler, så rangeringen ikke får ansvar for at håndhæve alle forretningsgrænser alene.

Typiske faldgruber

  • Modellen anvendes på alle dokumenter uden vurdering af omkostning.
  • Afkortning fjerner den del, der afgør relevansen.
  • En høj modelscore fortolkes som en universel sandsynlighed for korrekthed.

Det skal I afklare

  1. Afprøv modellen på dansk og på jeres dokumenttyper.
  2. Kontrollér det faktiske tekstpar efter eventuel afkortning.
  3. Mål bidraget på et begrænset kandidatfelt med kendte relevante kilder.

Spørgsmål og svar

Kan en cross-encoder erstatte vektorindekset?

I et meget lille materiale kan parvis vurdering være mulig direkte. Ved større samlinger bruges den ofte efter en hurtigere søgning, fordi hvert spørgsmål-dokument-par kræver behandling.

Er alle rerankere cross-encodere?

Nej. Reranking er en funktion i søgeforløbet, og der findes flere metoder. Cross-encoder er én bestemt modelopsætning til at vurdere tekstpar.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. Sentence Transformers: Cross-EncodersSamlet behandling af tekstpar og forskellen fra bi-encodere.
  2. Reimers og Gurevych: Sentence-BERTBaggrund for forskellen mellem parvis vurdering og separate sætningsrepræsentationer.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding