Hvad betyder Metadatafiltrering?
Metadata er oplysninger om et dokument eller uddrag, eksempelvis dokument-ID, ejer, sprog og versionsdato. Metadatafiltrering bruger sådanne felter til at afgrænse, hvilke poster en søgning må eller skal tage i betragtning.
Det løser et andet problem end semantisk rangering. Et dokument kan ligne spørgsmålet meget og stadig være uegnet, fordi det gælder en anden kunde eller en udgået produktversion. Et korrekt filter kan udelukke den type materiale, før svaret bliver skrevet.
Hvis metadata bruges til adgangsbegrænsning, skal filteret dannes og håndhæves af den betroede applikation ud fra verificerede tilladelser. Brugerens eller modellens egen tekst må ikke kunne vælge en anden kundes adgangsområde. Et felt med et kundenavn er ikke alene en fuld adgangskontrol.
Filtreringen er kun så god som de gemte oplysninger
Et dokument uden korrekt versionsstatus kan ikke filtreres pålideligt som aktuelt. Fastlæg derfor, hvor metadata kommer fra, hvilke felter der kræves, og hvad der sker, når de mangler.
Brug stabile identifikatorer, hvor navne kan ændre sig eller være ens. En organisations adgang bør eksempelvis ikke afhænge af en frit indtastet tekststreng. Ved dokumentopdeling skal nødvendige metadata følge hvert uddrag, så et afsnit ikke mister den afgrænsning, originaldokumentet havde.
Undersøg hvor i søgningen filteret virker
Søgemotorer kan anvende filtre på forskellige tidspunkter i forhold til vektorsøgning og kandidatvalg. Det kan påvirke både genfinding og antallet af returnerede resultater, særligt ved snævre filtre. Den konkrete adfærd skal læses og testes.
Ved adgangsfølsomme oplysninger må uautoriseret tekst ikke nå frem til modellen, en synlig forklaring eller en cache for andre brugere. Kontrollér hele vejen fra søgning til svar, også når flere søgespor eller en reranker indgår.
Et eksempel fra praksis
Et rådgiverteam har materiale fra flere kunder i samme tekniske løsning. En medarbejder åbner en bestemt kundes sag. Applikationen bruger medarbejderens verificerede adgang og sagens stabile kunde-ID til søgningen.
Testsættet indeholder næsten ens dokumenter fra to kunder. Systemet skal finde den tilladte version og holde den anden ude, også når den anden tekst ville få en højere semantisk score. Teamet prøver desuden et dokument uden kunde-ID og kontrollerer, at det håndteres efter en bevidst regel frem for at blive frit søgbart.
Typiske faldgruber
- Modellen eller klienten får lov til selv at bestemme adgangsfilteret.
- Metadata forsvinder, når dokumentet opdeles til mindre uddrag.
- Manglende felter medfører utilsigtet adgang til en bredere samling.
Det skal I afklare
- Brug verificerede tilladelser og stabile dokumentegenskaber.
- Definér sikker håndtering af manglende eller forældede metadata.
- Test adskillelse gennem søgning, rangering, modelinput og cache.
Spørgsmål og svar
Kan filtre bruges uden følsomme oplysninger?
Ja. De er også nyttige til relevans, eksempelvis sprog, produktgeneration eller dokumenttype. Adgangsfiltre kræver dog stærkere styring end et almindeligt brugerfilter.
Er et filter nok til at isolere kunder?
Kun som del af en korrekt implementeret adgangsmodel. Identitet, rettigheder, filterdannelse, øvrige dataadgange og cache skal hænge sammen og testes.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Pinecone: Filter by metadata ↗Filtrering af poster ud fra metadatafelter.
- Microsoft: Security filter pattern ↗Applikationsstyret filtrering baseret på bruger- og gruppetilladelser.
- Microsoft: Vector query filters ↗Filterplacering og konsekvenser for vektorsøgning.

