Hvad betyder Entity resolution?
Entity resolution handler om identitet på tværs af data. Den samme leverandør kan optræde med forkortet navn i ét system og fuldt navn i et andet. Omvendt kan to forskellige virksomheder have næsten ens navne. Systemet skal derfor vurdere mere end ren tekstlig lighed.
Metoderne kan bruge sikre identifikatorer, regler, sammenligning af flere felter eller probabilistisk record linkage. Værktøjer som Splink og Dedupe understøtter forskellige former for sammenkobling og dubletbehandling, også når et fælles entydigt ID mangler.
En matchscore bør ikke uden videre udløse en sammenlægning. Fejlagtig sammensmeltning kan knytte aftaler, historik eller rettigheder til den forkerte enhed. Beslutningen skal afspejle både datagrundlaget og konsekvensen af en forkert kobling.
Brug flere relevante signaler om identitet
Navn, adresse, registreringsnummer og andre felter kan bidrage forskelligt. Et ændret firmanavn kan være foreneligt med samme organisation, mens et fælles kontorhotel ikke nødvendigvis betyder samme virksomhed. Signalerne skal fortolkes i det relevante domæne.
Ved store datasæt indsnævres ofte, hvilke par der sammenlignes. Denne kandidatdannelse skal også testes. Hvis et sandt match aldrig bliver et kandidatpar, hjælper en god efterfølgende matchmodel ikke. Kontrollen bør derfor omfatte både udvælgelsen og vurderingen.
Adskil forslag, bekræftet match og sammenlægning
Et system kan foreslå, at to poster hører sammen, uden straks at ændre originaldata. En medarbejder kan gennemgå tvivlstilfælde og se de felter, der begrunder forslaget. Stærke identifikatorer kan understøtte mere automatisering, når datakvaliteten er kendt.
Bevar de oprindelige ID’er og beslutningshistorikken. Hvis et match senere viser sig forkert, skal koblingen kunne undersøges og om nødvendigt ophæves. Det er særligt vigtigt, når relationen bruges videre i en vidensgraf, søgning eller adgangsafgrænsning.
Et eksempel fra praksis
Et indkøbsteam samler leverandøroplysninger fra et ældre regneark og et økonomisystem. En leverandør står med to navne, mens to andre poster deler adresse, men har forskellige registreringsnumre.
Systemet foreslår match med synlige begrundelser. Teamet godkender kun sammenkoblinger efter de aftalte regler og sender modstridende identifikatorer til manuel afklaring. Originalposterne bevares med deres ID’er, så et forkert forslag ikke sletter historik eller flytter aftaler. Eksemplet beskriver en mulig kontrolproces uden at påstå en bestemt matchpræcision.
Typiske faldgruber
- Navnelighed eller fælles adresse behandles som sikker identitet.
- Et sandsynligt match sammenlægger originaldata uden en passende kontrol.
- Oprindelige ID’er og begrundelsen for koblingen går tabt.
Det skal I afklare
- Definér hvilke identifikatorer og felter der kan støtte et match.
- Test både oversete matches og fejlagtige sammenkoblinger.
- Bevar originalposter og en sporbar vej til at rette forkerte koblinger.
Spørgsmål og svar
Er entity resolution bare at fjerne dubletter?
Dubletbehandling er én anvendelse. Begrebet omfatter også at forbinde poster på tværs af systemer, selv når de skal bevares som selvstændige registreringer.
Kan en sprogmodel afgøre alle matches?
Den kan hjælpe med at fortolke navne og tekst, men sikre identifikatorer og kontrollerede regler er ofte vigtige. Kritiske sammenkoblinger bør ikke bero på et ubekræftet sprogligt gæt.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Splink: Documentation ↗Probabilistisk record linkage og sammenkobling uden fælles unikt ID.
- Dedupe: Documentation ↗Maskinlæringsbaseret dubletbehandling og record linkage.

