Hvad betyder Golden dataset?
Et golden dataset er organisationens fælles reference for, hvad en AI-løsning skal kunne. Det indeholder konkrete testopgaver og et dokumenteret grundlag for at afgøre, om svaret er acceptabelt. Facit behøver ikke være én ordret formulering; det kan være nødvendige fakta, tilladte handlinger og fejl, der aldrig må passere.
Ordet golden betyder ikke, at datasættet er perfekt. Det skal vedligeholdes, når produkter, regler og brugerbehov ændrer sig. Et testspørgsmål om en udgået serviceaftale kan ellers få en opdateret løsning til at se forkert ud, selv om den bruger de gældende vilkår.
Værdien ligger i at kunne gentage samme vurdering. Uden et fastholdt testsæt risikerer teamet at sammenligne den nye model på lette spørgsmål med den gamle på svære. Et godt datasæt gør ændringer synlige og giver fagpersoner et konkret grundlag for godkendelse.
Medtag både normale og vanskelige opgaver
Saml hyppige spørgsmål, sjældne men alvorlige tilfælde, stavevariationer, manglende oplysninger og opgaver, som systemet skal afvise eller sende videre. Beskriv kilden til hvert eksempel, det relevante dokument og begrundelsen for acceptkriteriet. Fjern unødvendige personoplysninger fra produktionsinspirerede cases. Angiv også, hvilke brugergrupper og arbejdsgange der mangler dækning. Et ensidigt testsæt kan give en overbevisende score uden at afspejle den faktiske drift.
Beskyt testen mod tilpasning til facit
Hold et evalueringssæt adskilt fra de eksempler, der bruges til promptjustering og træning. Hvis udviklere løbende retter systemet efter hvert enkelt testspørgsmål, bliver det sværere at vurdere generalisering. Versionsstyr spørgsmål og facit, og forklar ændringer i en log. Når en regel ændres, opdateres det berørte facit med faglig godkendelse; tidligere resultater skal fortsat kunne forstås ud fra den gamle datasætversion.
Et eksempel fra praksis
Illustrativt eksempel: En medlemsorganisation bygger en intern assistent til kontingentregler. Datasættet omfatter almindelig indmeldelse, pause, udmeldelse, prisændring midt i året og spørgsmål uden tilstrækkelige oplysninger. For hvert spørgsmål står både forventede fakta og den relevante paragraf i vedtægterne. Da reglerne ændres, opdaterer sekretariatet de berørte cases før næste test. Udviklerne kan dermed skelne mellem en modelregression og et facit, der er blevet forældet.
Typiske faldgruber
- At bruge samme eksempler til udvikling og endelig kvalitetsvurdering.
- At skrive ét facitsvar uden at beskrive, hvilke variationer der er acceptable.
- At beholde virkelige kundedata, som ikke er nødvendige for testen.
Det skal I afklare
- Registrér ejer, version, kilder og dækkede arbejdsgange.
- Medtag afvisninger, uklare spørgsmål og kritiske undtagelser.
- Gennemgå facit, når dokumenter eller forretningsregler ændres.
Spørgsmål og svar
Hvor stort skal et golden dataset være?
Dækning betyder mere end et bestemt antal. Start med centrale opgavetyper og udvid, når drift og fejl viser huller. Rapportér altid både antal og fordeling.
Kan AI hjælpe med at skrive testeksempler?
Ja, den kan foreslå variationer. En fagperson skal stadig kontrollere relevans og facit, så datasættet ikke blot afspejler samme models antagelser og fejl.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Datasheets for Datasets ↗Primærkilde gennemgået 7. september 2026.
- CheckList: Behavioral Testing of NLP models ↗Primærkilde gennemgået 7. september 2026.

