Hvad betyder Testdata til AI?
Testdata skal give et mere uafhængigt billede af kvaliteten end trænings- og valideringsresultater. De holdes tilbage, mens modellen udvikles, og bruges, når de væsentlige valg om model og behandling er fastlagt. Formålet er at efterligne mødet med nye observationer.
Uafhængigheden afhænger af processen. Hvis teamet ser testresultatet, justerer modellen og gentager testen, har materialet fået en udviklingsrolle. Det kan stadig være nyttigt, men bør ikke længere beskrives som en uberørt sluttest.
Et testsæt skal desuden repræsentere den anvendelse, man ønsker at vurdere. Et stort sæt lette eksempler siger ikke meget om sjældne undtagelser, nye produktgrupper eller ændrede forhold. Datagrundlag og begrænsninger skal følge med resultatet.
Efterlign den fremtidige anvendelse
Ved en prognose kan det være relevant at teste på en senere periode. Ved gentagne målinger fra samme kunde eller maskine kan det være nødvendigt at holde enheder samlet. Ellers kan modellen få hjælp fra næsten identiske eksempler, den allerede har set.
Definér også, hvilke input der må bruges. En test er urealistisk, hvis den indeholder oplysninger, som først opstår efter den beslutning, modellen skal støtte.
Rapportér både resultat og rækkevidde
Et testresultat bør ledsages af antal eksempler, tidsperiode, udvælgelse, kvalitetsmål og relevante fejltyper. Vis resultater for vigtige undergrupper, når datagrundlaget tillader det, og gør små stikprøver tydelige.
En god sluttest erstatter ikke overvågning i drift. Nye data, ændrede arbejdsgange og leverandøropdateringer kan ændre kvaliteten. Et fast regressionssæt kan opdage kendte fejl, mens nye repræsentative eksempler undersøger, om virkeligheden har flyttet sig.
Et eksempel fra praksis
Forestil jer en chatbot til interne procedurer. Før udviklingen låser teamet en samling spørgsmål med godkendte facitkilder, herunder spørgsmål uden svar og spørgsmål om adgangsbegrænset materiale.
Når løsningen er valgt, vurderes den på dette sæt med en fast rubric. Fejl fører til et dokumenteret udviklingsforløb og efterfølgende evaluering; man påstår ikke, at gentagne forbedringer på samme sæt er en ny uafhængig test. Der tilføjes løbende nye, fagligt gennemgåede spørgsmål til den fremtidige kontrol.
Typiske faldgruber
- Et testsæt mister sin uafhængige rolle, når det bruges til gentagen optimering.
- Næsten identiske eksempler på tværs af split kan gøre opgaven kunstigt let.
- En samlet score kan skjule manglende dækning af vigtige undtagelser.
Det skal I afklare
- Har testeksemplerne påvirket modelvalg, prompts eller andre udviklingsbeslutninger?
- Repræsenterer sættet både almindelige og kritiske situationer?
- Kan læseren se datagrundlag, målemetode og begrænsninger sammen med scoren?
Spørgsmål og svar
Kan syntetiske eksempler være testdata?
Ja, de kan teste bestemte situationer og regler. De dokumenterer dog ikke automatisk kvaliteten på virkelige input. Formål og begrænsninger bør være tydelige.
Hvor stort skal et testsæt være?
Der findes ikke ét universelt antal. Det afhænger af variation, fejltyper og den sikkerhed, beslutningen kræver. En lille, velvalgt pilot kan afdække problemer, men bærer ikke nødvendigvis brede kvalitetsudsagn.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Google: Dividing the original dataset ↗Testdata og adskillelse fra modeludvikling.
- scikit-learn: Common pitfalls ↗Datalækage og urealistisk evaluering.

