Hvad betyder Træningsdata?
Træningsdata er det materiale, en model lærer af under træning. Ved supervised learning indeholder eksemplerne typisk både input og et kendt mål. Ved andre læringsformer kan målet konstrueres fra data eller opstå gennem interaktion med et miljø.
Datasættet er ikke blot en samling filer. Hver observation repræsenterer en situation, og udvælgelsen afgør, hvilke situationer modellen møder. Hvis materialet primært indeholder lette, almindelige eksempler, kan modellen få et utilstrækkeligt grundlag for sjældne, men vigtige tilfælde.
Træningsdata skal adskilles fra validerings- og testdata. De sidste dele bruges til at vælge mellem løsninger og vurdere kvaliteten på nye observationer. En model, der genkender sit eget træningsmateriale, har ikke dermed dokumenteret, at den fungerer i drift.
Start med opgaven og beslutningstidspunktet
Beskriv, hvilke input modellen skal modtage i den faktiske arbejdsgang. Historiske data kan indeholde felter, som først bliver kendt efter beslutningen. Hvis de bruges under træning, kan modellen lære en genvej, som ikke er til rådighed i produktion.
Vurder også, om de gamle registreringer afspejler den ønskede proces. Hvis medarbejdere tidligere har brugt forskellige kategorier eller praksisser, kan data kræve faglig gennemgang før brug.
Gør datasættet muligt at forstå igen
Dokumentér oprindelse, udvælgelseskriterier, tidsperiode, ændringer og eventuelle begrænsninger. Versionér både data og den behandling, der omformer dem til modelinput. Det gør det lettere at forklare forskelle mellem to træningskørsler.
Adgang, brugsrettigheder og håndtering af følsomme oplysninger er en del af dataprocessen. At en fil kan eksporteres, betyder ikke automatisk, at den må bruges til ethvert formål eller deles med en modelleverandør.
Et eksempel fra praksis
Forestil jer et servicecenter, der vil lære en model at fordele henvendelser. Første eksport indeholder emne, besked og den afdeling, der til sidst løste sagen. Teamet opdager, at enkelte sager blev flyttet flere gange, og at en intern note afslører det endelige udfald.
Noten fjernes fra input, hvis den ikke ville være kendt ved modtagelse. Fagpersoner gennemgår tvivlsomme kategorier, og senere henvendelser holdes tilbage til test. Det giver et mere realistisk grundlag end blot at træne på alle tilgængelige felter.
Typiske faldgruber
- Store datamængder kan skjule systematiske registreringsfejl.
- Felter fra efter beslutningen kan skabe datalækage.
- Gentagne eller næsten identiske observationer kan påvirke både træning og evaluering.
Det skal I afklare
- Er hvert input til rådighed på det tidspunkt, modellen skal bruges?
- Hvilke situationer, grupper eller perioder mangler i materialet?
- Kan dataenes oprindelse, version og tilladte brug dokumenteres?
Spørgsmål og svar
Er mere træningsdata altid bedre?
Nej. Relevans, kvalitet og variation betyder meget. Flere gentagelser af de samme fejl kan gøre problemet større, mens få velvalgte eksempler kan være værdifulde.
Bliver en chatbesked automatisk til træningsdata?
Det afhænger af produkt, aftale og indstillinger. At give en model kontekst i en forespørgsel er teknisk forskelligt fra at opdatere dens parametre gennem træning.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Google: Dividing the original dataset ↗Adskillelse af træning, validering og test.
- scikit-learn: Common pitfalls ↗Datalækage og korrekt behandling af modelinput.

