Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Træning & fine-tuning

Data augmentation

Data augmentation skaber relevante variationer af træningseksempler, eksempelvis ændret billedudsnit eller lys, så modellen kan øve sig på mere varierede input.

Også kaldet: Dataaugmentering · Dataforøgelse

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
Beslægtede keramiske vaser med forskellige overflader står omkring en fælles forbindelse.
Variationerne illustrerer flere versioner af et eksempel med bevaret kerneindhold.

Hvad betyder Data augmentation?

Data augmentation udvider variationen i træningsmaterialet gennem transformationer. Et billede kan eksempelvis beskæres, roteres eller få justeret lysforhold. Formålet er at gøre modellen mindre afhængig af detaljer, som ikke bør afgøre resultatet.

En transformation er kun nyttig, hvis den passer til opgaven. Et spejlvendt billede kan være acceptabelt ved nogle produktklassifikationer, men ændre betydningen af tekst eller orientering i andre opgaver. Labelen skal fortsat være korrekt efter ændringen.

Metoden skaber ikke automatisk ny, uafhængig viden om verden. Mange variationer af få oprindelige eksempler kan stadig mangle de situationer, der betyder noget i driften. Augmentation bør derfor supplere en gennemtænkt dataindsamling og en realistisk evaluering.

Beskriv, hvilke variationer der er tilladte

Tag udgangspunkt i de variationer, systemet faktisk vil møde. Hvis kameraet har små ændringer i lys og vinkel, kan tilsvarende transformationer være relevante. Hvis farven er afgørende for at identificere en fejl, kan kraftig farveændring ødelægge det signal, modellen skal lære.

Gennemgå et udvalg af transformerede eksempler visuelt eller fagligt. Kontrollen skal vise, at transformationen hverken fjerner den relevante detalje eller tilføjer et urealistisk mønster.

Hold beslægtede variationer samlet

Del data i træning, validering og test før variationer af samme original fordeles. Ellers kan modellen få næsten identiske udgaver af et billede i både træning og test. Det kan skabe en misvisende høj score.

Evaluér på et repræsentativt testsæt med realistiske optagelser. Sammenlign en model med og uden augmentation på de samme eksempler, så den faktiske effekt kan vurderes. Gem transformationsindstillingerne som en del af træningsversionen.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Forestil jer en webshop, der vil genkende produkttyper på lagerbilleder. Piloten bruger moderate variationer i lys og beskæring, fordi billederne i drift kommer fra flere arbejdsstationer. Produktets afgørende form skal stadig være synlig.

En gennemgang viser, at nogle beskæringer fjerner en detalje, som skelner to lignende varianter. De transformationer begrænses. Testen bruger nye billeder fra de faktiske stationer, så teamet kan se, om modellen er blevet mere robust under realistiske forhold.

Typiske faldgruber

  • En transformation kan ændre labelens betydning eller fjerne det relevante signal.
  • Variationer af samme original på tværs af datasplit kan give lækage.
  • Store mængder kunstig variation kan skjule, at der mangler rigtige eksempler på vigtige situationer.

Det skal I afklare

  1. Hvilke variationer findes faktisk i driften, og hvilke bør modellen være robust over for?
  2. Er labelen stadig korrekt efter hver type transformation?
  3. Er alle afledte versioner af en original holdt ude af den uafhængige test?

Spørgsmål og svar

Er data augmentation det samme som syntetiske data?

Begreberne overlapper. Augmentation tager typisk udgangspunkt i eksisterende eksempler og ændrer dem, mens syntetiske data også kan fremstilles gennem regler, simulering eller generative modeller.

Kan tekst også augmenteres?

Ja, men omskrivning kan ændre betydning, tone eller facit. Derfor kræver tekstvariationer en kontrol, som passer til den konkrete opgave, frem for blot at skabe flere sætninger.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. TensorFlow: Data augmentationBilledtransformationer og brug under træning.
  2. scikit-learn: Common pitfallsAdskillelse af træning og test samt datalækage.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding