Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Træning & fine-tuning

Syntetiske data

Syntetiske data er data fremstillet gennem regler, simulering eller modeller til et bestemt formål, eksempelvis test af et system eller variation i træningsmateriale.

Også kaldet: Synthetic data · Kunstigt fremstillede data

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
Geometriske former passerer en tromle, mens nye former står under en glasklokke.
De fremstillede eksempler er en metafor for syntetiske data med særskilt kvalitetskontrol.

Hvad betyder Syntetiske data?

Syntetiske data er konstruerede observationer frem for direkte registreringer af de hændelser, de beskriver. Det kan være opdigtede fakturaer, simulerede sensormålinger eller genererede beskeder. Dataene kan efterligne bestemte strukturer og variationer uden at være faktiske kundesager.

Værdien afhænger af formålet. Et system kan testes for, om det afviser en ugyldig dato, med et enkelt konstrueret eksempel. En vurdering af, hvor godt en model forstår virkelige kundebeskeder, kræver derimod et grundlag, som afspejler den faktiske variation.

Syntetisk betyder ikke automatisk anonymt eller risikofrit. Hvis genereringen bygger på personoplysninger, skal man blandt andet undersøge, om oplysninger kan blive gengivet eller knyttet til personer. Den vurdering kan ikke erstattes af en etiket om, at dataene er kunstige.

Skeln mellem regeltest og repræsentativ evaluering

Til regeltest kan man bevidst skabe ekstreme eller sjældne situationer: manglende felter, modstridende værdier eller gentagne hændelser. Her er det afgørende, at det forventede systemresultat er tydeligt.

Til træning eller bred kvalitetsevaluering skal man også undersøge fordelingen af eksempler og deres lighed med virkeligheden. En generator kan producere pæne, ensartede formuleringer og dermed overse de stavefejl, afbrydelser og uklarheder, som systemet møder i drift.

Kontrollér både nytte og informationsrisiko

Beskriv, hvilke egenskaber dataene skal bevare, og hvilke de ikke må indeholde. Brug faglig gennemgang og relevante tekniske kontroller til at undersøge, om eksemplerne er brugbare og ikke blot kopier eller let genkendelige variationer af kildematerialet.

Hold generering til træning og uafhængig evaluering adskilt. Hvis den samme generator og skabelon former begge dele, kan testen primært belønne lighed med generatorens særlige stil.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Forestil jer et team, der bygger validering af fakturadata. De fremstiller dokumenter med fiktive virksomheder og kontrollerede fejl: en forkert sum, et manglende fakturanummer og en gentaget identifikator.

Hvert eksempel har et dokumenteret forventet udfald, eksempelvis manuel kontrol frem for videre behandling. Sættet tester de kendte regler. Teamet supplerer med særskilt vurderede, lovligt anvendelige eksempler fra den virkelige arbejdsgang, før det udtaler sig om løsningens samlede dokumentforståelse.

Typiske faldgruber

  • Kunstige eksempler kan være mere ensartede og lettere end virkelige input.
  • Generering fra følsomt materiale kan bevare eller afsløre oplysninger fra kilden.
  • Samme skabeloner i træning og test kan give en kunstigt god evaluering.

Det skal I afklare

  1. Skal datasættet teste bestemte regler eller repræsentere den faktiske drift?
  2. Hvordan kontrolleres relevans, variation og mulige gengivelser af kildedata?
  3. Er testfacit og evalueringsmateriale uafhængigt af den model, der skal vurderes?

Spørgsmål og svar

Kan syntetiske data erstatte alle rigtige testeksempler?

Normalt ikke som generel garanti. De er velegnede til kontrollerede situationer, men kan mangle vigtige mønstre i virkelige input. Kombinationen bør følge testens formål.

Er syntetiske data altid anonyme?

Nej. Fremstillingsmetode, kildedata og muligheder for genkendelse eller kobling skal vurderes konkret. En generel produktpåstand om anonymitet er ikke tilstrækkelig dokumentation.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. NIST: AI Risk Management FrameworkRisikostyring og vurdering af data og generative systemer.
  2. TensorFlow: Data augmentationEt afgrænset eksempel på at skabe variationer af data til træning.
  3. ICO: How do we ensure anonymisation is effective?Teknisk baggrund om identifikation og anonymisering fra den britiske tilsynsmyndighed; ikke en dansk juridisk konklusion. Gennemgået 7. september 2026.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding