Hvad betyder ETL?
ETL står for extract, transform, load: udtræk, transformation og indlæsning. Processen bruges til at samle data fra forskellige systemer i en form, som kan bruges til analyse eller andre arbejdsgange. Den kan eksempelvis forbinde ordredata, produktdata og kundedata i et rapporteringsgrundlag.
ETL handler ikke kun om transport. Transformationen afgør, hvad data betyder i målsystemet. Hvis kilder bruger forskellige definitioner af omsætning, dato eller kunde, skal disse forskelle håndteres eksplicit, før tallene sammenlignes.
Bevar betydningen gennem de tre trin
Udtrækket skal kende kildens struktur og det tidspunkt, data gælder for. Transformation kan rense formater, standardisere enheder, forbinde tabeller og beregne nye felter. Indlæsningen skal sikre, at de forventede poster er kommet frem uden utilsigtede dubletter.
Gem kontroltal og sporbarhed undervejs. Antal rækker før og efter en filtrering bør kunne forklares. En ugyldig værdi bør ikke stiltiende blive til nul, hvis nul betyder noget andet i rapporten. Det er ofte nyttigt at holde rådata og bearbejdede data adskilt, så en ændret regel kan efterprøves mod det oprindelige input.
Placeringen af transformationen har betydning
I ELT indlæses data først, og transformationen sker i målsystemet. Valget afhænger af kapacitet, datakrav og kontrolbehov. Uanset rækkefølge skal teamet kende den anvendte logik og håndtere ændringer i kildeskemaet. AI kan hjælpe med at foreslå mapping eller kategorier, men kritiske beregninger bør være deterministiske og testbare. Et dataflow skal have en regel for rettede eller slettede kildeposter, så gamle kopier ikke bliver ved med at påvirke analysen.
Et eksempel fra praksis
En virksomhed vil måle tiden fra en henvendelse til et kvalificeret møde. ETL-processen henter formular-, CRM- og mødedata, forbinder dem via stabile ID'er og standardiserer tidspunkter. Et aflyst møde skal ikke tælle som gennemført, og gentagne formularindsendelser skal ikke automatisk blive nye leads. Testen bruger en lille kendt samling af sager, hvor forventet forløb er dokumenteret, før hele datasættet indlæses.
Typiske faldgruber
- At ensrette feltnavne uden at ensrette deres betydning.
- At skjule manglende data ved at erstatte alt med nul.
- At mangle en regel for ændringer og sletninger i kildedata.
Det skal I afklare
- Dokumentér kilde, betydning og transformation for centrale felter.
- Afstem antal poster og relevante kontrolsummer.
- Test ændrede skemaer, dubletter og rettede kildeposter.
Spørgsmål og svar
Er ETL kun til store virksomheder?
Nej. Selv en lille rapport, der samler data fra flere systemer, har brug for tydelige regler for udtræk og transformation. Omfanget af værktøjer og drift bør passe til opgaven.
Kan AI overtage hele datarensningen?
AI kan hjælpe med visse fortolkninger, men resultatet skal kontrolleres. En uklar kategorisering og en fast beregning er forskellige opgaver og bør have forskellige kvalitetstjek.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- AWS: What is ETL? ↗Udtræk, transformation og indlæsning af data.
- Microsoft: ETL and ELT ↗Placering af transformation og valg af dataproces.

