Hvad betyder Regression i machine learning?
Regression bruges til at forudsige et tal ud fra tilgængelige input. Det kan være næste uges efterspørgsel, varigheden af en opgave eller et forventet forbrug. Resultatet adskiller sig fra klassifikation, hvor modellen vælger en kategori.
En lineær regressionsmodel beskriver resultatet som en kombination af input med lærte koefficienter. Andre regressionsmodeller kan repræsentere mere komplekse, ikke-lineære sammenhænge. Valget af model afhænger blandt andet af data, mønstre og behovet for at forstå beregningen.
En sammenhæng i data er ikke automatisk årsag og virkning. En model, som bruger rabat til at forudsige salg, beviser eksempelvis ikke, hvor meget en ny rabat vil øge salget. Historiske kampagner kan være påvirket af sæson, lager og andre forhold, som modellen ikke beskriver tilstrækkeligt.
Mål fejl i en skala, virksomheden kan bruge
MAE, mean absolute error, beskriver den gennemsnitlige absolutte afvigelse mellem forudsigelse og facit. Andre mål vægter store fejl anderledes. Valget skal passe til situationen: En lille gennemsnitsfejl kan skjule enkelte afvigelser, som skaber store problemer.
Se derfor også på fejl fordelt efter størrelse, periode og relevant produktgruppe. Hvis en undervurdering er dyrere end en overvurdering, bør evalueringen afspejle den forskel. Et samlet tal er sjældent tilstrækkeligt.
Sammenlign med den nuværende planlægning
En enkel reference kan være sidste periodes værdi, et sæsongennemsnit eller den eksisterende faglige vurdering. Modellen skal give en forbedring, som står mål med databehandling, drift og vedligeholdelse.
Input skal være kendt på forudsigelsestidspunktet. En beregning af næste uges forbrug må ikke bruge næste uges faktisk målte temperatur, hvis driften kun har adgang til en prognose. Ellers bliver testen mere optimistisk end den reelle anvendelse.
Et eksempel fra praksis
Et illustrativt værksted vil estimere arbejdstid på standardopgaver. Modellen får opgavetype og oplysninger, som er til rådighed ved booking. Efter afslutning kan den faktiske tid bruges som facit til fremtidig evaluering.
Planlæggeren ser estimatet som støtte og kan justere ved særlige forhold. Piloten undersøger, hvilke opgavetyper der bliver undervurderet, og om estimaterne giver mere realistiske dagsplaner. En model, der rammer gennemsnittet, men gentagne gange underestimerer krævende opgaver, kan være dårligere for driften end en mere forsigtig reference.
Typiske faldgruber
- Korrelation kan blive fejltolket som dokumentation for en effekt af en handling.
- Fremtidige oplysninger kan lække ind i input og gøre testen urealistisk.
- Et gennemsnitsmål kan skjule store fejl på bestemte typer opgaver.
Det skal I afklare
- Hvilket tal skal forudsiges, og hvornår skal forudsigelsen bruges?
- Hvilke input er faktisk kendt på det tidspunkt?
- Hvordan vægtes for høje og for lave estimater i evalueringen?
Spørgsmål og svar
Hvorfor hedder logistic regression regression, når den bruges til klassifikation?
Navnet følger modellens historiske og matematiske form. Logistic regression bruges typisk til at modellere sandsynligheden for et binært udfald, som derefter kan omsættes til en kategori.
Kan regression give et sikkert facit?
Nej. Resultatet er et estimat baseret på data og antagelser. Usikkerhed, fejlfordeling og ændrede forhold bør indgå i den beslutning, estimatet understøtter.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Google: Linear regression ↗Numerisk forudsigelse, vægte og tabsfunktioner.
- scikit-learn: Model evaluation ↗Regressionsmål og evaluering af modelresultater.

