Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Træning & fine-tuning

Feature engineering

Feature engineering omformer rå data til inputvariable, der gør relevante mønstre lettere for en model at bruge, eksempelvis sæson, varighed eller historiske gennemsnit.

Også kaldet: Feature engineering · Udledning af inputvariable

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
Rå former føres gennem en messingtragt og står som ordnede figurer på en plade.
Bearbejdningen illustrerer dannelse af nyttige egenskaber fra rå data.

Hvad betyder Feature engineering?

Feature engineering er arbejdet med at konstruere den repræsentation, en model får som input. Et råt tidsstempel kan eksempelvis blive til ugedag eller tid siden en tidligere hændelse. En række køb kan blive til et historisk gennemsnit beregnet på de oplysninger, der var kendt på et bestemt tidspunkt.

En feature er ikke automatisk god, fordi den er let at beregne. Den skal være relevant for målet, tilgængelig i driften og stabil nok til at vedligeholde. En kompliceret variabel kan også skjule datalækage eller gøre resultatet sværere at forklare.

Arbejdet omfatter blandt andet håndtering af manglende værdier, kategorier, skalaer og sammensatte mål. Nogle modeller lærer selv mere af repræsentationen, men valg af input og databehandling er stadig en vigtig del af den samlede løsning.

Beregn ud fra det, der var kendt dengang

Historiske aggregater skal afgrænses ved beslutningstidspunktet. Hvis en model skal prioritere en ny henvendelse, må en feature om kundens tidligere sager ikke indeholde den nye sags senere udfald. Det kræver ofte mere omhu end blot at gruppere et regneark.

Test databehandlingen på et konkret eksempel med en tidslinje. Skriv, hvornår hvert felt opstår, og hvordan det bliver opdateret. Det kan afsløre genveje, før de indbygges i træningen.

Brug samme behandling ved træning og drift

Skalering, kodning af kategorier og udfyldning af manglende værdier skal anvendes konsistent. Parametre, der læres fra data, bør tilpasses på træningsdelen og derefter anvendes på validering, test og nye input.

En pipeline kan samle de nødvendige trin og mindske risikoen for forskellig behandling. Den erstatter ikke faglig vurdering, men gør det tydeligere, hvilke transformationer der hører til modellen, og hvordan de versioneres.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Forestil jer en grossist, der vil forudsige efterspørgsel. Teamet konstruerer variable for kendt sæson, tidligere salg og tilgængelig produktinformation. Et glidende gennemsnit beregnes kun på perioder før den forudsigelse, der evalueres.

Under gennemgangen opdager teamet, at et felt med 'endelig kampagnestatus' først bliver opdateret efter kampagnen. Det erstattes med den planlagte status, som faktisk var kendt. Piloten undersøger derefter, om de nye features giver en forbedring mod en enkel sæsonreference, og om de kan beregnes stabilt i drift.

Typiske faldgruber

  • Et historisk gennemsnit kan utilsigtet indeholde fremtidige observationer.
  • Forskellige transformationer i træning og drift kan ændre modellens input.
  • Mange konstruerede felter kan øge kompleksiteten uden at forbedre nye forudsigelser.

Det skal I afklare

  1. Kan hver feature beregnes med oplysninger, der er kendt på beslutningstidspunktet?
  2. Er transformationerne dokumenteret og ens i udvikling og drift?
  3. Hvilke features forbedrer kvaliteten på en uafhængig evaluering?

Spørgsmål og svar

Er normalisering feature engineering?

Det kan regnes som en del af arbejdet med inputrepræsentation. Normalisering ændrer en numerisk variabels skala; andre transformationer kan skabe helt nye variable.

Behøver neurale netværk feature engineering?

De kan lære omfattende repræsentationer, men inputvalg, datakvalitet og konsistent behandling er stadig afgørende. Det konkrete behov afhænger af data og arkitektur.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. Google: Numerical data normalizationSkala og transformation af numeriske input.
  2. scikit-learn: Common pitfallsKonsistent preprocessing og forebyggelse af datalækage.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding