Hvad betyder Anomalidetektion?
Anomaly detection handler om at markere det usædvanlige i forhold til en valgt reference. En afvigelse kan være en pludselig ændring i en måling, en atypisk kombination af felter eller et forløb, som sjældent ses i historikken. Det usædvanlige er dog ikke automatisk forkert.
Et nyt produkt, en kampagne eller en ændret arbejdsgang kan skabe legitime afvigelser. Et system bør derfor beskrive, hvad det sammenligner med, og hvem der vurderer markeringerne. En alarm er ofte begyndelsen på en undersøgelse, ikke slutningen.
Der skelnes blandt andet mellem outlier detection, hvor træningsmaterialet kan indeholde afvigelser, og novelty detection, hvor en model af kendte normale data skal genkende nye observationer uden for mønstret. Metode og evaluering skal passe til den situation, data faktisk repræsenterer.
Definér normalen i den rigtige sammenhæng
En værdi kan være normal for én maskine eller periode og usædvanlig for en anden. Sæson, ugedag og driftstilstand kan derfor være nødvendige input. Et globalt gennemsnit kan give mange alarmer, hvis data dækker meget forskellige situationer.
Start med simple regler og visualiseringer. De kan vise, om en mere avanceret model er nødvendig, og give en reference for antallet af alarmer. Datafejl og manglende registreringer bør behandles særskilt, hvor det er muligt.
Tilpas tærsklen til opfølgningen
En lav tærskel kan finde flere mulige problemer, men også skabe flere falske alarmer. Hvis ingen har tid til at følge op, kan systemet miste sin praktiske værdi. Evalueringen bør derfor omfatte både oversete relevante hændelser og arbejdsbyrden ved kontrol.
Gem fagpersonens vurdering af en alarm. Feedbacken kan hjælpe med at skelne tilbagevendende, harmløse mønstre fra reelle problemer. Den bør gennemgås, før den bruges som nyt træningsgrundlag.
Et eksempel fra praksis
Et illustrativt økonomiteam vil markere fakturaer med usædvanlige kombinationer af leverandør, beløb og betalingsoplysninger. Systemet samler markeringerne i en kø med de relevante felter og sammenligningsgrundlaget.
En medarbejder kontrollerer dokumentationen før nogen betaling ændres. Et stort beløb kan eksempelvis være en aftalt årsbetaling. Piloten måler, hvor mange markeringer der fører til en relevant undersøgelse, og hvor meget kontrolarbejde de skaber. Den må ikke omtale enhver afvigelse som svindel.
Typiske faldgruber
- Sjældenhed kan forveksles med fejl eller mistænkelig adfærd.
- Ændringer i den normale drift kan udløse en stor mængde unødvendige alarmer.
- En teknisk god score kan skjule en kontrolkø, som afdelingen ikke kan håndtere.
Det skal I afklare
- Hvilken normaltilstand sammenlignes observationen med?
- Hvem følger op på en alarm, og hvilke oplysninger skal vedkommende se?
- Hvordan måler I både oversete hændelser og falske alarmer?
Spørgsmål og svar
Skal vi have eksempler på alle fejltyper?
Ikke nødvendigvis for at markere afvigelser. Men relevante, fagligt vurderede eksempler er værdifulde til at teste, om systemets alarmer faktisk finder problemer, som virksomheden vil reagere på.
Kan anomaly detection erstatte faste regler?
Nogle gange kan den supplere dem. Faste regler er ofte velegnede til kendte grænser, mens en model kan undersøge mere sammensatte mønstre. Kombinationen skal stadig testes.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- scikit-learn: Novelty and Outlier Detection ↗Forskellen mellem afvigelser i kendte data og nye observationer.
- scikit-learn: Model evaluation ↗Evaluering og valg af relevante kvalitetsmål.

