Hvad betyder Regressionstest af AI?
Regressionstest af AI undersøger, om en ændring forringer noget, der tidligere virkede. Ændringen kan være en ny model, en prompt, et dokumentfilter, en integration eller en opdateret vidensbase. Selvom den løser ét problem, kan den skabe et andet i en arbejdsgang, teamet ikke lige har fokus på.
I klassisk software kan mange tests kræve præcis samme output. Ved genereret sprog er det ofte mere relevant at kontrollere egenskaber: rigtige fakta, nødvendige forbehold, gyldige felter og fravær af uautoriserede handlinger. Ordlyden må gerne variere, hvis opgaven stadig løses korrekt.
En regressionstest kræver et kendt sammenligningsgrundlag. Gem den tidligere version og dens resultater på samme testsæt. Hvis både model, prompt og facit ændres samtidig, bliver det vanskeligt at forklare forskellen. Del ændringerne op, når det er praktisk muligt.
Definér, hvad der blokerer en udgivelse
Nogle fejl bør stoppe en ændring med det samme, eksempelvis visning af en anden kundes oplysninger eller en forkert prisberegning. Andre ændringer kan vurderes samlet, såsom tone og længde. Skriv disse regler før testen. Kontrollér både hyppige opgaver og tidligere fejl, som er blevet rettet. Et samlet kvalitetsgennemsnit må ikke gøre en alvorlig sikkerhedsregression acceptabel, fordi svarene samtidig er blevet mere velformulerede.
Tag højde for variation mellem kørsler
En model kan give forskellige svar på samme input. Gentag derfor følsomme cases og registrér indstillinger, præcist model-ID og antal forsøg. Skeln mellem en enkelt afvigelse og en systematisk forringelse uden at skjule nogen af delene. Gem fejl og rå resultater, så teamet kan efterprøve vurderingen. Ved en godkendt ændring bliver den nye version sammenligningsgrundlag for næste runde; historikken bevares.
Et eksempel fra praksis
Illustrativt eksempel: Et bureau ændrer prompten i en tilbudsassistent, så udkastene bliver kortere. Den nye version virker bedre i demoen, men regressionstesten viser, at betalingsforbeholdet forsvinder i tilbud med flere leverancer. Teamet afviser udgivelsen, justerer kriteriet for forkortelse og gentager de berørte tests. Det afgørende er ikke, om teksten generelt blev pænere, men om den stadig indeholder de aftaler, virksomheden har brug for.
Typiske faldgruber
- At evaluere en ny model på et andet datasæt end den gamle.
- At bruge ordret tekstmatch til svar, hvor flere formuleringer er korrekte.
- At opdatere facit for at få testen til at bestå uden faglig begrundelse.
Det skal I afklare
- Versionsstyr model, prompt, kilder, testdata og evaluator.
- Adskil stopfejl fra kvalitetsmål, der kræver samlet vurdering.
- Gem rå resultater og dokumentér beslutningen om udgivelse.
Spørgsmål og svar
Hvornår skal en regressionstest køres?
Ved ændringer, der kan påvirke output eller rettigheder: modeller, instruktioner, data, retrieval og integrationskode. Omfanget kan tilpasses ændringens betydning.
Kan testen garantere, at der ikke kommer nye fejl?
Nej. Den opdager kendte problemtyper og dækkede scenarier. Overvågning i drift og løbende udvidelse af testsættet er stadig nødvendig.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- CheckList: Behavioral Testing of NLP models ↗Primærkilde gennemgået 7. september 2026.
- Sculley m.fl.: Hidden Technical Debt in Machine Learning Systems ↗Primærkilde gennemgået 7. september 2026.

