Hvad betyder AI red teaming?
AI red teaming er en målrettet undersøgelse af, hvordan et AI-system kan svigte under modstridende eller ondsindet påvirkning. Testen ser på hele løsningen: model, prompts, dokumenter, værktøjer, rettigheder og brugerflade. Formålet er at finde svagheder, mens de kan håndteres kontrolleret.
Det er mere end at få en chatbot til at skrive noget mærkeligt. Et værdifuldt fund viser en konkret konsekvens, eksempelvis adgang til en forkert kundes dokument, en uautoriseret handling eller et svar, der skjuler manglende kildegrundlag. Testen skal derfor knyttes til organisationens faktiske sikkerhedsmål.
Arbejdet kræver en tydelig autorisation og afgrænsning. Beskriv systemer, data, tilladte handlinger, stopkriterier og kontaktpersoner før testen. Brug isolerede miljøer og syntetiske data, hvor det er muligt, så selve afprøvningen ikke skaber de skader, den skal hjælpe med at forebygge.
Vælg scenarier ud fra systemets grænser
Start med dataflow og rettigheder. Hvad må en almindelig bruger se? Hvilke handlinger må agenten foreslå eller udføre? Hvilke eksterne kilder behandles som ubetroede? Udvælg scenarier, der udfordrer disse grænser, og angiv den forventede sikre adfærd. Automatisk genererede testinput kan øge variationen, men mennesker skal vurdere relevans og konsekvens. Mange tilfældige prompts giver ikke nødvendigvis bedre dækning.
Gør fund reproducerbare og test rettelsen
Gem nødvendige input, versioner, rettigheder og observeret adfærd, men begræns følsomme oplysninger i rapporten. Skeln mellem en model, der foreslår noget forkert, og et system, der faktisk udfører det. Begge kan være relevante, men konsekvensen er forskellig. Efter en rettelse gentages scenariet og beslægtede variationer, så beskyttelsen ikke kun matcher én kendt formulering. Fundene bør blive del af regressionstesten.
Et eksempel fra praksis
Illustrativt eksempel: Et bureau tester en agent, der kan lave kalenderudkast. I et isoleret miljø indsættes et dokument med en instruktion, som strider mod brugerens mødeønske. Testen kontrollerer, om agenten behandler teksten som kildeindhold og holder sig til tilladte kalenderhandlinger. Et fund dokumenteres med syntetiske modtagere og vises sammen med den serverkontrol, der blokerer en uautoriseret ændring. Ingen rigtig invitation sendes under testen.
Typiske faldgruber
- At teste i produktion uden aftalt scope og stopmulighed.
- At rapportere provokerende tekst uden at undersøge reel systemkonsekvens.
- At erklære systemet sikkert efter én vellykket rettelse.
Det skal I afklare
- Aftal autorisation, miljø, data og stopkriterier skriftligt.
- Knyt scenarier til konkrete data- og handlingsgrænser.
- Gem reproduktion, prioriter rettelser og gentest variationer.
Spørgsmål og svar
Er AI red teaming det samme som penetrationstest?
Der er overlap, men AI-testen omfatter også modeladfærd, kildepåvirkning og samspillet med værktøjer. Klassisk adgangs- og applikationssikkerhed skal stadig testes.
Kan en anden AI udføre hele testen?
Den kan foreslå og variere scenarier. Scope, konsekvensvurdering, autorisation og beslutninger om rettelser bør fortsat ejes af kompetente mennesker.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Perez m.fl.: Red Teaming Language Models with Language Models ↗Primærkilde gennemgået 7. september 2026.
- NIST AI 100-2: Adversarial Machine Learning ↗Primærkilde gennemgået 7. september 2026.

