Hvad betyder Model extraction?
Model extraction er en type angreb, hvor en aktør forsøger at genskabe væsentlige egenskaber ved en model gennem dens tilgængelige grænseflade. Det kan handle om at efterligne beslutningsadfærd eller udlede detaljer om modellen. Begrebet betyder ikke nødvendigvis, at de oprindelige modelvægte bliver hentet direkte.
Risikoen er relevant, hvis virksomheden har investeret i en specialiseret model eller tilbyder et API, hvis resultater kan indsamles systematisk. Adgang til meget detaljerede svar kan give mere information end den forretningsmæssige opgave kræver. Samtidig skal et legitimt produkt stadig være brugbart; beskyttelsen er en afvejning, ikke blot at skjule alt.
Model extraction bør holdes adskilt fra tyveri af en systemprompt og fra udtræk af træningsdata. Disse hændelser kan overlappe i en sikkerhedsvurdering, men de har forskellige mål og kontrolbehov. En præcis definition gør det lettere at vælge relevante tests.
Vurdér, hvad grænsefladen afslører
Kortlæg tilgængelige output, detaljerede scores, forklaringer og muligheden for store mængder forespørgsler. Spørg, hvilke oplysninger kunder faktisk har brug for, og hvilke der kun er med af tekniske bekvemmelighedshensyn. Brug adgangsstyring og rimelige forbrugsgrænser, der passer til produktet. Registrér mønstre, som kan kræve undersøgelse, men undgå at antage, at enhver stor kunde eller gentagen forespørgsel er et angreb.
Beskyt værdien uden at love fuldstændig hemmeligholdelse
Et offentligt API giver nødvendigvis information om sin adfærd. Derfor kan ingen simpel rate limit garantere, at en model ikke kan efterlignes. Kombinér tekniske begrænsninger, overvågning, relevante aftalevilkår og beskyttelse af de datakilder og processer, der skaber produktets værdi. Vurder også konsekvensen: Er bekymringen konkurrence, adgang til fortrolige regler eller misbrug af en downstream-funktion? Kontrollerne bør følge det faktiske tabsscenarie.
Et eksempel fra praksis
Illustrativt eksempel: En logistikvirksomhed stiller et specialiseret estimatværktøj til rådighed for kunder. Teamet gennemgår, om svaret behøver at indeholde alle interne delscorer, og afgrænser API-adgangen til aftalte kundebehov. De indfører forbrugsovervågning og en proces til at undersøge usædvanlige kaldsmønstre. Tiltagene beskrives som begrænsning af eksponering og misbrug, ikke som bevis for, at modellens adfærd er umulig at efterligne.
Typiske faldgruber
- At forveksle efterligning af adfærd med direkte download af modelvægte.
- At eksponere interne scores uden et produktbehov.
- At betragte en enkelt teknisk grænse som fuldstændig beskyttelse.
Det skal I afklare
- Kortlæg API-output og de oplysninger, brugeren behøver.
- Aftal adgang, forbrugsgrænser og undersøgelse af anomalier.
- Beskriv konsekvens og relevante kontrolmål i trusselsmodellen.
Spørgsmål og svar
Kan en systemprompt forhindre model extraction?
Den kan beskrive ønsket adfærd, men løser ikke alene risikoen ved systematisk adgang til modellens output. Beskyttelsen skal også ligge omkring API’et.
Gælder risikoen kun store sprogmodeller?
Nej. Forskningen omfatter også klassifikationsmodeller og andre prediction-API’er. Relevansen afhænger af adgang, output og hvilken værdi der kan efterlignes.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Tramèr m.fl.: Stealing Machine Learning Models via Prediction APIs ↗Primærkilde gennemgået 7. september 2026.
- NIST AI 100-2: Adversarial Machine Learning ↗Primærkilde gennemgået 7. september 2026.

