Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Sikkerhed & ansvar

Model extraction

Forsøg på at udlede eller efterligne en models adfærd gennem adgang til dens svar eller andre eksponerede oplysninger.

Også kaldet: Modeludtræk

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
En lukket grøn beholder forbindes med flere prøveskåle og en ny ordnet samling kugler.
Gentagne observationer af svar kan bruges til at forsøge at efterligne en model.

Hvad betyder Model extraction?

Model extraction er en type angreb, hvor en aktør forsøger at genskabe væsentlige egenskaber ved en model gennem dens tilgængelige grænseflade. Det kan handle om at efterligne beslutningsadfærd eller udlede detaljer om modellen. Begrebet betyder ikke nødvendigvis, at de oprindelige modelvægte bliver hentet direkte.

Risikoen er relevant, hvis virksomheden har investeret i en specialiseret model eller tilbyder et API, hvis resultater kan indsamles systematisk. Adgang til meget detaljerede svar kan give mere information end den forretningsmæssige opgave kræver. Samtidig skal et legitimt produkt stadig være brugbart; beskyttelsen er en afvejning, ikke blot at skjule alt.

Model extraction bør holdes adskilt fra tyveri af en systemprompt og fra udtræk af træningsdata. Disse hændelser kan overlappe i en sikkerhedsvurdering, men de har forskellige mål og kontrolbehov. En præcis definition gør det lettere at vælge relevante tests.

Vurdér, hvad grænsefladen afslører

Kortlæg tilgængelige output, detaljerede scores, forklaringer og muligheden for store mængder forespørgsler. Spørg, hvilke oplysninger kunder faktisk har brug for, og hvilke der kun er med af tekniske bekvemmelighedshensyn. Brug adgangsstyring og rimelige forbrugsgrænser, der passer til produktet. Registrér mønstre, som kan kræve undersøgelse, men undgå at antage, at enhver stor kunde eller gentagen forespørgsel er et angreb.

Beskyt værdien uden at love fuldstændig hemmeligholdelse

Et offentligt API giver nødvendigvis information om sin adfærd. Derfor kan ingen simpel rate limit garantere, at en model ikke kan efterlignes. Kombinér tekniske begrænsninger, overvågning, relevante aftalevilkår og beskyttelse af de datakilder og processer, der skaber produktets værdi. Vurder også konsekvensen: Er bekymringen konkurrence, adgang til fortrolige regler eller misbrug af en downstream-funktion? Kontrollerne bør følge det faktiske tabsscenarie.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Illustrativt eksempel: En logistikvirksomhed stiller et specialiseret estimatværktøj til rådighed for kunder. Teamet gennemgår, om svaret behøver at indeholde alle interne delscorer, og afgrænser API-adgangen til aftalte kundebehov. De indfører forbrugsovervågning og en proces til at undersøge usædvanlige kaldsmønstre. Tiltagene beskrives som begrænsning af eksponering og misbrug, ikke som bevis for, at modellens adfærd er umulig at efterligne.

Typiske faldgruber

  • At forveksle efterligning af adfærd med direkte download af modelvægte.
  • At eksponere interne scores uden et produktbehov.
  • At betragte en enkelt teknisk grænse som fuldstændig beskyttelse.

Det skal I afklare

  1. Kortlæg API-output og de oplysninger, brugeren behøver.
  2. Aftal adgang, forbrugsgrænser og undersøgelse af anomalier.
  3. Beskriv konsekvens og relevante kontrolmål i trusselsmodellen.

Spørgsmål og svar

Kan en systemprompt forhindre model extraction?

Den kan beskrive ønsket adfærd, men løser ikke alene risikoen ved systematisk adgang til modellens output. Beskyttelsen skal også ligge omkring API’et.

Gælder risikoen kun store sprogmodeller?

Nej. Forskningen omfatter også klassifikationsmodeller og andre prediction-API’er. Relevansen afhænger af adgang, output og hvilken værdi der kan efterlignes.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. Tramèr m.fl.: Stealing Machine Learning Models via Prediction APIsPrimærkilde gennemgået 7. september 2026.
  2. NIST AI 100-2: Adversarial Machine LearningPrimærkilde gennemgået 7. september 2026.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding