Hvad betyder Prompttest?
Prompttest gør det muligt at vurdere en AI-instruktion systematisk. I stedet for at vælge den tekst, som giver det flotteste svar på et enkelt eksempel, undersøger teamet flere repræsentative situationer efter kriterier, der er fastlagt på forhånd.
Kriterierne skal passe til opgaven. Et dataudtræk kan vurderes på korrekte felter og kildehenvisninger. Et svarudkast kan vurderes på dokumenterede fakta, tone og håndtering af manglende information. En arbejdsgang med værktøjer kræver også kontrol af, hvilke handlinger der foreslås eller udføres.
En test er et afgrænset bevisgrundlag, ikke en garanti for alle fremtidige input. Resultatet bør derfor beskrive datasæt, model, promptversion og vurderingsmetode. Ellers kan et pænt tal være svært at fortolke eller gentage.
Begynd med de fejl, der har betydning
Saml almindelige eksempler og de sager, medarbejdere ved er vanskelige. Tilføj manglende oplysninger, tvetydige formuleringer og situationer uden et dækkende svar. Et godt forventet resultat kan være et afklaringsspørgsmål frem for en færdig konklusion.
Beskriv, hvad der gør hvert svar acceptabelt. Nogle egenskaber kan kontrolleres præcist med kode. Andre kræver en faglig vurdering. En modelbaseret bedømmer kan støtte sorteringen, men dens vurderinger bør selv kontrolleres på kendte eksempler.
Bevar eksempler som prompten ikke tilpasses til
Hvis alle tests bruges aktivt til at omskrive prompten, kan den blive god til netop disse formuleringer uden at fungere bredt. Hold derfor et særskilt sæt tilbage til vurdering af den færdige ændring.
Se også på fejltyper frem for kun en samlet score. En lille forbedring i gennemsnit kan skjule, at en sjælden, kritisk situation bliver dårligere. Gentagne kørsler på udvalgte sager kan vise variation, som ét svar ikke afslører. Vælg omfang efter risiko og ressourceforbrug.
Et eksempel fra praksis
En virksomhed vil bruge en prompt til at foreslå svar på leveringsspørgsmål. Testsættet indeholder afsendte ordrer, restordrer, flere pakker og en sag uden sporingsnummer. Hver sag har godkendte fakta og en beskrivelse af acceptable svar.
En ny prompt må ikke love en bestemt leveringsdag, når kilden kun angiver forventet afsendelse. Teamet registrerer denne fejl særskilt, selv om svaret ellers er venligt og korrekt formateret. En medarbejder gennemgår tvivlstilfælde og justerer vurderingskriterier, før testen bruges som beslutningsgrundlag.
Typiske faldgruber
- Kun lette eksempler fra demonstrationen indgår i testsættet.
- En samlet score skjuler en fejl, som har stor betydning for kunden.
- En modelbedømmer bruges uden at kontrollere dens egne vurderinger.
Det skal I afklare
- Definér opgaven og konkrete acceptkriterier før sammenligningen.
- Hold udviklingseksempler og afsluttende kontrol adskilt.
- Gem versioner, resultater og fejltyper, så ændringer kan efterprøves.
Spørgsmål og svar
Hvor mange tests skal vi have?
Der er ikke ét rigtigt antal. Begynd med de vigtigste arbejdssituationer og udvid med reelle fejl. Dækning af relevante variationer er vigtigere end et stort antal næsten ens eksempler.
Kan testen automatiseres helt?
En del kan. Format, tilladte værdier og nogle fakta kan kontrolleres med kode. Faglige vurderinger og tvetydige sager kan fortsat kræve mennesker.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Anthropic: Define success criteria and build evaluations ↗Opgavespecifikke kriterier og adskilte evalueringsdata.
- Promptfoo: Assertions and Metrics ↗Præcise og modelbaserede kontroller af output.

