Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Prompting & inference

Prompttest

Prompttest undersøger en prompts adfærd på et aftalt sæt opgaver og kriterier, herunder normale sager, undtagelser og input, hvor svaret bør være usikkert.

Også kaldet: Prompt testing · Prompt evaluation

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
Tre skåle med meget forskellige materialer står på samme balance.
Forskellige tilfælde prøves under en fælles vurderingsramme.

Hvad betyder Prompttest?

Prompttest gør det muligt at vurdere en AI-instruktion systematisk. I stedet for at vælge den tekst, som giver det flotteste svar på et enkelt eksempel, undersøger teamet flere repræsentative situationer efter kriterier, der er fastlagt på forhånd.

Kriterierne skal passe til opgaven. Et dataudtræk kan vurderes på korrekte felter og kildehenvisninger. Et svarudkast kan vurderes på dokumenterede fakta, tone og håndtering af manglende information. En arbejdsgang med værktøjer kræver også kontrol af, hvilke handlinger der foreslås eller udføres.

En test er et afgrænset bevisgrundlag, ikke en garanti for alle fremtidige input. Resultatet bør derfor beskrive datasæt, model, promptversion og vurderingsmetode. Ellers kan et pænt tal være svært at fortolke eller gentage.

Begynd med de fejl, der har betydning

Saml almindelige eksempler og de sager, medarbejdere ved er vanskelige. Tilføj manglende oplysninger, tvetydige formuleringer og situationer uden et dækkende svar. Et godt forventet resultat kan være et afklaringsspørgsmål frem for en færdig konklusion.

Beskriv, hvad der gør hvert svar acceptabelt. Nogle egenskaber kan kontrolleres præcist med kode. Andre kræver en faglig vurdering. En modelbaseret bedømmer kan støtte sorteringen, men dens vurderinger bør selv kontrolleres på kendte eksempler.

Bevar eksempler som prompten ikke tilpasses til

Hvis alle tests bruges aktivt til at omskrive prompten, kan den blive god til netop disse formuleringer uden at fungere bredt. Hold derfor et særskilt sæt tilbage til vurdering af den færdige ændring.

Se også på fejltyper frem for kun en samlet score. En lille forbedring i gennemsnit kan skjule, at en sjælden, kritisk situation bliver dårligere. Gentagne kørsler på udvalgte sager kan vise variation, som ét svar ikke afslører. Vælg omfang efter risiko og ressourceforbrug.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

En virksomhed vil bruge en prompt til at foreslå svar på leveringsspørgsmål. Testsættet indeholder afsendte ordrer, restordrer, flere pakker og en sag uden sporingsnummer. Hver sag har godkendte fakta og en beskrivelse af acceptable svar.

En ny prompt må ikke love en bestemt leveringsdag, når kilden kun angiver forventet afsendelse. Teamet registrerer denne fejl særskilt, selv om svaret ellers er venligt og korrekt formateret. En medarbejder gennemgår tvivlstilfælde og justerer vurderingskriterier, før testen bruges som beslutningsgrundlag.

Typiske faldgruber

  • Kun lette eksempler fra demonstrationen indgår i testsættet.
  • En samlet score skjuler en fejl, som har stor betydning for kunden.
  • En modelbedømmer bruges uden at kontrollere dens egne vurderinger.

Det skal I afklare

  1. Definér opgaven og konkrete acceptkriterier før sammenligningen.
  2. Hold udviklingseksempler og afsluttende kontrol adskilt.
  3. Gem versioner, resultater og fejltyper, så ændringer kan efterprøves.

Spørgsmål og svar

Hvor mange tests skal vi have?

Der er ikke ét rigtigt antal. Begynd med de vigtigste arbejdssituationer og udvid med reelle fejl. Dækning af relevante variationer er vigtigere end et stort antal næsten ens eksempler.

Kan testen automatiseres helt?

En del kan. Format, tilladte værdier og nogle fakta kan kontrolleres med kode. Faglige vurderinger og tvetydige sager kan fortsat kræve mennesker.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. Anthropic: Define success criteria and build evaluationsOpgavespecifikke kriterier og adskilte evalueringsdata.
  2. Promptfoo: Assertions and MetricsPræcise og modelbaserede kontroller af output.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding