Hvad betyder Agentevaluering?
Agentevaluering er en systematisk vurdering af et helt agentforløb. Den ser både på slutresultatet og på de handlinger, der førte dertil. En agent kan give et korrekt svar efter unødvendige eller uautoriserede handlinger, eller den kan skrive en god afslutning uden at have udført opgaven.
Derfor skal evalueringen begynde med et observerbart succeskriterium. Det kan være et korrekt dokumentudtræk, et godkendeligt udkast eller en bestemt registrering i et testmiljø. Modellens egen vurdering af, at den er færdig, er ikke tilstrækkelig.
Brug realistiske opgaver og tydelige udfald
Et testsæt bør dække både almindelige opgaver, manglende data, tekniske fejl og tilfælde, hvor agenten skal afvise eller eskalere. Beskriv hvilke resultater der er acceptable, men undgå at kræve én bestemt handlingsrute, hvis flere veje er korrekte. Ellers kan en forbedret løsning blive bedømt som forkert af en for snæver test.
Faste kontroller kan undersøge felter, objekt-ID'er og systemtilstand. Fagpersoner kan vurdere nuancer, og en modelbaseret evaluator kan hjælpe med større mængder. Dens bedømmelser bør kalibreres mod menneskelige vurderinger, især før scoren bruges til vigtige beslutninger.
Adskil kvalitet, grænser og forbrug
Rapportér opgaveløsning, uønskede handlinger og ressourceforbrug særskilt. En høj gennemsnitlig kvalitet kan skjule få alvorlige adgangsfejl. Gem modelversion, instruktioner, værktøjsversion og relevante testforudsætninger, så resultater kan sammenlignes. Gentagne forsøg kan vise variation, men bør ikke bruges til kun at udvælge det bedste resultat. Nye fejl fra driften kan føjes til testsættet, så en rettelse bliver kontrolleret ved senere ændringer.
Et eksempel fra praksis
En agent skal forberede svar på tekniske supportspørgsmål fra godkendte kilder. Testsættet indeholder kendte svar, modstridende dokumentversioner og spørgsmål uden kildegrundlag. Evalueringen måler, om svaret er brugbart, om de rigtige kilder er valgt, og om manglende viden bliver markeret. Den kontrollerer også, at agenten ikke sender noget til kunden. En ændret prompt sammenlignes med den tidligere version på samme spørgsmål.
Typiske faldgruber
- At måle på agentens afsluttende tekst frem for det faktiske resultat.
- At skjule sjældne grænseoverskridelser i én samlet gennemsnitsscore.
- At forbedre modellen på testsættet og derefter bruge samme sæt som uafhængigt bevis.
Det skal I afklare
- Definér observerbart slutresultat og uacceptable handlinger.
- Dæk normale, svære, fejlramte og afvisningskrævende opgaver.
- Gem versionsoplysninger og vurder både succes, variation og forbrug.
Spørgsmål og svar
Er et offentligt benchmark nok?
Nej. Det kan give kontekst om en model, men ikke bevise, at jeres agent fungerer med egne data, rettigheder og værktøjer. Der kræves opgaver, som afspejler den konkrete anvendelse.
Skal alle trin være identiske mellem testkørsler?
Ikke nødvendigvis. Vurder det rigtige resultat og de nødvendige grænser. Et krav om identiske værktøjskald kan afvise andre gyldige måder at løse opgaven på.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Anthropic: Evals for AI agents ↗Skellet mellem et forløbs tekst og det faktisk opnåede resultat.
- LangSmith: Evaluation ↗Datasæt, evaluatorer og sammenligning af eksperimenter.

