Tech leads, CTO'er, AI-product managers
Markedet i dag — sammenlign konkrete versioner
Claude, GPT og Gemini er relevante modelfamilier at undersøge, men ingen af navnene fortæller alene, hvad en bestemt integration kan. Familierne ændrer sig, og hver model kan have forskellige grænser, funktioner og priser.
Start med opgaven og de ufravigelige krav. Skal modellen udtrække felter, formulere danske svar, læse billeder eller styre værktøjer? Skal svar komme løbende, og hvad må sendes til leverandøren? Udpeg derefter et lille antal konkrete kandidater.
Andre modeller, herunder modeller med tilgængelige vægte, kan være relevante. Egen drift tilføjer dog ansvar for kapacitet, sikkerhed og vedligehold. Vælg ikke en løsning alene ud fra brand, parameterantal eller en udokumenteret påstand om bedst kvalitet.
Claude — hvad bør I undersøge?
Anthropics modeloversigt beskriver aktuelle versioner, model-ID'er og deres egenskaber. Brug den enkelte models dokumentation til at afklare kontekst, maksimalt output, værktøjer og adgangsplatform. Den tidligere regel om samme kontekstvindue på alle Claude-modeller er ikke dækkende.
Til danske dokumentopgaver bør I teste fagudtryk, undtagelser og svar uden tilstrækkeligt belæg. Vurder om modellen følger jeres instruktioner under pres, eksempelvis når et dokument indeholder uvedkommende instruktioner.
En leverandørs egne præstationsbeskrivelser er et udgangspunkt for udvælgelse, ikke dokumentation for at modellen er bedst eller sikrest i jeres løsning. Sammenlign omkostningen ved et godkendt svar og kontrollér data- og kontraktvilkår for den valgte platform.
GPT og OpenAI — hvad bør I undersøge?
OpenAI tilbyder modeller og API-funktioner med forskellige egenskaber. Skeln mellem ChatGPT-produktet og den model/API, som skal integreres i jeres system. Et godt resultat i en chatapp kan afhænge af instruktioner og værktøjer, som jeres integration endnu ikke har.
Kontrollér den præcise støtte for billeder, lyd, strukturerede output og værktøjer. Flere funktioner er model- eller endpointafhængige. Ved funktionskald er det stadig applikationen, der skal kontrollere rettigheder og håndtere udførelsen.
Læs også data controls for de anvendte funktioner. Lagring, cache, filer og eksterne MCP-servere kan have forskellige forhold. Gem model-ID og promptversion, så ændringer kan undersøges og en migration kan testes på samme grundlag.
Gemini — hvad bør I undersøge?
Googles modeloversigt adskiller aktuelle, ældre og preview-versioner. Vælg efter den konkret dokumenterede funktionalitet og plan for levetid. Produktbetegnelser og abonnementer i brugerapps skal ikke forveksles med API-modeller.
Hvis opgaven indeholder billeder, lyd eller video, skal både inputformat og ønsket output kontrolleres. Et stort kontekstvindue kan være relevant, men viser ikke, at modellen sikkert bruger hvert forbehold i et langt dokument.
Et eksisterende Google-miljø kan gøre nogle integrationer praktiske. Sammenlign alligevel på jeres egne opgaver. Gratis udviklingskvoter og gamle prisforhold bør ikke bruges som produktionsbudget; anvend den gældende prisliste og mål forbruget i den valgte konfiguration.

Beslutningsmatrix
Lav et testsæt før leverandørvalget. Medtag typiske opgaver, vanskelige tilfælde og input, hvor det korrekte svar er at stoppe eller bede om mere information. Brug samme kildegrundlag og kriterier for kandidaterne.
Mål mere end et gennemsnit. Et enkelt alvorligt datalæk eller en forkert systemhandling kan være vigtigere end mange velformulerede svar. Fastlæg derfor både minimumskrav og fejl, der udelukker en kandidat.
Sammenlign pris inklusive modelkald, værktøjer, genforsøg og menneskelig kontrol. Skeln mellem tid til første del af svaret og tid til afsluttet opgave. Gem dato, modelversion, indstillinger og begrænsninger sammen med resultatet.
| Opgave | Kvalitetstest | Driftskontrol |
|---|---|---|
| Kundeservicesvar | Korrekt politik, kildebelæg og eskalation | Svartid og genhenvendelser |
| Dokumentudtræk | Felter, manglende værdier og ugyldige data | Pris pr. godkendt dokument |
| Værktøjsbrug | Rigtige argumenter og passende handling | Rettigheder, genforsøg og dubletter |
| Analyse | Kontrollerbare beregninger og forbehold | Reviewtid og samlet forbrug |
Hybrid setups — når flere modeller er begrundet
En løsning kan bruge forskellige modeller til forskellige opgaver. En afgrænset klassifikation og en vanskelig analyse kan eksempelvis have forskellige kvalitets- og svartidskrav. Det er en mulighed, ikke en automatisk vej til bedst ROI.
Routing tilfører fejlsituationer. Systemet kan vælge forkert, sende data til en anden leverandør end forventet eller give forskellig kvalitet ved fallback. Definér derfor, hvilke data hver model må modtage, og hvad der sker, når en kandidat er utilgængelig.
Begynd med en kendt baseline. Tilføj en anden model, når målingerne viser en fordel, der også kan bære ekstra vedligehold. Test hele forløbet, inklusive routing og menneskelig kontrol, før I konkluderer, at den nye kombination er bedre.
Læs videre ved kilden.
Vores beslutningsmodeller er rådgivning fra Mosel Studio. Tekniske fakta og rammer understøttes af kilderne her.
- OpenAI: Aktuelle API-modeller
Aktuelle OpenAI-modeller; specifikationer er versionsafhængige.
- Anthropic: Claude-modeller
Aktuelle Claude-modeller og adgangsformer.
- Google: Gemini API-modeller
Aktuelle Gemini-modeller og livscyklus.
- Meta: Llama-modeller og modellicenser
Modelkort og vilkår for tilgængelige vægte.
- OpenAI: Using tools
Værktøjsunderstøttelse er ikke det samme som tilladelse.
- OpenAI: Data controls
Funktionsafhængig databehandling hos OpenAI.
- OWASP: Prompt Injection
Test af ubetroede instruktioner.
- Anthropic: Demystifying evals for AI agents
Evaluering og relevante fejlforløb.
- LangSmith: Evaluation concepts
Sammenligneligt testgrundlag.
- Anthropic: Building effective agents
Afvejning mellem workflows og mere kompleks autonomi.




