Hvad betyder Computer vision?
Computer vision er computerbaseret analyse af billeder og video. En model kan eksempelvis identificere en produktkategori, lokalisere en genstand med en boks eller markere bestemte pixels. Opgaverne er forskellige og skal vurderes med kriterier, der passer til det ønskede resultat.
Et system, der kan beskrive et billede i naturligt sprog, er ikke automatisk en pålidelig kvalitetskontrol. Det kan overse små fejl, forveksle lignende dele eller tolke skygger som skader. Billedets opløsning, belysning, vinkel og baggrund påvirker grundlaget for vurderingen.
For virksomheder er det ofte nyttigt at starte med en afgrænset visuel opgave. Spørgsmålet er ikke blot, om modellen kan se billedet, men om den kan finde den relevante egenskab tilstrækkeligt sikkert og sende tvivlstilfælde videre. Opgavens konsekvens bestemmer, hvor meget menneskelig kontrol der er nødvendig.
Skeln mellem klassifikation, detektion og segmentering
Klassifikation giver en kategori for et billede eller udsnit. Objektdetektion finder placeringer og kategorier for genstande. Segmentering beskriver områder mere detaljeret på pixelniveau. En genereret billedbeskrivelse er endnu en opgave. Hvis en lagerproces skal tælle kolli, er et flydende tekstresumé ikke samme kontrol som en valideret detektion. Vælg output, som den næste del af arbejdsgangen kan kontrollere og anvende uden at gætte.
Test under de forhold, billederne faktisk kommer fra
Saml et særskilt testmateriale med relevante kameraer, lysforhold, produktvarianter og sjældne fejl. Undgå at have næsten identiske billeder fra samme optagelse i både udvikling og test, da det kan give for optimistiske resultater. Dokumentér også, hvad der ikke kan vurderes visuelt. En skjult skade eller en egenskab, som kræver fysisk måling, bliver ikke pålidelig alene ved at bede modellen om at være sikker.
Et eksempel fra praksis
Illustrativt eksempel: En møbelwebshop vil sortere indsendte reklamationsbilleder efter synlig skadetype. Teamet tester fotos i dagslys, mørke rum og med flere produkter i samme billede. Systemet må foreslå kategorien ridse eller brud, men skal markere tvivl og kan ikke afgøre årsag eller ansvar. Medarbejderen ser både foto og forslag. Det gør den visuelle analyse nyttig uden at gøre den til en automatisk afgørelse af reklamationen.
Typiske faldgruber
- At behandle en billedbeskrivelse som dokumenteret inspektion.
- At teste på bedre billeder end dem, brugerne faktisk sender.
- At udlede skjulte egenskaber, hensigter eller ansvar fra et foto.
Det skal I afklare
- Definér visuel egenskab, output og acceptable fejl.
- Test på variation i lys, vinkler og relevante produktgrupper.
- Aftal tvivlshåndtering og hvad der kræver fysisk eller menneskelig kontrol.
Spørgsmål og svar
Er en multimodal chatbot en computer vision-løsning?
Den kan indgå i en sådan løsning. Men en brugbar arbejdsgang kræver stadig datahåndtering, passende output og test af den konkrete visuelle opgave.
Kan confidence bruges som garanti?
Nej. En models score kan være fejlkalibreret, især på ukendte billeder. Vurder den mod faktiske fejl og test, hvordan systemet reagerer på usikre input.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- TorchVision: Models and pre-trained weights ↗Primærkilde gennemgået 7. september 2026.
- Hugging Face: Object detection ↗Primærkilde gennemgået 7. september 2026.

