Uforpligtende snakFå afklaret jeres idé, udfordring eller næste skridtTal med os
← Udforsk AI-ordbogen
Modeller & arkitektur

Multimodal model

En model, der kan behandle flere typer information, eksempelvis tekst og billeder.

Moselstudio · AI-ordbog2 min. læsning
Få en uforpligtende snak om mulighederne ↗
Fire analoge medieformater er forbundet med en tom træbakke på et lyst bord
Multimodale input

Hvad betyder Multimodal model?

En multimodal model kan behandle mere end én type information, eksempelvis tekst og billeder. Understøttet input og understøttet output er forskellige egenskaber: en model kan analysere et billede uden at kunne generere et nyt billede.

Den tekniske sammenkobling af modaliteter varierer. Systemer kan bruge særlige encodere og koblinger til en sprogmodel eller en mere samlet arkitektur. Derfor er det for upræcist at sige, at alle multimodale modeller repræsenterer al information på samme måde.

Et forretningseksempel er at kombinere et produktfoto med kundens fejlbeskrivelse. Kontrollen skal stadig omfatte uskarpe billeder, manglende detaljer og oplysninger, modellen ikke kan se. Tjek filtyper, størrelsesgrænser og modaliteter i dokumentationen for det præcise model-ID og API.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. OpenAI: Aktuelle API-modeller ↗
  2. Google: Gemini API-modeller ↗
FRA VIDEN TIL JERES NÆSTE SKRIDT

Hvordan kan I bruge Multimodal model i jeres virksomhed?

Fortæl om den opgave, I gerne vil gøre lettere. Vi tager en uforpligtende snak om jeres muligheder og hjælper med at vælge et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Vi aftaler næste skridt med jer