Multimodal AI er kunstig intelligens, der arbejder med flere medietyper på én gang – tekst, billeder, lyd og video – i samme model. Den kan beskrive et billede, tale om et dokument og lave et diagram ud af en samtale.
De første sprogmodeller kunne kun én ting: tekst ind, tekst ud. De multimodale modeller nedbryder den grænse. Man kan fotografere en tavle og få et referat, tale til modellen i stedet for at skrive, eller bede den forvandle et regneark til en illustration.
Konsekvensen er, at AI rykker fra skrivebordet ud i resten af arbejdet – møder, præsentationer, produktion og dokumentation. Det udvider mulighederne, men også de spørgsmål om kvalitet, rettigheder og dømmekraft, som tekst-AI allerede har rejst.
I praksis
Et konkret eksempel: Du optager et kundemøde, modellen skriver referatet, trækker beslutningerne ud, foreslår en opfølgningsmail og laver en slide til styregruppen – fire medietyper i én arbejdsgang.
Sådan forklarer du det for ledelsen
»Multimodal betyder, at AI nu arbejder i alle vores formater. Derfor kan vi ikke længere afgrænse spillereglerne til det skrevne.«
Hvad det betyder for det skabende arbejde, udforsker jeg på siden om AI i kreativt arbejde.