Multimodal AI er kunstig intelligens, der arbejder med flere medietyper på én gang – tekst, billeder, lyd og video – i samme model. Den kan beskrive et billede, tale om et dokument og lave et diagram ud af en samtale.

De første sprogmodeller kunne kun én ting: tekst ind, tekst ud. De multimodale modeller nedbryder den grænse. Man kan fotografere en tavle og få et referat, tale til modellen i stedet for at skrive, eller bede den forvandle et regneark til en illustration.

Konsekvensen er, at AI rykker fra skrivebordet ud i resten af arbejdet – møder, præsentationer, produktion og dokumentation. Det udvider mulighederne, men også de spørgsmål om kvalitet, rettigheder og dømmekraft, som tekst-AI allerede har rejst.

I praksis

Et konkret eksempel: Du optager et kundemøde, modellen skriver referatet, trækker beslutningerne ud, foreslår en opfølgningsmail og laver en slide til styregruppen – fire medietyper i én arbejdsgang.

Sådan forklarer du det for ledelsen

»Multimodal betyder, at AI nu arbejder i alle vores formater. Derfor kan vi ikke længere afgrænse spillereglerne til det skrevne.«

Hvad det betyder for det skabende arbejde, udforsker jeg på siden om AI i kreativt arbejde.