Multimodale Modelle verarbeiten verschiedene Eingabeformen in einem gemeinsamen Verstaendnis, statt nur reinen Text. Dadurch koennen sie Bilder beschreiben, Diagramme interpretieren, Sprache transkribieren oder aus Text Bilder erzeugen. Bekannte Beispiele sind GPT-4o, Claude und Gemini, die Text und Bilder kombiniert verstehen. Multimodalitaet eroeffnet Anwendungen von der Dokumentenanalyse bis zur barrierefreien Bildbeschreibung.
