Multimodal AI
A model that handles more than one kind of input or output — text, images, audio, video.
Multimodale Modelle bilden verschiedene Datentypen auf eine gemeinsame Repräsentation ab, sodass du einem Modell einen Screenshot und eine Frage geben und eine Textantwort bekommen kannst. Praktisch heißt das: Whiteboards, PDFs und Sprache werden zu gültigen Eingaben, was in vielen Abläufen den Schritt des Transkribierens überflüssig macht.
In der Praxis: Ein kaputtes Diagramm in einem Foliendeck abfotografieren und fragen, was daran nicht stimmt.