Generative AI & LLMs beginner

Multimodal AI

A model that handles more than one kind of input or output — text, images, audio, video.

Multimodale Modelle bilden verschiedene Datentypen auf eine gemeinsame Repräsentation ab, sodass du einem Modell einen Screenshot und eine Frage geben und eine Textantwort bekommen kannst. Praktisch heißt das: Whiteboards, PDFs und Sprache werden zu gültigen Eingaben, was in vielen Abläufen den Schritt des Transkribierens überflüssig macht.

In der Praxis: Ein kaputtes Diagramm in einem Foliendeck abfotografieren und fragen, was daran nicht stimmt.

Where this comes up