Generative AI & LLMs beginner

Multimodal AI

A model that handles more than one kind of input or output — text, images, audio, video.

Les modèles multimodaux projettent différents types de données dans une représentation commune : vous pouvez donc en donner un une capture d’écran accompagnée d’une question et obtenir une réponse en texte. Concrètement, tableaux blancs, PDF et voix deviennent des entrées valides, ce qui supprime l’étape de transcription dans quantité de flux de travail.

En pratique : Photographier un graphique bancal dans une présentation et demander ce qui cloche.

Where this comes up