Generative AI & LLMs beginner

Multimodal AI

A model that handles more than one kind of input or output — text, images, audio, video.

I modelli multimodali mappano tipi di dati diversi in una rappresentazione condivisa, così puoi passare loro uno screenshot e una domanda e ottenere una risposta testuale. La conseguenza pratica è che lavagne, PDF e voce diventano tutti input validi, il che elimina il passaggio della trascrizione da parecchi flussi di lavoro.

In pratica: Fotografare un grafico sbagliato dentro una presentazione e chiedere che cosa non va.

Where this comes up