Generative AI & LLMs beginner

Multimodal AI

A model that handles more than one kind of input or output — text, images, audio, video.

Modelos multimodais mapeiam tipos diferentes de dados em uma representação compartilhada, então você pode entregar a um deles uma captura de tela e uma pergunta e receber uma resposta em texto. O efeito prático é que quadros brancos, PDFs e voz viram entradas válidas, o que elimina a etapa de transcrição em um monte de fluxos de trabalho.

Na prática: Fotografar um gráfico quebrado em uma apresentação e perguntar o que há de errado com ele.

Where this comes up