Multimodal AI
A model that handles more than one kind of input or output — text, images, audio, video.
Los modelos multimodales mapean distintos tipos de datos a una representación compartida, así que puedes entregarle una captura de pantalla y una pregunta y recibir una respuesta en texto. La consecuencia práctica es que pizarrones, PDFs y voz se vuelven entradas válidas, lo que elimina el paso de transcripción en muchos flujos de trabajo.
En la práctica: Fotografiar un gráfico mal hecho en una presentación y preguntar qué tiene de malo.