¿Qué es Multimodal?
Un modelo que procesa varios tipos de información: texto, imágenes, audio o video.
// Explicación
Los primeros LLMs solo entendían texto. Los modelos multimodales además pueden ver imágenes, escuchar audio y hasta analizar video. GPT-4o, Gemini 2.5 Pro y Claude 3.5 Sonnet son multimodales. Esto los hace mucho más versátiles para tareas del mundo real.
// Ejemplo
Le mandas una foto de tu recibo del supermercado y le dices 'dime cuánto gasté en bebidas'. Un modelo multimodal lo lee y te da el número.