# Inteligencia artificial multimodal: texto, imágenes, audio y video

**Categoría:** Inteligencia artificial · **Nivel:** Inicial · **Lectura:** 11 min
**Publicada:** 2026-07-28 · **Actualizada:** 2026-07-28 · **Autoría:** Underc0de
**Versión HTML (canónica):** https://underc0de.org/guias/inteligencia-artificial/inteligencia-artificial-multimodal-texto-imagenes-audio-y-video/

## Respuesta rápida

La **inteligencia artificial multimodal** es la que trabaja con **varios tipos de información a la vez** —texto, imágenes, audio y video— en un mismo modelo, en lugar de manejar solo uno. Una «modalidad» es cada uno de esos tipos. Durante años, cada IA era *unimodal*: una entendía texto, otra reconocía imágenes, otra transcribía audio, y no se hablaban entre sí. Un modelo multimodal derriba esos muros: puede **recibir** una imagen y una pregunta en texto y responder sobre ella, **escuchar** un audio y resumirlo, o **generar** una imagen a partir de una descripción. Lo potente no es solo que maneje cada modalidad, sino que **razona entre ellas**: relaciona lo que ve con lo que lee y lo que oye, como hacemos las personas. Sus usos van de lo cotidiano (preguntarle a una foto, describir imágenes para accesibilidad) a lo profesional (analizar documentos con texto y gráficos, asistir en diagnóstico médico). Pero trae **riesgos nuevos**: la capacidad de *generar* imágenes, voz y video realistas habilita los **deepfakes** —contenidos falsos casi indistinguibles de los reales— usados para fraude, desinformación y suplantación. Por eso crece la importancia de verificar la [procedencia del contenido](../riesgos-etica-y-uso-responsable-de-la-ia/index.md) y del uso responsable.

## Qué es la IA multimodal

Una **modalidad** es un tipo de información: el texto es una modalidad, las imágenes otra, el audio otra, el video otra. Durante mucho tiempo, cada sistema de IA era **unimodal**: manejaba una sola. Los modelos de lenguaje entendían texto pero eran ciegos y sordos; los de [visión](../vision-artificial-como-analizar-imagenes-con-ia/index.md) reconocían imágenes pero no conversaban; los de [voz](../como-convertir-voz-en-texto-con-inteligencia-artificial/index.md) transcribían pero no entendían el sentido profundo.

> **Un solo modelo que integra varios sentidos**
>
> La **IA multimodal** reúne esas capacidades en un mismo modelo, que puede recibir y —en muchos casos— producir varias modalidades. Lo verdaderamente nuevo no es que sepa hacer cada cosa por separado, sino que las **relaciona**: conecta lo que ve con lo que lee y lo que oye, razonando de forma integrada. Es lo más parecido a cómo las personas percibimos el mundo, combinando sentidos, y por eso desbloquea usos que antes exigían encadenar varios sistemas distintos.

## Cómo combina modalidades

Un modelo multimodal puede operar en dos direcciones. En la **entrada**, recibe combinaciones de modalidades: una foto más una pregunta escrita, un audio, un documento con texto y gráficos. En la **salida**, según el modelo, puede producir texto, imágenes, voz o video. Muchos modelos hacen ambas cosas.

La clave técnica, sin entrar en la matemática, es que el modelo aprende a representar todas las modalidades en un **espacio común** —emparentado con la idea de los [embeddings](../que-son-los-embeddings-y-para-que-se-utilizan/index.md)—, de modo que puede relacionar un concepto sin importar si le llegó como palabra, como imagen o como sonido. Esa representación compartida es lo que le permite «razonar entre modalidades»: entender que la palabra «perro», la foto de un perro y un ladrido se refieren a lo mismo.

## Para qué sirve

Los usos se dividen en dos grandes grupos:

- **Comprensión** (el modelo recibe y analiza): preguntarle a una foto qué contiene o cómo resolver algo que muestra; describir imágenes para la **accesibilidad** de personas con dificultad visual; analizar un documento que mezcla texto, tablas y gráficos; resumir un video o una reunión grabada.
- **Generación** (el modelo crea contenido): producir imágenes a partir de una descripción; generar voz natural a partir de texto; crear o editar video. Es la parte más vistosa y también la más delicada.

En el trabajo real, la multimodalidad simplifica tareas que antes exigían encadenar herramientas: un solo modelo puede leer una factura escaneada (imagen), extraer sus datos (texto) y responder preguntas sobre ella. Y potencia a los [asistentes](../como-crear-un-chatbot-con-inteligencia-artificial/index.md), que ahora pueden ver capturas de pantalla, escuchar y responder por voz.

## Los riesgos nuevos

La capacidad de *generar* imágenes, voz y video realistas es asombrosa, pero abre una puerta peligrosa que hay que mirar de frente.

> **Atención**
>
> Los **deepfakes** son imágenes, audios o videos **sintéticos** tan realistas que cuesta o es imposible distinguirlos de los auténticos: la cara y la voz de una persona diciendo o haciendo algo que nunca dijo ni hizo. Se usan para **fraude** (estafas con la voz clonada de un familiar o un jefe), **suplantación de identidad** y **desinformación**. Frente a esto crecen las técnicas de **verificación de la procedencia** del contenido —estándares que certifican de dónde viene un material— y el marcado de contenido generado por IA. Es un tema central del [uso responsable de la IA](../riesgos-etica-y-uso-responsable-de-la-ia/index.md).

La defensa no es solo tecnológica: es también de criterio. Ante un audio o video que sorprende —sobre todo si pide dinero o urgencia—, la desconfianza y la verificación por otro canal se vuelven una habilidad básica. En ciberseguridad, los deepfakes son ya una herramienta de ingeniería social que hay que conocer para defenderse, siempre dentro de un marco legal y ético.

## Errores frecuentes

- **Creer todo lo que se ve y se oye.** Imágenes, voz y video pueden ser sintéticos; ante la sorpresa, verificar.
- **Confundir manejar varias modalidades con razonar entre ellas.** Lo valioso es la integración, no solo la suma.
- **Asumir que la generación es siempre exacta.** Un modelo puede generar imágenes con errores o texto falso con seguridad.
- **Ignorar la procedencia del contenido.** Verificar de dónde viene un material es cada vez más necesario.
- **Usar generación para engañar.** Crear deepfakes para fraude o suplantación es ilegal y dañino.
- **Olvidar los derechos y el consentimiento.** Generar la imagen o voz de una persona real tiene implicancias legales.
- **Subir contenido sensible sin evaluar la privacidad.** Enviar fotos, audios o documentos a un servicio externo expone datos.

## Preguntas frecuentes

**¿Qué es la inteligencia artificial multimodal?**
Es la inteligencia artificial capaz de trabajar con varios tipos de información a la vez —texto, imágenes, audio y video— dentro de un mismo modelo, en lugar de manejar una sola. Cada uno de esos tipos de información se llama modalidad, de ahí el nombre. Durante años, cada sistema de IA era unimodal: los modelos de lenguaje entendían texto pero no veían ni oían, los de visión reconocían imágenes pero no conversaban, y los de voz transcribían audio pero no comprendían su sentido, y además no se comunicaban entre sí, de modo que combinar sus capacidades exigía encadenar sistemas distintos. La IA multimodal derriba esos muros al reunir esas capacidades en un solo modelo que puede recibir y muchas veces también producir varias modalidades. Lo verdaderamente novedoso no es solo que maneje cada tipo por separado, sino que razona entre ellos, relacionando lo que ve con lo que lee y lo que oye de forma integrada, parecido a como las personas combinamos nuestros sentidos para entender el mundo.

**¿En qué se diferencia de un modelo de solo texto?**
Un modelo de solo texto, por muy capaz que sea, es esencialmente ciego y sordo: solo puede recibir y producir palabras. Si le querés mostrar una foto para que la analice o darle un audio para que lo resuma, no puede, porque esas modalidades están fuera de su alcance. Un modelo multimodal, en cambio, puede recibir una imagen junto con una pregunta escrita y responder sobre lo que ve, escuchar un audio y devolver un resumen, o generar una imagen a partir de una descripción, entre muchas otras combinaciones. Pero la diferencia más profunda no está en la cantidad de modalidades que maneja, sino en su capacidad de relacionarlas: un buen modelo multimodal conecta el concepto que aparece en una imagen con el mismo concepto expresado en texto o en sonido, lo que le permite razonar de forma integrada sobre información que llega por distintos canales. Esto desbloquea tareas que antes requerían encadenar varios sistemas especializados, como leer una factura escaneada, extraer sus datos y responder preguntas sobre ella, todo dentro de un mismo modelo.

**¿Para qué sirve la IA multimodal en la práctica?**
Sus usos se dividen en dos grandes grupos. Por un lado están los usos de comprensión, donde el modelo recibe y analiza información: preguntarle a una foto qué contiene o cómo resolver algo que muestra, describir imágenes para dar accesibilidad a personas con dificultad visual, analizar documentos que mezclan texto, tablas y gráficos, o resumir un video o una reunión grabada. Por otro lado están los usos de generación, donde el modelo crea contenido: producir imágenes a partir de una descripción escrita, generar voz natural a partir de texto, o crear y editar video. En el trabajo cotidiano, la multimodalidad simplifica enormemente tareas que antes exigían combinar varias herramientas distintas, y potencia a los asistentes de IA, que ahora pueden ver capturas de pantalla, escuchar y responder por voz, volviéndose mucho más versátiles. La parte de generación es la más vistosa e impactante, pero también la más delicada, porque es la que introduce los riesgos nuevos asociados a la creación de contenido sintético realista.

**¿Qué son los deepfakes y por qué son un riesgo?**
Los deepfakes son imágenes, audios o videos sintéticos, es decir generados o manipulados por inteligencia artificial, que resultan tan realistas que cuesta o directamente es imposible distinguirlos de los auténticos. Pueden mostrar la cara y reproducir la voz de una persona real diciendo o haciendo cosas que nunca dijo ni hizo. Son un riesgo serio porque habilitan varios tipos de daño: el fraude, como estafas en las que se clona la voz de un familiar o un jefe para pedir dinero con urgencia; la suplantación de identidad; y la desinformación a gran escala, al poder fabricar pruebas falsas convincentes. La capacidad de generar este tipo de contenido, que antes requería mucho tiempo y experiencia, se ha vuelto accesible gracias a la IA multimodal generativa. Frente a esto crecen en importancia las técnicas de verificación de la procedencia del contenido, que buscan certificar de dónde proviene un material, y el marcado de contenido generado por IA. Pero la defensa no es solo tecnológica: ante un audio o video sorprendente, especialmente si pide dinero o transmite urgencia, la desconfianza y la verificación por otro canal se vuelven una habilidad básica de protección.

**¿Cómo puedo protegerme de los deepfakes?**
La protección combina criterio personal y herramientas. En lo personal, lo más importante es incorporar una dosis sana de desconfianza ante contenidos que sorprenden o generan una reacción emocional fuerte, sobre todo si involucran pedidos de dinero, urgencia o información sensible: ante un audio o video de alguien conocido en una situación inesperada, conviene verificar por un canal distinto y confiable, por ejemplo llamando directamente a la persona por un número que ya se tenía. En el caso de estafas con voz clonada de familiares o jefes, acordar de antemano una palabra o pregunta de seguridad es una defensa simple y eficaz. En lo tecnológico, están surgiendo estándares de procedencia del contenido que permiten certificar el origen de un material y detectar si fue generado o alterado por IA, así como sistemas de marcado del contenido sintético, aunque ninguno es todavía infalible ni universal. A nivel organizativo, conviene establecer procesos de verificación para operaciones sensibles que no dependan solo de reconocer una voz o una cara. En definitiva, la clave es no asumir que ver u oír algo equivale a que sea verdadero, un principio que la IA multimodal vuelve más necesario que nunca.

**¿La IA multimodal reemplaza a la visión artificial y al reconocimiento de voz?**
No los reemplaza, sino que los integra y en muchos casos convive con ellos. La visión artificial y el reconocimiento del habla como campos especializados siguen siendo muy valiosos, especialmente para tareas específicas y de gran volumen donde un modelo dedicado resulta más eficiente y económico que un modelo multimodal general; por ejemplo, contar piezas defectuosas en una línea de producción o transcribir grandes cantidades de audio. Lo que hace la IA multimodal es incorporar esas capacidades dentro de un modelo unificado que además puede razonar entre ellas y combinarlas con el lenguaje, lo que abre usos nuevos y hace mucho más natural la interacción, como mostrarle una imagen y conversar sobre ella. Se puede pensar la relación así: la visión artificial y el reconocimiento de voz son disciplinas que resuelven cada modalidad en profundidad, mientras que la IA multimodal es el enfoque que las une bajo un mismo techo y las conecta entre sí y con el texto. Ambos coexisten, y la elección entre un modelo especializado y uno multimodal depende, como con la elección de cualquier modelo, de la tarea concreta, el volumen, el costo y la precisión que se necesitan.

## Fuentes

Documentación oficial y material de la comunidad consultados para esta guía. Fecha de consulta: 28 de julio de 2026.

### Aportes de la comunidad Underc0de

1. **Underc0de, foro.** [Sección Informática](https://underc0de.org/foro/informatica/). Modelos de IA y sus capacidades.
2. **Underc0de, foro.** [Sección Hacking](https://underc0de.org/foro/hacking/). Deepfakes, fraude y verificación de contenidos.

### Documentación oficial

1. **OpenAI.** [Vision](https://platform.openai.com/docs/guides/vision). Cómo un modelo procesa imágenes junto con texto.
2. **Google.** [Gemini: capacidades multimodales](https://ai.google.dev/gemini-api/docs/vision). Texto, imagen, audio y video en un modelo.
3. **MIT Technology Review.** [Cobertura de IA generativa y multimodal](https://www.technologyreview.com/). Contexto y análisis.
4. **C2PA.** [Coalition for Content Provenance and Authenticity](https://c2pa.org/). Estándar de procedencia de contenido frente a los deepfakes.

## Guías relacionadas

- [Visión artificial](../vision-artificial-como-analizar-imagenes-con-ia/index.md)
- [Voz a texto con IA](../como-convertir-voz-en-texto-con-inteligencia-artificial/index.md)
- [Riesgos, ética y uso responsable](../riesgos-etica-y-uso-responsable-de-la-ia/index.md)
- [Qué es la inteligencia artificial](../que-es-la-inteligencia-artificial/index.md)
- [Índice de Inteligencia artificial](../index.md)
