Ilustración que simula una IA multimodal en tonos rosas, con figuras como un diamante, un corazón, una representación de imagen y una representación de texto

Más allá de las palabras: La IA se vuelve multimodal para encontrarlos donde están

Por Susanna Ray

Ha llovido durante días cuando navegan por la web y se encuentran con una imagen de una hermosa playa con aguas turquesas que brillan bajo el sol. «¿Dónde es eso?», se preguntan en voz alta, «¿y cómo puedo llegar allí?».

La respuesta es inmediata. Su asistente de IA no solo identifica la playa, sino que también organiza un plan de vacaciones completo para ustedes. Hablan sobre los detalles para refinar su itinerario, reciben consejos sobre cómo sobrellevar el clima gris mientras tanto y comienzan a reproducir una banda sonora sugerida para mejorar su estado de ánimo.

Las experiencias con IA se vuelven cada vez más multimodales, lo que significa que pueden ir más allá de simples preguntas en texto. En lugar de solo escribir una pregunta y recibir una respuesta, ahora pueden utilizar imágenes, audio y video para que la IA vea lo que ustedes ven en línea y escuche lo que ustedes oyen. Estas capacidades ayudan a que las herramientas de IA obtengan una imagen más completa de lo que desean hacer, al mismo tiempo que les ofrecen formas más intuitivas de interactuar con la tecnología y acceder a la información de manera más rápida y sencilla.

Al igual que el cerebro humano absorbe información de texto, imágenes y audio de manera simultánea, los investigadores han trabajado para «fusionar todas estas capacidades en un solo modelo universal», dice Ryan Volum, quien dirige el desarrollo de productos de IA en Microsoft. «Le brindamos más y más del mundo que vemos como humanos».

Si bien los modelos de IA multimodal no son nuevos por completo, han comenzado a tener un impacto real en el mundo, con herramientas que ayudan a los médicos a diagnosticar y tratar pacientes con mayor precisión y a las agencias meteorológicas a predecir tormentas severas con mayor exactitud

Las herramientas multimodales también ayudan a la gente a simplificar asuntos más mundanos, como cuando Volum trató de manera reciente de elegir entre distintas opciones de seguro médico.

En lugar de tener que profundizar en el denso lenguaje de cada plan, Volum recurrió a Copilot Vision, una función de Microsoft que proporciona asistencia en tiempo real para que la navegación por Internet resulte menos abrumadora. Con su permiso, Copilot Vision fue capaz de ver todo lo que había en el sitio que consultaba -no sólo texto, sino también gráficos e imágenes- y resumirlo todo para él en menos tiempo del que le habría llevado hojear la primera línea. 

A continuación, respondió a sus preguntas en una conversación natural, para aportar información de otras fuentes que le ayudaron a tomar una decisión.

“Fue capaz de encontrarme en mi mundo” y ofrecerme mejor ayuda, dice Volum. Lo compara con la forma en que dos personas suelen trabajar juntas para pilotar un avión.

“Si en un avión el copiloto sólo pudiera oír lo que dices, pero no pudiera ver lo que ves, sería mucho menos útil”, dice. “Pero como puede ver las nubes que tiene delante, los indicadores del tablero y la telemetría del avión, el copiloto es mucho más útil y el usuario tiene que hacer mucho menos para comunicar lo que necesita”.

Con la IA multimodal, los desarrolladores han construido sobre la base de los recientes avances en el lenguaje natural y han extendido esas capacidades a diferentes tipos de entradas. De la misma manera que los modelos de lenguaje de gran escala (LLMs, por sus siglas en inglés) realizan tareas basadas en texto al extraer conceptos codificados en el lenguaje y el pensamiento humano, para hacer inferencias lógicas, resolver problemas y generar contenido, los modelos multimodales hacen lo mismo con otros modos de comunicación, como la voz y las imágenes.

Los modelos se entrenan con vastos conjuntos de datos para identificar características clave en diferentes tipos de información, como palabras y frases en textos, formas y colores en imágenes, o tonos y frecuencias en audio. Organizan estas entradas y las conectan de manera unificada, al relacionar, por ejemplo, una imagen de un gato con la palabra escrita o hablada «gato», y luego reconocen patrones para hacer conexiones entre modalidades.

Una vez entrenado, un modelo puede traducir entre modos para entender y crear contenido. Puede generar una imagen a partir de instrucciones habladas de alguien o crear audio a partir de un texto escrito.

Ilustración con un cubo con números dentro, en tonos rojos y rosas

Estas capacidades ampliadas ayudan a clínicos y científicos, en particular, a lograr grandes avances, dice Jonathan Carlson, quien lidera la investigación en ciencias de la salud en Microsoft Health Futures.

Los LLMs se utilizan durante las consultas médicas para registrar y organizar conversaciones con los pacientes, incluso si la discusión salta entre síntomas y preguntas. Esto facilita diversas tareas de seguimiento que, de otro modo, requerirían mucho tiempo y atención por parte del médico, como redactar un resumen de la visita y una derivación a un especialista, que el doctor solo tendría que revisar y firmar.

Además, los modelos multimodales dan un paso más al analizar píxeles en imágenes médicas, para identificar posibles tumores o anomalías difíciles de detectar. La IA puede utilizarse para respaldar y validar el trabajo de un patólogo e incluso detectar aspectos que podrían pasar desapercibidos para el ojo humano, dice Carlson, o extrapolar información para ayudar a diagnosticar enfermedades raras que cuentan con datos de entrenamiento limitados.

«Ahora tenemos modelos que comprenden conceptos codificados en imágenes y en lenguaje», dice Carlson. «Así que puedes decir: ‘Tengo una imagen de patología, muéstrame todas las células inmunitarias, identifica cualquier célula cancerosa sospechosa y dime si hay biomarcadores que puedan ayudarme a elegir el tratamiento adecuado’. Una vez que se tienen modelos con estos conceptos tan ricos, en realidad es muy sencillo alinearlos y combinarlos, para lograr una experiencia en la que, en esencia, se puede hablar con una imagen».

Esa capacidad ayuda a los profesionales médicos a realizar pruebas más específicas y tratamientos más precisos, lo que mejora los resultados gracias a diagnósticos más tempranos y ahorra tiempo, molestias y dinero a los pacientes al reducir procedimientos innecesarios.

Muchas personas podrán utilizar capacidades multimodales en los navegadores Edge con Copilot Vision, ahora disponible para todos los usuarios de Copilot Pro y gratuitos en EE.UU. Cada usuario tiene el control sobre su uso: deben hacer clic en el icono de Copilot Vision para iniciar una sesión y, una vez finalizada, los datos se eliminan.

Ilustración con un cubo con la representación gráfica de imagen dentro, en tonos rojos y rosas

Las empresas y los desarrolladores pueden elegir entre un amplio catálogo de modelos multimodales o recibir ayuda para combinarlos entre las 1,800 opciones disponibles en Azure AI Foundry para crear herramientas comerciales más inteligentes e interactivas.

Por ejemplo, Mercedes-Benz ha creado una herramienta que usa Azure AI Vision y GPT-4 Turbo para analizar los alrededores de un automóvil y responder preguntas del conductor, como si está permitido estacionar en cierta calle o identificar edificios cercanos.

El modelo Magma, introducido de manera reciente por Microsoft, integra la percepción visual con la comprensión del lenguaje para ayudar a asistentes de IA o robots a comprender entornos en los que no han sido entrenados y sugerir acciones adecuadas para nuevas tareas, como tomar una herramienta o navegar por un sitio web y hacer clic en un botón para ejecutar un comando. Es un paso significativo hacia agentes de IA que pueden funcionar como asistentes versátiles y de propósito general.

Por otro lado, el nuevo modelo multimodal Phi-4 puede procesar voz, visión y texto directo en los dispositivos, y utiliza menos poder de cómputo que sus predecesores. Este modelo más pequeño y accesible permite a los desarrolladores crear aplicaciones eficientes que destacan en tareas matemáticas y lógicas.

Las capacidades multimodales en servicios como Azure AI Content Understanding pueden ayudar a extraer información significativa a partir de grandes volúmenes de datos no estructurados, como grabaciones de centros de llamadas, documentos escaneados o publicaciones en redes sociales.

Toda esta capacidad conlleva nuevos riesgos y la necesidad de mayor educación sobre IA y colaboración en su protección, dice Sarah Bird, directora de producto de AI Responsable en Microsoft.

La forma en que las personas son representadas —o mal representadas— es un riesgo único de la IA multimodal, dice Bird, ya que la tecnología generativa puede imitar la apariencia o la voz de alguien.

Además, las reacciones de las personas varían según las modalidades utilizadas, explica. Por ejemplo, las imágenes violentas se perciben como más graves que el texto violento; un video se considera más confiable que una historia escrita; y cuando un asistente de IA, como Copilot, habla con una voz audible, los errores parecen más intencionados que cuando aparecen en pantalla.

Ilustración con un cubo con letras dentro, en tonos rojos y rosas

Por ello, los investigadores de seguridad e ingenieros de Microsoft han reforzado las medidas de protección ya establecidas para la IA generativa, dice Bird.

A medida que se introducen más modalidades, también aumentan los riesgos. Entradas como texto, imágenes o audio, que por sí solas pueden ser inofensivas, pueden combinarse para generar contenido dañino, como una foto de una persona famosa acompañada de un texto que la describa como un animal. Por esta razón, Microsoft mejorado sus modelos de seguridad para analizar el resultado en su conjunto, en lugar de evaluar tan solo las partes individuales, explica Bird.

También es fundamental generar una mayor conciencia sobre los riesgos y cómo reconocer contenido generado por IA. Microsoft firma de manera criptográfica todo el contenido de IA creado con su tecnología para que cualquiera pueda identificarlo. La educación y la capacitación son esenciales para que las personas sepan reconocer estas firmas y entender su significado, al igual que la colaboración entre organizaciones tecnológicas, como la coalición C2PA, fundada por Microsoft y otros líderes de la industria para desarrollar estándares que certifiquen las fuentes.

«Hay mucho que podemos hacer a nivel tecnológico y dentro de la plataforma para reducir el riesgo», afirma Bird. «Pero también hay nuevo contenido en el mundo, y el mundo necesita ajustar su enfoque ante esto. Cada persona tiene un papel en la evaluación y defensa contra los riesgos de la IA multimodal».

La investigación avanza con rapidez, a medida que los desarrollos se construyen unos sobre otros.

Por primera vez, en los últimos años, los investigadores cuentan con la maquinaria y la asistencia de IA multimodal que les permite construir una visión holística de una célula, dice Carlson.

Ilustración con un cubo con la representación gráfica de volumen dentro, en tonos rojos y rosas

“El siguiente paso es: ¿cómo puede un modelo aprender a comprender las proteínas?”, comenta. “Hemos trabajado mucho en ello, y se pueden tomar los mismos conceptos del modelado de lenguaje y aplicarlos a cientos, miles o incluso millones de secuencias de proteínas” para diseñar antígenos para vacunas, por ejemplo.

“Se trata de aprender el lenguaje de la naturaleza”, añade. “De la misma manera en que aprendemos el lenguaje humano, ¿podemos aprender el lenguaje de cómo se expresa una célula o cómo funcionan en realidad las secuencias de proteínas?”

Poder utilizar texto, voz, imágenes, audio y video para resolver múltiples problemas al mismo tiempo abre un mundo de nuevas oportunidades, dice Volum.

“La inteligencia artificial nos encontrará cada vez más donde estemos”, afirma, “para comprender mejor nuestras necesidades y satisfacerlas de manera más proactiva”.

Ilustraciones de Michał Bednarski / Makeshift Studios.

Español (España)
Icono de exclusión de opciones de privacidad Tus opciones de privacidad
Privacidad de la salud del consumidor Ponte en contacto con Microsoft Privacidad Gestionar cookies Condiciones de uso Marcas registradas Sobre nuestra publicidad Docs de cumplimiento de la UE