Presentamos Quine: un sistema de investigación en IA diseñado para la complejidad de la biología

11 minutos
Diagrama del enfoque de ciclo cerrado de Project Quine para la investigación biológica. Un científico plantea preguntas que se envían a Quine para su procesamiento computacional in silico. Quine combina un modelo integral de la biología, que abarca genómica, proteínas, química, estado celular y bioimagen, con una plataforma de orquestación y razonamiento respaldada por conocimiento y herramientas. Quine genera propuestas que se ponen a prueba mediante experimentos de laboratorio en el mundo real. Las mediciones experimentales regresan al científico e informan la siguiente pregunta, creando un ciclo iterativo entre el modelado computacional y la experimentación real.

Resumen

  • Quine es un esfuerzo de investigación para crear un modelo mundial multimodal de biología y un arnés interactivo que conecte modelos, herramientas científicas, literatura e investigadores.
  • En colaboración con investigadores del Broad Institute of Harvard y el MIT, hemos utilizado este sistema para priorizar compuestos predichos para impulsar cambios terapéuticos en el estado tumoral y validado varios candidatos mejor clasificados en múltiples ensayos de laboratorio húmedo.
  • El programa Quine Fellows dará a un grupo de científicos acceso al sistema y la oportunidad de acelerar su propia investigación y proporcionar retroalimentación científica.
  • Quine es una tecnología de investigación experimental destinada solo a la investigación, no a un uso clínico o médico, y sus resultados pueden ser incompletos o inexactos, requiere revisión por investigadores cualificados y validación científica y experimental adecuada. A medida que la tecnología madura, esperamos ampliar el acceso a través de productos como Microsoft Discovery.

Por: Nicolo Fusi, vicepresidente y científico distinguido; Jonathan M. Carlson, vicepresidente.

Durante más de dos décadas, Microsoft Research ha trabajado en la intersección entre la computación y la biología. Nuestra investigación ha abarcado inmunología, virología, genómica, imagen biomédica, biología celular e ingeniería de proteínas. Ese trabajo ha producido métodos fundamentales, nueva ciencia y tecnología que han llegado a la clínica, desde el diagnóstico de enfermedades raras e infecciosas hasta la detección de biomarcadores del cáncer.

A lo largo de ese trabajo, una lección se ha vuelto cada vez más clara: la biología no se divide en los límites claros que suelen hacer nuestros modelos y herramientas. Los genes influyen en las proteínas; las proteínas interactúan dentro de las células; las células se organizan en tejidos; y los experimentos remodelan de manera continua lo que los científicos saben y lo que eligen preguntar a continuación. Por tanto, avanzar en las preguntas biológicas más difíciles requiere más que modelos cada vez más capaces de conjuntos de datos o tareas individuales. Requiere sistemas que puedan conectar el conocimiento a través de escalas y modalidades, razonar sobre experimentos y evidencias, y participar en el proceso iterativo a través del cual avanza la ciencia.

Microsoft Research presenta Quine, un esfuerzo de investigación diseñado para trabajar más allá de esos límites, lo que refleja nuestra visión a largo plazo de un sistema de descubrimiento que evolucione a través del uso científico. Quine reúne un modelo mundial de biología con un arnés que conecta herramientas científicas, literatura, el laboratorio húmedo y los investigadores que las utilizan.

Los límites de la experimentación

Aunque las técnicas experimentales han mejorado y el rendimiento en laboratorio húmedo ha aumentado, la biología se mantiene, de manera fundamental, limitada por el tiempo y la complejidad. La naturaleza no puede ser apresurada, ni derivada de principios básicos. Los experimentos son lentos, los ciclos de iteración son largos y muchas de las preguntas más importantes involucran interacciones, espacios de diseño combinatorios y efectos posteriores que son tan solo demasiado grandes para explorarlos solo de manera experimental.

Al mismo tiempo, los avances en el aprendizaje automático a gran escala, en especial la aparición de modelos de base y razonamiento de propósito general que pueden resolver problemas de manera iterativa, sugieren una nueva posibilidad. Estos sistemas han comenzado a demostrar capacidades más allá del reconocimiento de patrones: integrar información entre dominios, razonar sobre abstracciones y apoyar la resolución iterativa de problemas. Por igual de importante, muchas de las técnicas desarrolladas para el lenguaje humano han demostrado ser, de manera notable, adaptables a aspectos de la biología, lo que permite a los modelos aprender representaciones de sistemas biológicos a través de diversos tipos y escalas de datos.

Esto planteó una pregunta provocadora para nosotros: ¿qué haría falta para construir un modelo mundial para la biología? Por modelo mundial, entendemos un sistema que pueda representar el estado de un sistema biológico, predecir cómo evolucionará ese estado en respuesta a intervenciones y razonar sobre las consecuencias de esas intervenciones varios pasos en el futuro. Un sistema así no reemplazaría la experimentación. Más bien, nos permitiría usar la computación para explorar, proponer, clasificar y priorizar posibles caminos antes de comprometer recursos de laboratorio escasos. Nuestra estrella polar es un futuro en el que científicos, modelos y experimentos operen en un bucle que se acelera continuamente.

Lo que hemos construido

Quine es nuestro primer paso hacia esa visión. Incluye tanto un modelo mundial de biología como un arnés que conecta el modelo con modelos de orquestación y razonamiento, herramientas científicas, la literatura y los equipos de científicos que los utilizan.

Figura 1: Los dos componentes Frontier de Quine — un modelo mundial de biología y un arnés interactivo — se sitúan dentro de un bucle que comienza y termina con el científico. Una pregunta se convierte en un conjunto de propuestas, las propuestas se convierten en diseños que merecen la pena probar, y el experimento devuelve mediciones que afinan tanto la siguiente pregunta del científico como el propio modelo.

El núcleo de este esfuerzo es el modelo mundial, que aprende representaciones compartidas a través de modalidades y escalas biológicas, lo que incluye secuencia, estructura, función, estado celular y datos de imagen. Al entrenar de manera conjunta entre estas modalidades, Quine puede utilizar la evidencia de una modalidad para informar predicciones en otra, al capturar relaciones que de otro modo permanecerían aisladas o perdidas cuando el sistema orquestaría modelos especializados de dominio único separados. Este diseño multimodal refleja la realidad de la biología: comprender un nivel requiere contexto de los demás. En lugar de diluir el rendimiento, encontramos que el aprendizaje a través de estas representaciones conectadas lo fortalece, lo que permite que el modelo generalice de manera más eficaz y soporte una gama más amplia de tareas de razonamiento biológico.

Figura 2: La biología es multiescala y multimodal. (A) La evidencia biológica se acumula desde moléculas hasta células, tejidos y pacientes, con un lenguaje científico que corre por debajo de todo ello. (B) Las modalidades en las que se entrena el Proyecto Quine — genómica, proteínas, química, ARN y estado celular, bioimagen — observan cada una un rango diferente de ese rango, y se solapan. Leer hacia abajo es el camino causal desde el genotipo hasta el fenotipo; leer a través es a escala física. Como el modelo aprende estas representaciones de manera conjunta, en lugar de orquestar especialistas separados, la evidencia en un nivel puede informar predicciones en otro.

Al integrar este modelo en un sistema unificado que facilita la experimentación computacional y aprende de la iteración, los investigadores pueden generar predicciones entre modalidades y razonar sobre las consecuencias de las intervenciones biológicas antes de que sean probadas en el laboratorio. De manera crucial, el modelo mundial no necesita ser perfecto —de hecho, nunca modelará la biología a la perfección— tan solo debe informar de manera útil el diseño experimental.

Cómo se ve esto en biología del cáncer

Un ejemplo concreto proviene de nuestro trabajo sobre el adenocarcinoma ductal pancreático (PDAC, por sus siglas en inglés), la forma más común de cáncer de páncreas y una de las más difíciles de tratar. En colaboración con investigadores del Broad Institute del MIT y Harvard, hemos pasado años en el desarrollo y aplicación de modelos ex vivo derivados de pacientes, para investigar una hipótesis de larga data: que el comportamiento tumoral y la respuesta a los fármacos dependen no solo de la genética, sino también del estado celular transcripcional. En PDAC, las células tumorales pueden ocupar diferentes estados celulares asociados a cómo responden al tratamiento.

Con Quine, ahora hemos puesto en práctica esa hipótesis, a través de explorar si características no genéticas del cáncer, en especial el estado celular, pueden servir como objetivos terapéuticos accionables. Utilizamos Quine para predecir y priorizar miles de compuestos basándonos en su potencial para desplazar células tumorales entre estados relevantes a nivel terapéutico. En estudios de laboratorio húmedo centrados en la transición del estado celular clásico al basal, los compuestos mejor valorados de Quine produjeron los mayores cambios previstos en ensayos experimentales. Todo el proceso —desde reducir con rapidez el espacio de búsqueda de compuestos hasta priorizar un puñado de candidatos prometedores para ser validados en laboratorio— duró solo un fin de semana, lo que, en potencia, ahorró meses de trabajo experimental y costes significativos de investigación. Cabe destacar que algunos de los efectos más fuertes provinieron de compuestos con mecanismos de acción inesperados, al ofrecer evidencias tempranas de que la IA puede descubrir nuevas oportunidades para la reutilización y el descubrimiento de fármacos.

Aunque la transición de estado inverso resultó más difícil (de estados basales a clásicos celulares), Quine predijo que los compuestos disponibles tendrían este efecto más débil. De manera más notable, los experimentos revelaron algo que no anticipábamos del todo: Quine predijo que varios compuestos moverían de manera consistente las células hacia un tercer fenotipo distinto —una observación confirmada en el laboratorio— lo que sugiere que el paisaje de estado celular del cáncer de páncreas es más rico que un simple eje clásico-basal. Los experimentos no solo pusieron a prueba las hipótesis del modelo, sino que también generaron nuevas.

Figura 3: Exploración guiada por Quine de los estados celulares del cáncer de páncreas. En las líneas celulares de ductaladenocarcinoma pancreático (PDAC), los compuestos mejor clasificados produjeron los mayores desplazamientos transcripcionales de clásico a basal, validados por experimentos de laboratorio húmedo. Desplazamientos inversos más débiles y movimientos inesperados hacia un fenotipo adicional también fueron consistentes con las predicciones de Quine.

Nuestro trabajo continuo aquí utilizará conjuntos de datos y tareas de ARN recién integrados para representar este panorama más rico, fortalecer las predicciones de transición de estados y proporcionar estimaciones calibradas de confianza que ayuden a los científicos a priorizar las hipótesis más prometedoras para las pruebas en laboratorio húmedo. Y este es justo el bucle de retroalimentación que Quine fue diseñado para apoyar. Cada ronda de experimentación mejora nuestra comprensión de la biología, y cada nueva visión puede convertirse en una señal de entrenamiento para la siguiente generación del sistema.

Aprender a través del descubrimiento – una invitación

Creamos Quine para mejorar la forma en que nosotros mismos hacemos ciencia. A medida que el sistema evolucionaba, lo integramos en nuestros programas científicos en curso. Cada pregunta de investigación, resultado experimental y hallazgo inesperado se convirtió en una oportunidad para refinar los modelos, mejorar los flujos de trabajo y comprender mejor dónde la IA podía acelerar de manera significativa nuestra investigación. Con el tiempo, el sistema se convirtió en central en cómo abordamos el descubrimiento en múltiples ámbitos, incluida la biología del cáncer, ingeniería de proteínas, genómica y bioimagen.

Nos gustaría seguir con la construcción sobre esa base, a través de introducir Quine en esta etapa temprana. Quine surgió de nuestra propia investigación, pero no queremos que su desarrollo continuo ocurra de manera aislada. Muchas de las preguntas que determinarán hacia dónde irá no son respuestas que podamos responder solos; requieren la experiencia, creatividad y perspectivas de la comunidad científica en general. Por esta razón, abrimos el programa Quine Fellows para poner el sistema directo en manos de científicos que trabajan en la frontera de la biología y la medicina.

Las solicitudes para la primera cohorte de Quine Fellows están abiertas ahora

Construir de manera responsable siempre será lo primero. Creemos que el progreso en IA y biología debe ir de la mano con la seguridad, protección y gestión responsable. Hemos adoptado un enfoque deliberado y gradual en el desarrollo y acceso de Quine, con disponibilidad inicial limitada al programa Quine Fellows y a colaboraciones de investigación seleccionadas. La revisión interna continua y las salvaguardas integradas nos ayudarán a mantener una supervisión adecuada a medida que el sistema evolucione. Conforme la tecnología madure, esperamos ampliar el acceso a través de productos como Microsoft Discovery.

Es tentador enmarcar el progreso en IA para biología en torno a referencias y tablas de clasificación. Eso importa, pero la verdadera prueba de Quine es qué ocurre cuando se encuentra con la ciencia tal y como se practica en realidad. ¿Puede ser útil cuando la evidencia está incompleta? ¿Cuando se enfrentan a preguntas que en realidad nunca se han hecho antes? ¿Puede ayudar a acortar el camino desde las preguntas hasta el descubrimiento?

En última instancia, ese es el estándar que nos importa. La ambición es que Quine se retire en un segundo plano de la práctica científica, mientras la ciencia avanza más rápido en primer plano. Los protagonistas no son el modelo ni la plataforma. Son los científicos, los experimentos y los descubrimientos que siguen.

Español (España)
Icono de exclusión de opciones de privacidad Tus opciones de privacidad
Privacidad de la salud del consumidor Ponte en contacto con Microsoft Privacidad Gestionar cookies Condiciones de uso Marcas registradas Sobre nuestra publicidad Docs de cumplimiento de la UE