AlphaFold
Por qué importa
En profundidad
AlphaFold recibe una sola entrada — la secuencia de aminoácidos de una proteína — y devuelve coordenadas 3D de sus átomos junto con puntuaciones de confianza por residuo. El pipeline de AlphaFold 2 busca primero en bases de datos de secuencias para crear un alineamiento múltiple de secuencias (MSA) de proteínas relacionadas evolutivamente y busca estructuras conocidas que puedan servir como plantillas. Ambos alimentan una Red neuronal articulada en torno a un bloque llamado Evoformer, que intercambia información entre el alineamiento y una representación por pares de las relaciones entre residuos, seguida de un módulo de estructura que genera coordenadas atómicas. La red se entrena mediante Aprendizaje supervisado sobre las menos de 200.000 estructuras determinadas experimentalmente del Protein Data Bank, y el pipeline recicla su propia salida a través de la red unas cuantas veces para refinar el resultado. Ejecutar una predicción tarda entre minutos y horas en una sola GPU, según la longitud de la secuencia.
El MSA es el arma secreta
La entrada individual más importante de AlphaFold 2 no es la secuencia en sí, sino el alineamiento múltiple de secuencias: cientos o miles de secuencias de proteínas relacionadas extraídas de bases de datos públicas. Los residuos que mutan juntos durante la evolución suelen estar cerca en la estructura plegada, y esta señal de covariación es lo que permite a la red inferir contactos 3D. Los alineamientos profundos producen las predicciones más fiables; los superficiales son la principal razón por la que una predicción resulta poco confiable, algo común en proteínas virales, proteínas diseñadas de novo y secuencias "huérfanas" con pocos parientes conocidos. Sistemas posteriores como ESMFold de Meta AI sustituyen la búsqueda en bases de datos por un modelo de lenguaje de proteínas y se ejecutan varios órdenes de magnitud más rápido, a costa de cierta precisión en familias bien alineadas. Los equipos que necesitan la máxima precisión siguen ejecutando AlphaFold 2 completo y reservan las variantes de modelo de lenguaje para examinar millones de secuencias.
Dentro del Evoformer
El núcleo de AlphaFold 2 es el Evoformer, una pila de 48 bloques que pasa información de un lado a otro entre dos representaciones: las filas y columnas del alineamiento y una "representación por pares" que sigue la creencia actual de la red sobre la relación entre cada par de residuos. La maquinaria se construye con Atención, la misma operación básica que impulsa el Transformer, adaptada con operaciones personalizadas llamadas actualizaciones triangulares que empujan la representación por pares hacia la consistencia geométrica: si el residuo A está cerca del B y el B está cerca del C, entonces probablemente A también deba estar cerca del C. Luego, un módulo de estructura convierte la representación refinada en coordenadas mediante atención de puntos invariantes, una variante consciente de la geometría que se comporta correctamente bajo rotaciones y traslaciones 3D. La lección de diseño que sorprende a muchos profesionales es lo poco que la precisión debe a la escala bruta: AlphaFold 2 tiene aproximadamente 93 millones de parámetros, diminuto según los estándares de los modelos de lenguaje modernos.
Interpretar las puntuaciones de confianza
Cada predicción de AlphaFold incluye una puntuación de confianza por residuo llamada pLDDT en una escala de 0–100. Las regiones con puntuaciones superiores a 90 suelen ser fiables hasta en la colocación de cadenas laterales, las puntuaciones de 70–90 indican una columna vertebral confiable y todo valor inferior a 50 debería interpretarse como "probablemente no plegado" — un pLDDT bajo suele ser una predicción correcta de desorden intrínseco y no un fallo del modelo. Para los complejos, la matriz de error alineado predicho (PAE) informa con cuánta confianza se colocan los pares de dominios o cadenas entre sí, lo cual marca la diferencia entre una hipótesis de acoplamiento útil y una imagen bonita. El hábito de trabajo que conviene adquirir es mirar la gráfica de pLDDT antes que la vista 3D y tratar toda predicción como una hipótesis que todavía necesita respaldo experimental antes de sustentar una publicación o un programa farmacológico.
Predice estructuras, no el plegamiento
Una idea equivocada persistente es que AlphaFold "resolvió el problema del plegamiento de proteínas". Lo que resolvió es la predicción de estructuras: dada una secuencia, producir la forma que la proteína probablemente adopta. No dice nada sobre cómo llega allí — la trayectoria, la cinética y los estados intermedios de los que trata la paradoja clásica del plegamiento — y produce principalmente una conformación estática, mientras que las proteínas reales se flexionan, respiran y cambian entre estados. Tampoco indica directamente qué hará una mutación a la estabilidad o la función, y su manejo de ligandos, membranas y modificaciones postraduccionales varía en fiabilidad. El Aprendizaje profundo aquí se entiende mejor como un comparador de patrones excepcionalmente bueno sobre datos evolutivos y estructurales, no como un motor de física; para estudiar la dinámica, todavía se necesitan simulaciones moleculares y experimentos de laboratorio.
AlphaFold 3, la base de datos y el Premio Nobel
Alrededor del modelo creció la AlphaFold Protein Structure Database, una colaboración entre Google DeepMind y EMBL-EBI que publica predicciones precalculadas gratuitas: más de 200 millones de estructuras que abarcan casi todas las proteínas catalogadas. AlphaFold 3, lanzado en 2024, generaliza más allá de cadenas de proteína individuales a complejos que incluyen ADN, ARN, ligandos e iones, y sustituye el módulo de estructura por un Modelo de difusión que genera directamente coordenadas atómicas, lo cual le permite manejar química más allá de los aminoácidos. Se accede mediante un servidor alojado gratuito, y el código y los pesos se publicaron posteriormente para uso no comercial, un gesto notable de Pesos abiertos para un sistema de tal valor estratégico, que evoca un linaje de investigación iniciado con AlphaGo. En 2024, Demis Hassabis y John Jumper recibieron el Premio Nobel de Química por la predicción de estructuras de proteínas, compartido con David Baker por el diseño computacional de proteínas, consolidando a AlphaFold como el ejemplo estándar de la IA haciendo ciencia original.