ImageNet
Por qué importa
En profundidad
ImageNet es en realidad dos cosas que suelen confundirse: un dataset y una competición. El dataset, publicado en 2009, contiene aproximadamente 14 millones de imágenes extraídas de la web y clasificadas manualmente en más de 20.000 categorías tomadas de la jerarquía léxica de WordNet, desde razas concretas de perros hasta tipos de queso y electrodomésticos. La competición, ILSVRC, se celebró anualmente de 2010 a 2017 sobre un subconjunto menor y curado — unos 1,2 millones de imágenes de entrenamiento repartidas en 1.000 clases — y pedía a los equipos clasificar imágenes y localizar objetos. En esa competición nació en la práctica el Aprendizaje profundo moderno, y el subconjunto utilizado, a menudo llamado ImageNet-1K, sigue siendo un Benchmark entre los más citados en IA.
Construido con WordNet y crowdsourcing
Fei-Fei Li y sus colaboradores partieron de una apuesta contraria a la corriente de la época: mientras la mayoría de la investigación en visión por computadora se centraba en algoritmos más ingeniosos, ellos sostenían que la falta de datos asfixiaba el progreso. Mapearon categorías a la jerarquía de sustantivos de WordNet, recopilaron imágenes candidatas de motores de búsqueda y contrataron trabajadores en Amazon Mechanical Turk para verificar cada etiqueta, incorporando redundancia y controles de calidad a fin de mantener fiable la Anotación a escala. El resultado era varios órdenes de magnitud mayor que los datasets entonces comunes en la investigación de visión, que normalmente contenían, como máximo, decenas de miles de imágenes. El Dataset se publicó en 2009, y el desafío anual llegó en 2010 para obligar al campo a utilizarlo realmente. Los primeros resultados fueron poco inspiradores — los métodos tradicionales mejoraban solo de forma incremental —, lo que volvió aún más dramático el resultado de 2012.
El avance de 2012
En 2012, AlexNet — una CNN profunda creada por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton — ganó la tarea de clasificación con una tasa de error top-5 del 15,3 %, mientras el segundo lugar, que utilizaba características tradicionales diseñadas manualmente, se situó alrededor del 26 %. Un margen tan grande casi nunca aparece en competiciones de benchmarks, y el campo tomó nota en cuestión de semanas. En pocos años, cada participación seria era una red neuronal profunda y las tasas de error siguieron cayendo: las arquitecturas con Conexión residual llevaron el error top-5 por debajo del 4 % en 2015, superando la tasa de error aproximada del 5 % de un etiquetador humano entrenado. La comunidad extrajo una lección doble — las redes profundas funcionan y solo funcionan así de bien cuando reciben datos a la escala de ImageNet.
En realidad, no resolvió la visión
Una idea equivocada común es que las puntuaciones sobrehumanas en ImageNet significan que la visión por computadora está terminada. El benchmark examina una habilidad estrecha: asignar una etiqueta limpia a una foto web donde el sujeto suele llenar el encuadre. Dice poco sobre la Detección de Objetos en escenas abarrotadas, el conteo detallado, la robustez ante ángulos de cámara inusuales o la larga cola de imágenes del mundo real. Los modelos que dominan ImageNet suelen apoyarse en señales de atajo — texturas y fondos en lugar de la forma del objeto —, y su precisión cae notablemente en variantes de prueba de estrés creadas precisamente para revelar esa fragilidad. Y como las etiquetas son únicas y a veces ambiguas (una foto de un border collie en una playa es a la vez un perro y una escena de playa), la métrica top-5 disimula en parte lo desordenada que es realmente la Clasificación. ImageNet fue una escalera que el campo subió y luego tuvo que abandonar.
La vida después del desafío
ILSVRC se fue apagando después de 2017, pero ImageNet nunca abandonó el flujo de trabajo. Su contribución más duradera resultó ser el Aprendizaje por Transferencia: las redes entrenadas en ImageNet aprenden características visuales de propósito general, y aplicar ajuste fino a esos pesos preentrenados sobre un pequeño dataset específico de una tarea supera al entrenamiento desde cero en la mayoría de las aplicaciones de Visión por computadora, desde imágenes médicas hasta inspección industrial. ImageNet-1K también persiste como el campo de pruebas estándar donde arquitecturas como el Vision Transformer demostraron por primera vez que podían competir con las convoluciones, y la versión mayor de 21.000 categorías todavía se utiliza para el preentrenamiento a escala. Desde entonces, el campo ha pasado a datos a escala web, con etiquetado débil y autosupervisados — la misma filosofía centrada en los datos que defendió ImageNet, llevada hasta el punto de que unos pocos millones de imágenes verificadas a mano ahora parecen pocas. Ese es el verdadero legado: no tanto un dataset en el que la gente todavía entrena, sino la prueba de que quien tiene mejores datos suele ganar.