Saltar al contenido principal
Zubnet AIAprenderWiki › ImageNet
Entrenamiento

ImageNet

También conocido como: ImageNet Challenge, ILSVRC
Un dataset de imágenes a gran escala con aproximadamente 14 millones de imágenes etiquetadas a mano y organizadas en más de 20.000 categorías, publicado por primera vez en 2009 por un equipo dirigido por Fei-Fei Li. Su competición anual asociada, ImageNet Large Scale Visual Recognition Challenge (ILSVRC), se convirtió en el benchmark estándar de visión por computadora y desencadenó la era del aprendizaje profundo cuando una red neuronal la ganó en 2012.

Por qué importa

ImageNet demostró que escalar los datos importa tanto como inventar mejores algoritmos, una lección que todavía da forma a la estrategia de IA actual. Sus pesos preentrenados se convirtieron en el punto de partida predeterminado para el trabajo práctico de visión por computadora, y su subconjunto de benchmark con 1.000 clases todavía es la forma en que las nuevas arquitecturas de visión demuestran su valía.

En profundidad

ImageNet es en realidad dos cosas que suelen confundirse: un dataset y una competición. El dataset, publicado en 2009, contiene aproximadamente 14 millones de imágenes extraídas de la web y clasificadas manualmente en más de 20.000 categorías tomadas de la jerarquía léxica de WordNet, desde razas concretas de perros hasta tipos de queso y electrodomésticos. La competición, ILSVRC, se celebró anualmente de 2010 a 2017 sobre un subconjunto menor y curado — unos 1,2 millones de imágenes de entrenamiento repartidas en 1.000 clases — y pedía a los equipos clasificar imágenes y localizar objetos. En esa competición nació en la práctica el Aprendizaje profundo moderno, y el subconjunto utilizado, a menudo llamado ImageNet-1K, sigue siendo un Benchmark entre los más citados en IA.

Construido con WordNet y crowdsourcing

Fei-Fei Li y sus colaboradores partieron de una apuesta contraria a la corriente de la época: mientras la mayoría de la investigación en visión por computadora se centraba en algoritmos más ingeniosos, ellos sostenían que la falta de datos asfixiaba el progreso. Mapearon categorías a la jerarquía de sustantivos de WordNet, recopilaron imágenes candidatas de motores de búsqueda y contrataron trabajadores en Amazon Mechanical Turk para verificar cada etiqueta, incorporando redundancia y controles de calidad a fin de mantener fiable la Anotación a escala. El resultado era varios órdenes de magnitud mayor que los datasets entonces comunes en la investigación de visión, que normalmente contenían, como máximo, decenas de miles de imágenes. El Dataset se publicó en 2009, y el desafío anual llegó en 2010 para obligar al campo a utilizarlo realmente. Los primeros resultados fueron poco inspiradores — los métodos tradicionales mejoraban solo de forma incremental —, lo que volvió aún más dramático el resultado de 2012.

El avance de 2012

En 2012, AlexNet — una CNN profunda creada por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton — ganó la tarea de clasificación con una tasa de error top-5 del 15,3 %, mientras el segundo lugar, que utilizaba características tradicionales diseñadas manualmente, se situó alrededor del 26 %. Un margen tan grande casi nunca aparece en competiciones de benchmarks, y el campo tomó nota en cuestión de semanas. En pocos años, cada participación seria era una red neuronal profunda y las tasas de error siguieron cayendo: las arquitecturas con Conexión residual llevaron el error top-5 por debajo del 4 % en 2015, superando la tasa de error aproximada del 5 % de un etiquetador humano entrenado. La comunidad extrajo una lección doble — las redes profundas funcionan y solo funcionan así de bien cuando reciben datos a la escala de ImageNet.

En realidad, no resolvió la visión

Una idea equivocada común es que las puntuaciones sobrehumanas en ImageNet significan que la visión por computadora está terminada. El benchmark examina una habilidad estrecha: asignar una etiqueta limpia a una foto web donde el sujeto suele llenar el encuadre. Dice poco sobre la Detección de Objetos en escenas abarrotadas, el conteo detallado, la robustez ante ángulos de cámara inusuales o la larga cola de imágenes del mundo real. Los modelos que dominan ImageNet suelen apoyarse en señales de atajo — texturas y fondos en lugar de la forma del objeto —, y su precisión cae notablemente en variantes de prueba de estrés creadas precisamente para revelar esa fragilidad. Y como las etiquetas son únicas y a veces ambiguas (una foto de un border collie en una playa es a la vez un perro y una escena de playa), la métrica top-5 disimula en parte lo desordenada que es realmente la Clasificación. ImageNet fue una escalera que el campo subió y luego tuvo que abandonar.

La vida después del desafío

ILSVRC se fue apagando después de 2017, pero ImageNet nunca abandonó el flujo de trabajo. Su contribución más duradera resultó ser el Aprendizaje por Transferencia: las redes entrenadas en ImageNet aprenden características visuales de propósito general, y aplicar ajuste fino a esos pesos preentrenados sobre un pequeño dataset específico de una tarea supera al entrenamiento desde cero en la mayoría de las aplicaciones de Visión por computadora, desde imágenes médicas hasta inspección industrial. ImageNet-1K también persiste como el campo de pruebas estándar donde arquitecturas como el Vision Transformer demostraron por primera vez que podían competir con las convoluciones, y la versión mayor de 21.000 categorías todavía se utiliza para el preentrenamiento a escala. Desde entonces, el campo ha pasado a datos a escala web, con etiquetado débil y autosupervisados — la misma filosofía centrada en los datos que defendió ImageNet, llevada hasta el punto de que unos pocos millones de imágenes verificadas a mano ahora parecen pocas. Ese es el verdadero legado: no tanto un dataset en el que la gente todavía entrena, sino la prueba de que quien tiene mejores datos suele ganar.

← Todos los términos
ESC