跳到主要内容
Zubnet AI学习Wiki › ImageNet
训练

ImageNet

别名:ImageNet Challenge、ILSVRC、ImageNet 挑战赛
一个大规模图像数据集,约含 1400 万张人工标注图片,分属 2 万多个类别,最早由李飞飞带领的团队于 2009 年发布。与之配套的年度竞赛 ImageNet Large Scale Visual Recognition Challenge(ILSVRC)成为计算机视觉的标准基准;2012 年,一款神经网络赢得比赛,也由此点燃了深度学习时代。

为什么重要

ImageNet 证明,扩大数据规模与发明更好的算法同样重要,这个教训至今仍在塑造 AI 战略。它的预训练权重成了实用计算机视觉工作的默认起点,而由 1000 个类别组成的基准子集,至今仍是新视觉架构证明自己的考场。

深度解析

ImageNet 其实是两件常被混为一谈的东西:一个数据集和一项竞赛。2009 年发布的数据集约含 1400 万张从网络抓取的图像,再按借自 WordNet 词汇层级的 2 万多个类别人工整理,从具体犬种,到奶酪种类,再到家用电器,什么都有。ILSVRC 竞赛则在 2010 到 2017 年每年举行,采用一套更小、更精心筛选的子集——1000 个类别、约 120 万张训练图像——要求参赛团队做图像分类和物体定位。现代深度学习实际上正是在这项竞赛中诞生,而竞赛使用的子集通常被称为 ImageNet-1K,至今仍是 AI 领域引用最多的基准测试之一。

用 WordNet 与众包搭建

李飞飞与合作者从一项在当时颇为逆势的赌注出发:大多数计算机视觉研究都在追求更聪明的算法,他们却认为进步被数据饥荒拖住了。团队把类别映射到 WordNet 的名词层级,从搜索引擎收集候选图像,再雇用 Amazon Mechanical Turk 工人核验每个标签;冗余设计和质量检查则保证大规模数据标注仍然可靠。最终成果比当时常见的视觉数据集大了几个数量级,后者最多通常只有几万张图像。这份 Dataset 于 2009 年发布,年度挑战赛则在 2010 年跟上,逼整个领域真正把它用起来。早期结果并不起眼——传统方法只是一点点进步——所以 2012 年的结果才显得格外戏剧化。

2012 年的突破

2012 年,AlexNet——由 Alex Krizhevsky、Ilya Sutskever 和 Geoffrey Hinton 构建的深层 CNN——以 15.3% 的 top-5 错误率赢得分类任务,使用传统人工设计特征的亚军则在 26% 左右。基准竞赛中几乎从不会出现如此巨大的差距,整个领域几周内就注意到了。短短几年后,每一个认真参赛的方案都是深层神经网络,错误率也继续下降:采用残差连接的架构在 2015 年把 top-5 错误率压到 4% 以下,超过训练有素的人类标注员约 5% 的错误率。社区带走的是两重教训——深层网络确实有效,而且只有喂给它 ImageNet 规模的数据,效果才能这么好。

它并没有真正解决视觉

一个常见误解是,ImageNet 分数超过人类,就意味着计算机视觉已经完成。基准测试的是一项狭窄技能:给一张主体通常占满画面的网络照片贴上一个干净标签。它几乎不涉及杂乱场景中的目标检测、细粒度计数、面对罕见相机角度的鲁棒性,或真实世界图像的长尾。横扫 ImageNet 的模型常常依赖捷径线索——纹理和背景,而不是物体形状——在专门暴露这种脆弱性的压力测试变体上,准确率会明显下降。而且标签只有一个,有时还很模糊——海滩上的边境牧羊犬既是一条狗,也是一幅海滩场景——top-5 指标部分掩盖了Classification究竟有多混乱。ImageNet 是整个领域爬上去、随后又必须走下来的梯子。

挑战赛之后

ILSVRC 于 2017 年后落幕,ImageNet 却从未离开工作流。它最持久的贡献最终是 Transfer Learning:在 ImageNet 上训练的网络会学到通用视觉特征,而在小型任务专用数据集上微调这些预训练权重,胜过大多数计算机视觉应用从零训练,范围从医学影像一路到工业检测。ImageNet-1K 仍是标准试验场,Vision Transformer 等架构最初就是在这里证明自己可以与卷积竞争;更大的 21000 类版本也仍被用于大规模预训练。此后,领域已经转向网络规模、弱标注和自监督数据——把 ImageNet 倡导的数据优先理念推到极致,以至于几百万张人工核验图像如今都显得小。真正的遗产并不是一份大家至今都在训练的数据集,而是一个证明:拥有更好数据的人,通常会赢。

← 所有术语
ESC