ImageNet
為什麼重要
深度解析
ImageNet 其實是經常混為一談的兩項事物:資料集與競賽。2009 年發布的資料集包含約 1,400 萬張從網路擷取的圖像,再由人工整理至取自 WordNet 詞彙階層的 20,000 多個類別,內容從特定犬種、起司種類到家用電器都有。ILSVRC 競賽則於 2010 至 2017 年間每年舉辦,採用規模較小且經過整理的子集——涵蓋 1,000 個類別、約 120 萬張訓練圖像——要求團隊進行圖像分類與物體定位。現代深度學習實際上就是在這項競賽中誕生,而競賽採用的子集通常稱為 ImageNet-1K,至今仍是 AI 領域最常受到引用的基準測試之一。
以 WordNet 與群眾外包建立
李飛飛與合作者從一項在當時十分反主流的判斷出發:多數電腦視覺研究著重更巧妙的演算法,他們卻主張進展受限於資料不足。團隊將類別對應至 WordNet 的名詞階層、從搜尋引擎收集候選圖像,再聘用 Amazon Mechanical Turk 工作者驗證每個標籤,並以重複檢查與品質管制,確保大規模標註維持可靠。成果比當時視覺研究常見的資料集大上數個數量級,後者通常最多只有數萬張圖像。這份 Dataset 於 2009 年發布,年度挑戰賽則於 2010 年接續展開,促使整個領域實際使用資料集。初期成果並不出色——傳統方法只有小幅改善——使 2012 年的結果更加驚人。
2012 年的突破
2012 年,AlexNet——由 Alex Krizhevsky、Ilya Sutskever 與 Geoffrey Hinton 建立的深層 CNN——以 15.3% 的 top-5 錯誤率贏得分類任務,使用傳統人工設計特徵的第二名則約為 26%。基準競賽幾乎不會出現如此巨大的差距,整個領域在數週內便注意到這項結果。幾年之內,所有認真的參賽作品都採用深層神經網路,而錯誤率持續下降:採用殘差連接的架構在 2015 年將 top-5 錯誤率降至 4% 以下,勝過受過訓練的人類標註人員約 5% 的錯誤率。社群從中得到兩項教訓——深層網路確實有效,而且只有取得 ImageNet 規模的資料,才能達到如此優異的效果。
它並沒有真正解決視覺
常見的誤解,是認為 ImageNet 分數超越人類代表電腦視覺已經解決。這項基準測試只衡量一種狹窄技能:為主體通常占滿畫面的網路照片指定單一明確標籤。它幾乎無法說明雜亂場景中的Object Detection、細緻計數、面對特殊相機角度時的穩健性,或真實世界圖像的長尾問題。在 ImageNet 表現出色的模型通常仰賴捷徑線索——紋理和背景,而非物體形狀——在專為暴露這種脆弱性而設計的壓力測試變體上,準確率會明顯下降。此外,標籤只有一個而且有時含糊不清(海灘上的邊境牧羊犬既是一隻狗,也是一幅海灘場景),top-5 指標部分淡化了Classification實際上的複雜程度。ImageNet 是整個領域向上攀爬、之後又必須離開的一座階梯。
挑戰賽之後
ILSVRC 在 2017 年後結束,但 ImageNet 從未離開工作流程。它最持久的貢獻最終是 Transfer Learning:以 ImageNet 訓練的網路會學到通用視覺特徵,而在小型任務專用資料集上微調這些預訓練權重,在大多數電腦視覺應用中都優於從頭訓練,範圍從醫學影像至工業檢測。ImageNet-1K 也持續作為標準試驗場,Vision Transformer 等架構最初便在這裡證明可與卷積方法競爭,而規模更大的 21,000 類別版本至今仍用於大規模預訓練。此後,這個領域轉向網路規模、弱標註及自我監督資料——將 ImageNet 倡導的資料優先理念推至極致,使數百萬張經人工驗證的圖像如今看來都很少。真正的影響不只是一份人們仍用於訓練的資料集,而是證明擁有較優良資料的一方通常會獲勝。