Falcon
為什麼重要
深度解析
Falcon 是由技術創新研究院開發的一系列僅解碼器式大型語言模型;技術創新研究院是一所位於阿布達比、由阿拉伯聯合大公國政府支援的研究機構。首批模型於 2023 年推出,包括以該機構自行建立的 RefinedWeb 資料集訓練而成的 7B 和 40B 模型;同年稍晚,又推出 Falcon 180B——這個擁有 1,800 億個參數、以約 3.5 兆個 token 訓練的模型,在發佈時登上 Hugging Face 開放 LLM 排行榜榜首。關鍵在於,TII 依寬鬆條款釋出權重——40B 在推出後不久便改採 Apache 2.0——因此在 2023 年大部分時間裡,Falcon 都是最強、真正採用開放權重的選擇。後續世代接連推出:2024 年的 Falcon 2、同年稍晚提供 1B 至 10B 多種規模的 Falcon 3,以及 Falcon-Mamba、混合型 Falcon-H1 等超越標準 Transformer 配方的實驗性分支。
對 RefinedWeb 的押注
當時的模型大多以精心挑選的書籍、程式碼、學術論文與篩選後網頁文字所組成的混合語料訓練。TII 對 Falcon 的押注則不同:直接取用原始 Common Crawl 網頁資料,大規模進行積極的重複資料移除與品質篩選,以證明只要妥善清理,龐大的網頁文字便足以媲美精心策展的語料。成果就是 RefinedWeb——一套包含數兆個 token 的Dataset,TII 將它與模型一同公開發佈。Falcon 40B 使用其中約 1 兆個 token 進行訓練,180B 模型則擴大至約 3.5 兆個 token,並混入部分精選語料。在如此規模下,幾乎完全使用公開網頁資料進行預訓練並不常見;即使這些模型本身早已被超越,RefinedWeb 仍是其他開放模型專案廣泛重複使用的資產。
作為競爭武器的授權
推出時機,使 Falcon 的授權與權重同等重要。Falcon 40B 於 2023 年年中問世時,Meta 的第一代 Llama 僅限研究用途,其他多數強大模型則藏在 API 後方;因此,採 Apache 2.0 發佈——這項授權在推出後不久取代了附有權利金條款的自訂授權——讓 Falcon 成為建構商業產品之團隊的常見選擇。這種寬鬆做法推動了更廣泛的開放 vs. 封閉之爭:幾個月內,Llama 2 便依允許商業使用的社群授權推出,寬鬆授權從此成為基本預期,而非差異化優勢。Falcon 3 與後續版本改採 TII Falcon 授權,雖然維持 Apache 風格,卻加入自有條款——這也提醒人們,「開放權重」涵蓋各式各樣的條款,每一份授權都值得實際讀過一遍。
排行榜換不來心占率
對 Falcon 歷史的一種常見解讀,是它因登上 Hugging Face 排行榜榜首,而贏得 2023 年的開放模型競賽。事實並非如此。基準測試名次很難轉化成生態系:Mistral AI 和 Llama 吸引了進行微調的人、工具作者與教學文章作者,這些模型也累積了真正能推動採用的量化版本、合併配方與部署指南。Falcon 180B 尤其更像展示聲望的作品,而非實用產品——在量化前需要數百 GB 的 GPU 記憶體,幾乎沒有人負擔得起,其微調成本也令大多數團隊卻步。這項教訓具有普遍性:在開放模型領域,分發、硬體相容性與工具鏈的優勢會持續累積,排行榜分數則會迅速貶值。
超越密集型 Transformer
Falcon 的後續版本顯示,TII 將這個系列視為架構研究計畫,而非單一產品線。Falcon 2 於 2024 年推出,是一個 11B 模型,另有一個能處理圖像的視覺-語言姊妹版本;同年稍晚,Falcon 3 接續推出,以 1B、3B、7B 與 10B 等規模及多語言訓練,鎖定實用型市場。更有意思的發展出現在分支:Falcon-Mamba 7B 將注意力機制全面替換成 Mamba 狀態空間架構,使長序列推論能維持固定的記憶體用量;Falcon-H1 系列則在 2025 年接續登場,採用於單一模型內混合注意力層與狀態空間層的設計。即使主流 Falcon 產品線正與規模龐大得多的開放權重生態系競爭,這些實驗仍讓 TII 在架構討論中保有能見度。