一群大型出版商在一位知名作家的加入下,提起集體訴訟,指控 Google 蓄意侵犯版權,稱該公司未經許可使用他們受版權保護的書籍與文本來訓練其 Gemini 大型語言模型。這份訴狀於 7月13日 由 Hachette Book Group、Cengage Learning 與 Elsevier,連同暢銷書作家 Scott Turow,向美國紐約南區聯邦地區法院提起,並請求法院判予法定賠償、核發永久禁制令以阻止進一步侵權,以及命令 Google 銷毀其所使用作品的所有未經授權副本。
使本案有別於一般網路抓取指控的細節,在於原告所稱這些素材的來源。這宗訴訟並非僅指控 Google 從開放網路上擷取文本,而是主張 Google 動用了自家受限且用途範圍有限的計畫,具體而言即 Google Books、Google Play 與 Google Scholar,來訓練 Gemini 的早期版本。這些計畫讓 Google 在狹隘條款下取得大量已出版素材的存取權,用於掃描、建立索引、預覽或銷售,而原告主張,為這些有限用途取得的內容其後被重新用於建構一套商業人工智慧模型。這使得爭議的焦點,從抓取網際網路是否合理,轉變為你是否把我們為某一用途交給你的東西,拿去建構了截然不同的另一套東西。
原告的陣容至關重要。Hachette、Cengage 與 Elsevier 橫跨大眾、教育與學術出版領域,而 Scott Turow 既是暢銷小說家,也曾任 Authors Guild 主席,這讓本案的觸角延伸至出版界截然不同的各個角落。此案以擬議中的集體訴訟形式提起,意即若法院認可該集體,它最終可能代表廣泛的作家與出版商群體,而不僅是具名的當事方,這大幅提高了潛在責任與任何最終和解的規模。
把本案放在脈絡中審視是值得的,因為它並非孤立發生。過去這幾年間,針對人工智慧公司的版權訴訟接連湧現,而法院仍在處理貫穿其中的核心問題:以受版權保護的作品訓練模型,究竟屬於受保護的合理使用,還是需要授權與付費的侵權行為。目前尚無定論,各項裁決走向不一,最終許多結果或將取決於具體細節,例如素材是如何取得的,以及產出是否與原作構成競爭。Google 這宗案件大力著重於前一項因素,即素材取得方式,而這正是使其引人注目的部分原因。
本案的重要性超越單一公司。合理使用的問題是人工智慧領域最具深遠影響、懸而未決的議題之一,因為其答案將決定下一代模型能在哪些資料的基礎上合法建構,以及那些資料的代價幾何。這宗訴訟將問題直接擺到 Google 面前,並增添一個令人不安的曲折:那些在對權利人做出特定承諾之下、使 Google 成為全球書籍值得信賴之管理者的同一批計畫,如今卻被指控為其訓練資料的來源。這些是指控,而非經證實的事實,此類訴訟往往拖延數年或悄然了結,但它是另一個明確的訊號,顯示人工智慧的資料權利清算正認真到來,而擁有最深厚內容存取權的公司,或將承擔最深重的法律風險。
