跳到主要內容
Zubnet AI學習Wiki › Deep Research
使用AI

Deep Research

別名:Deep Research Agents、Agentic Research、深度研究
多款 AI 助手提供的一種模式,模型會自主規劃並執行多步驟網路研究任務,再傳回附有引用的結構化報告。它不會只進行一次快速搜尋便回答,而是花費數分鐘閱讀數十個來源、追查線索,並整合研究結果。Google 於 2024 年 12 月率先在 Gemini 中以這個名稱推出功能,OpenAI 2025 年 2 月的發布讓它普及開來,如今 Perplexity 與 Grok 也都提供同類產品。

為什麼重要

一次 Deep Research 可將數小時的人工文獻回顧——搜尋、略讀、交叉核對及記錄筆記——濃縮為單一請求。它最適合沒有唯一權威答案的問題:市場盤點、技術比較、政策概況和文獻綜述,這些工作對廣度與可追溯引用的重視高於速度。

深度解析

一次 Deep Research 執行過程與一般聊天補全截然不同。系統收到提示詞後,會先將問題拆解為研究計畫:一組子問題、搜尋查詢及值得追查的角度。接著進入迴圈——發出搜尋、開啟網頁、閱讀,再決定下一步追查什麼——持續數分鐘至半小時,途中往往查閱數十個來源。中途發現會累積至工作筆記,最後再經過一次整合,將筆記轉化為附有行內引用的結構化報告。其內部運作更接近自主代理的規劃迴圈,而非經典 RAG 的單次文件查詢。

代理迴圈如何運作

核心迴圈是規劃、搜尋、閱讀與重新評估。每讀完一批網頁,模型都會更新理解,再根據仍缺少哪些資訊、哪些來源彼此矛盾,以及哪些主張需要再次確認,選擇下一輪查詢。這正是它與經典 RAG 的差異:檢索並非一次性查詢,而是由模型自行引導的反覆過程。瀏覽透過工具使用進行——搜尋、開啟網頁,有時也包括程式碼執行工具——而代理讀過的所有內容都必須放進上下文視窗,因此這類系統會積極將網頁濃縮為筆記,而非保留大量原始文字。

推理模型如何改變局面

直到模型能在長時間工作鏈中持續作業而不偏離主題,Deep Research 才真正變得可行。一次執行可能包含數十輪搜尋與閱讀,因此底層模型必須維持計畫、追蹤未解問題,並察覺新來源何時與先前假設衝突。OpenAI 版本採用一款以真實瀏覽任務進行強化學習微調的推理模型,競爭產品則仰賴各自具備推理能力的旗艦模型。實際上,Deep Research 就是將測試時計算用在搜尋上:系統以數分鐘的推理與瀏覽,換取單次前向傳播無法產生的答案。

有引用不等於有保證

附有行內連結的精美報告容易令人過度信賴,這正是主要的失敗模式。引用只能證明模型開啟過某個網頁,不能證明該頁真的支援報告中的主張;引用與主張不符的情況十分常見,因此抽查依然不可或缺。系統也會承襲開放網路的偏誤:SEO 導向內容、過時網頁與行銷材料,會和第一手來源受到同等仔細的閱讀;付費牆後方或未建立索引的材料則完全不可見。和其他生成系統一樣,模型仍可能幻覺出細節,也可能用聽來合理的整合敘述悄悄填補證據缺口。應將輸出視為快速研究助理撰寫的優秀初稿,而非已完成事實查核的最終成果。

領域發展與衡量方式

Gemini 於 2024 年 12 月率先推出 Deep Research;OpenAI 2025 年 2 月的發布最初僅供最高價訂閱方案使用,且每月有執行次數配額,正是它讓這個類別成形。數月之內,Perplexity 為答案引擎加入同類功能,xAI 則在 Grok 中發布 DeepSearch。使用範圍很快擴大,到 2025 年中,多數主流助手都已提供某種多步驟研究模式。開放原始碼重製版本也同步出現,通常會在代理架構中將搜尋 API 連接至推理模型。

衡量這些系統甚至比建立它們更困難。早期最常受到引用的結果來自 Humanity's Last Exam,這項基準測試包含眾多學科的專家級問題,而 OpenAI 的 Deep Research 正確回答約四分之一——遠高於當時標準聊天模型的個位數分數。供應商也公布在 GAIA 上的優異結果,這是一項針對代理型助手的基準測試。不過,兩項基準測試都無法直接衡量報告品質:引用精準度、來源多樣性,以及對人類讀者的實用程度,依然主要仰賴人工判斷,而獨立評估也仍然有限。

← 所有術語
ESC