跳到主要内容
Zubnet AI学习Wiki › Deep Research
使用AI

Deep Research

别名:Deep Research Agents、Agentic Research、深度研究
多款 AI 助手提供的一种模式,模型会自主规划并执行多步网络研究任务,再返回带引用的结构化报告。它不会只做一次快速搜索就回答,而是花几分钟阅读数十个来源、追踪线索,再综合发现。Google 于 2024 年 12 月率先在 Gemini 中以这个名字推出功能,OpenAI 2025 年 2 月的发布让它流行起来,如今 Perplexity 和 Grok 也都有对应产品。

为什么重要

一次 Deep Research 可以把数小时的人工文献工作——搜索、浏览、交叉核对、做笔记——压缩成一条请求。对于没有单一权威答案的问题,它最能证明价值:市场扫描、技术比较、政策版图和文献综述,都更看重覆盖面与可追溯引用,而不是速度。

深度解析

一次 Deep Research 运行与普通聊天补全完全不同。收到提示词后,系统先把问题拆成研究计划:一组子问题、搜索查询和值得追踪的角度。接着,它进入循环——发起搜索、打开网页、阅读、决定下一条该追什么——持续几分钟到半小时不等,途中往往查阅数十个来源。中间发现不断积累在工作笔记中,最后再经过一次综合,将笔记变成带行内引用的结构化报告。底层形态更接近自主智能体的规划循环,而不是经典 RAG 的单次文档查找。

智能体循环如何运作

核心循环是计划、搜索、阅读、重新评估。每读完一批网页,模型都会更新理解,再根据还缺什么、哪些来源互相矛盾、哪些主张需要第二次确认,挑选下一轮查询。它与经典 RAG 的分水岭就在这里:检索不是一次性查找,而是由模型自行操控的迭代过程。浏览通过工具使用完成——搜索、打开网页,有时还有代码执行工具——而智能体读过的一切都必须装进上下文窗口,因此这类系统会积极把页面蒸馏成笔记,不会囤积原始文本。

推理模型如何改变局面

直到模型能够撑过漫长工作链、又不丢掉主线,Deep Research 才真正可行。一次运行可能跨越几十轮搜索与阅读,所以底层模型必须记住计划、追踪开放问题,并在新来源与早先假设冲突时察觉出来。OpenAI 版本由一款在真实浏览任务上通过强化学习微调的推理模型驱动,竞品也都依靠自家有推理能力的旗舰。实际上,Deep Research 就是花在搜索上的测试时计算:系统用几分钟的推理与浏览,换取任何一次前向传播都产不出的答案。

有引用不等于有保证

带行内链接的精美报告很容易让人过度信任,这正是主要失败模式。引用只能说明模型打开过一页,不能说明那一页真的支持报告中的主张;引用与主张错配非常常见,所以抽查仍不可少。系统还会继承开放网络的偏差:SEO 驱动的内容、过时网页和营销材料,与第一手来源一样得到耐心阅读;付费墙后或未被索引的材料则完全不可见。和所有生成器一样,模型仍可能产生幻觉细节,也可能用听起来合理的综合悄悄糊住证据空白。把输出当作一名速度极快的研究助理交来的优秀初稿,不要当成已经完成事实核查的最终交付物。

市场版图与衡量方式

Gemini 于 2024 年 12 月率先推出 Deep Research;OpenAI 2025 年 2 月的发布起初只对最高价订阅档开放,并设有每月运行额度,正是它让这个类别成型。短短几个月内,Perplexity 为答案引擎加入同类功能,xAI 则在 Grok 中发布 DeepSearch。访问范围迅速扩大,到 2025 年中,大多数主流助手都已提供某种多步研究模式。开源复刻也同步出现,通常是在智能体外壳中把搜索 API 接到推理模型上。

衡量这些系统比搭建它们还难。早期引用最多的结果来自 Humanity's Last Exam,这是一项横跨许多学科的专家级问题基准;OpenAI 的 Deep Research 答对约四分之一,远超当时标准聊天模型的个位数成绩。供应商也报告了 GAIA 上的强势结果,这是一项面向智能体助手的基准测试。不过,两项基准都无法直接捕捉报告质量:引用精度、来源多样性和对人类读者的实用性,仍然主要靠人手判断,独立评估也还很少。

← 所有术语
ESC