Saltar al contenido principal
Zubnet AIAprenderWiki › Investigación profunda
Usar AI

Investigación profunda

También conocido como: Deep Research, Deep Research Agents, Agentic Research
Un modo ofrecido por varios asistentes de IA en el que el modelo planifica y ejecuta de forma autónoma una tarea de investigación web de varios pasos, y luego devuelve un informe estructurado con citas. En vez de responder a partir de una búsqueda rápida, dedica varios minutos a leer decenas de fuentes, seguir pistas y sintetizar lo que encuentra. Google lanzó la primera función con este nombre en Gemini en diciembre de 2024, el lanzamiento de OpenAI en febrero de 2025 fue lo que la popularizó, y ahora hay equivalentes en Perplexity y Grok.

Por qué importa

Una ejecución de investigación profunda condensa horas de revisión bibliográfica manual — buscar, leer por encima, contrastar, tomar notas — en una sola solicitud. Demuestra su valor en preguntas sin una única respuesta autorizada: análisis de mercados, comparaciones técnicas, panoramas de políticas y revisiones bibliográficas donde la amplitud y las citas rastreables importan más que la velocidad.

En profundidad

Una ejecución de investigación profunda no se parece en nada a un completado de chat normal. Dado un prompt, el sistema primero descompone la pregunta en un plan de investigación: un conjunto de subpreguntas, consultas de búsqueda y ángulos que vale la pena explorar. Luego entra en un bucle — hace búsquedas, abre páginas, lee y decide qué perseguir a continuación — durante entre un par de minutos y media hora, y suele consultar decenas de fuentes por el camino. Los hallazgos intermedios se acumulan en notas de trabajo y una pasada final de síntesis las convierte en un informe estructurado con citas en línea. Bajo el capó, se acerca más al bucle de planificación de un Agente Autónomo que a la consulta de documentos de una sola pasada del RAG clásico.

Cómo funciona el bucle del agente

El bucle central consiste en planificar, buscar, leer y reevaluar. Después de cada batch de páginas, el modelo actualiza su comprensión y elige las siguientes consultas según lo que todavía falta, qué fuentes discrepan y qué afirmaciones necesitan una segunda confirmación. Aquí se aparta del RAG clásico: la recuperación no es una consulta de una sola pasada, sino un proceso iterativo que dirige el propio modelo. La navegación sucede mediante Uso de herramientas — herramientas de búsqueda, apertura de páginas y, en ocasiones, ejecución de código —, y todo lo que ha leído el agente debe caber en la Ventana de contexto, por lo que estos sistemas condensan agresivamente las páginas en notas en vez de acumular texto en bruto.

Por qué los modelos de razonamiento cambiaron el juego

La investigación profunda solo se volvió práctica cuando los modelos pudieron mantener largas cadenas de trabajo sin perder el hilo. Una sola ejecución puede abarcar decenas de pasos de búsqueda y lectura, así que el modelo subyacente debe conservar un plan, seguir las preguntas abiertas y advertir cuando una nueva fuente contradice una suposición anterior. La versión de OpenAI está impulsada por un modelo de razonamiento con ajuste fino mediante aprendizaje por refuerzo sobre tareas reales de navegación, y los productos competidores dependen de sus propios modelos insignia con capacidad de razonamiento. En la práctica, la investigación profunda es Cómputo en tiempo de inferencia gastado en búsqueda: el sistema intercambia minutos de Razonamiento y navegación por una respuesta que ninguna pasada hacia adelante individual podría producir.

Las citas no son una garantía

El informe pulido con enlaces en línea invita a confiar demasiado, y ese es el principal modo de fallo. Una cita indica que el modelo abrió una página, no que la página diga lo que afirma el informe, y las discrepancias entre citas y afirmaciones son lo bastante comunes para que las comprobaciones puntuales sigan siendo esenciales. Los sistemas también heredan los sesgos de la web abierta: el contenido impulsado por SEO, las páginas desactualizadas y el material de marketing se leen con la misma paciencia que las fuentes primarias, mientras el material de pago o no indexado permanece invisible. Como cualquier generador, el modelo todavía puede incurrir en Alucinación de detalles y cubrir discretamente los huecos de evidencia con síntesis que suena plausible. Trata la salida como un primer borrador sólido de un asistente de investigación muy rápido, no como un entregable terminado y verificado.

El campo y cómo se mide

Gemini lanzó el primer Deep Research en diciembre de 2024; el lanzamiento de OpenAI en febrero de 2025, inicialmente limitado a su nivel de suscripción más caro con una cuota mensual de ejecuciones, fue lo que lo convirtió en una categoría. En cuestión de meses, Perplexity añadió uno a su motor de respuestas y xAI publicó DeepSearch en Grok. El acceso se amplió rápidamente, y para mediados de 2025 la mayoría de los grandes asistentes ofrecía alguna forma de investigación de varios pasos. En paralelo aparecieron recreaciones de código abierto, que normalmente conectaban una API de búsqueda con un modelo de razonamiento dentro de un arnés de agente.

Medir estos sistemas es más difícil que construirlos. El resultado temprano más citado es Humanity's Last Exam, un benchmark de preguntas de nivel experto en muchas disciplinas, donde Deep Research de OpenAI respondió correctamente aproximadamente una cuarta parte de las preguntas — muy por encima de las puntuaciones de un solo dígito de los modelos de chat estándar de la época. Los proveedores también informan resultados sólidos en GAIA, un Benchmark de asistentes agénticos. Sin embargo, ninguno de los dos benchmarks captura directamente la calidad de los informes: la precisión de las citas, la diversidad de fuentes y la utilidad para un lector humano todavía se juzgan principalmente a mano, y las evaluaciones independientes siguen siendo escasas.

← Todos los términos
ESC