Investigación profunda
Por qué importa
En profundidad
Una ejecución de investigación profunda no se parece en nada a un completado de chat normal. Dado un prompt, el sistema primero descompone la pregunta en un plan de investigación: un conjunto de subpreguntas, consultas de búsqueda y ángulos que vale la pena explorar. Luego entra en un bucle — hace búsquedas, abre páginas, lee y decide qué perseguir a continuación — durante entre un par de minutos y media hora, y suele consultar decenas de fuentes por el camino. Los hallazgos intermedios se acumulan en notas de trabajo y una pasada final de síntesis las convierte en un informe estructurado con citas en línea. Bajo el capó, se acerca más al bucle de planificación de un Agente Autónomo que a la consulta de documentos de una sola pasada del RAG clásico.
Cómo funciona el bucle del agente
El bucle central consiste en planificar, buscar, leer y reevaluar. Después de cada batch de páginas, el modelo actualiza su comprensión y elige las siguientes consultas según lo que todavía falta, qué fuentes discrepan y qué afirmaciones necesitan una segunda confirmación. Aquí se aparta del RAG clásico: la recuperación no es una consulta de una sola pasada, sino un proceso iterativo que dirige el propio modelo. La navegación sucede mediante Uso de herramientas — herramientas de búsqueda, apertura de páginas y, en ocasiones, ejecución de código —, y todo lo que ha leído el agente debe caber en la Ventana de contexto, por lo que estos sistemas condensan agresivamente las páginas en notas en vez de acumular texto en bruto.
Por qué los modelos de razonamiento cambiaron el juego
La investigación profunda solo se volvió práctica cuando los modelos pudieron mantener largas cadenas de trabajo sin perder el hilo. Una sola ejecución puede abarcar decenas de pasos de búsqueda y lectura, así que el modelo subyacente debe conservar un plan, seguir las preguntas abiertas y advertir cuando una nueva fuente contradice una suposición anterior. La versión de OpenAI está impulsada por un modelo de razonamiento con ajuste fino mediante aprendizaje por refuerzo sobre tareas reales de navegación, y los productos competidores dependen de sus propios modelos insignia con capacidad de razonamiento. En la práctica, la investigación profunda es Cómputo en tiempo de inferencia gastado en búsqueda: el sistema intercambia minutos de Razonamiento y navegación por una respuesta que ninguna pasada hacia adelante individual podría producir.
Las citas no son una garantía
El informe pulido con enlaces en línea invita a confiar demasiado, y ese es el principal modo de fallo. Una cita indica que el modelo abrió una página, no que la página diga lo que afirma el informe, y las discrepancias entre citas y afirmaciones son lo bastante comunes para que las comprobaciones puntuales sigan siendo esenciales. Los sistemas también heredan los sesgos de la web abierta: el contenido impulsado por SEO, las páginas desactualizadas y el material de marketing se leen con la misma paciencia que las fuentes primarias, mientras el material de pago o no indexado permanece invisible. Como cualquier generador, el modelo todavía puede incurrir en Alucinación de detalles y cubrir discretamente los huecos de evidencia con síntesis que suena plausible. Trata la salida como un primer borrador sólido de un asistente de investigación muy rápido, no como un entregable terminado y verificado.
El campo y cómo se mide
Gemini lanzó el primer Deep Research en diciembre de 2024; el lanzamiento de OpenAI en febrero de 2025, inicialmente limitado a su nivel de suscripción más caro con una cuota mensual de ejecuciones, fue lo que lo convirtió en una categoría. En cuestión de meses, Perplexity añadió uno a su motor de respuestas y xAI publicó DeepSearch en Grok. El acceso se amplió rápidamente, y para mediados de 2025 la mayoría de los grandes asistentes ofrecía alguna forma de investigación de varios pasos. En paralelo aparecieron recreaciones de código abierto, que normalmente conectaban una API de búsqueda con un modelo de razonamiento dentro de un arnés de agente.
Medir estos sistemas es más difícil que construirlos. El resultado temprano más citado es Humanity's Last Exam, un benchmark de preguntas de nivel experto en muchas disciplinas, donde Deep Research de OpenAI respondió correctamente aproximadamente una cuarta parte de las preguntas — muy por encima de las puntuaciones de un solo dígito de los modelos de chat estándar de la época. Los proveedores también informan resultados sólidos en GAIA, un Benchmark de asistentes agénticos. Sin embargo, ninguno de los dos benchmarks captura directamente la calidad de los informes: la precisión de las citas, la diversidad de fuentes y la utilidad para un lector humano todavía se juzgan principalmente a mano, y las evaluaciones independientes siguen siendo escasas.