Saltar al contenido principal
Zubnet AIAprenderWiki › Uso de computadoras
Usar AI

Uso de computadoras

También conocido como: Computer Use, Computer Use Agents, GUI Agents, Computer-Using Agent (CUA)
Una capacidad que permite a un modelo de IA operar un escritorio o navegador real como lo haría una persona: mirando capturas de pantalla y emitiendo acciones de ratón y teclado. En vez de llamar a una API, el modelo percibe la pantalla, decide dónde hacer clic o qué escribir y un ejecutor realiza la acción, repitiendo el bucle hasta que termina la tarea o el agente se rinde. Computer Use de Anthropic y Operator de OpenAI son las implementaciones más conocidas.

Por qué importa

La mayoría del software empresarial se construyó para humanos, no para máquinas, y gran parte carece de una API utilizable. En principio, los agentes de uso de computadoras pueden manejar cualquiera de estos sistemas — ERP heredados, paneles administrativos internos, sitios web sin vía de integración —, lo que los convierte en la forma más general de automatización con IA intentada hasta ahora. También son actualmente la forma menos fiable, por lo que comprender sus límites importa tanto como comprender su promesa.

En profundidad

Un sistema de uso de computadoras es un bucle, no un único modelo. Una captura de la pantalla actual entra en un modelo multimodal; el modelo razona sobre la tarea y la conversación hasta el momento, y luego emite una acción estructurada — hacer clic en estas coordenadas de píxeles, escribir esta cadena, pulsar esta tecla, desplazarse; un pequeño ejecutor realiza la acción dentro de un entorno aislado, toma una nueva captura, la añade a la conversación y el ciclo se repite. Una tarea como "busca un vuelo a Tokio por menos de 900 dólares y completa el formulario de reserva" puede requerir entre 30 y 100 pasos de este tipo y varios minutos, porque cada paso es una llamada completa al modelo con imágenes dentro del contexto. Esto constituye un contrato fundamentalmente distinto al de un Agente Autónomo construido sobre API: en vez de llamar funciones con argumentos tipados, el agente opera los mismos píxeles y widgets que un humano, con toda la ambigüedad y fragilidad que eso implica.

El bucle captura-acción

La mecánica es deliberadamente sencilla. El modelo ve píxeles, no el DOM ni un árbol de accesibilidad (aunque los agentes de navegador suelen añadir el árbol de accesibilidad como segunda entrada para facilitar la referencia a elementos), y responde con una acción más coordenadas exactas — "clic izquierdo en (412, 637)". Acertar las coordenadas es la parte difícil: el modelo debe anclar un concepto visual como "el botón Guardar" en una posición de píxeles, razón por la que el uso de computadoras impulsó el entrenamiento específico de modelos Multimodal sobre capturas de pantalla con elementos de UI anotados. Las capturas también consumen contexto: un solo fotograma de escritorio puede costar aproximadamente mil tokens, por lo que una sesión de 50 pasos acumula mucho historial visual, y las implementaciones reducen la resolución o descartan fotogramas antiguos para permanecer dentro de la ventana. Cada ida y vuelta cuesta unos segundos de inferencia más la ejecución de la acción, razón por la que los agentes de GUI se sienten lentos frente al Uso de herramientas mediante API estructuradas — la latencia es el precio de la generalidad.

Los lanzamientos que definieron la categoría

Anthropic convirtió "computer use" en una categoría de producto en octubre de 2024, cuando una versión actualizada de Claude 3.5 Sonnet se distribuyó con una beta pública de la capacidad: los desarrolladores recibieron un entorno de referencia (un escritorio Linux dentro de un contenedor con pantalla virtual) y una definición de herramienta que permite al modelo solicitar acciones de ratón, teclado y captura mediante la API. Anthropic lo presentó explícitamente como experimental — a veces engorroso y propenso a errores — y lo dirigió a desarrolladores que automatizan trabajo repetitivo de escritorio. En enero de 2025, OpenAI llevó la idea a los consumidores con Operator, un producto alojado impulsado por su modelo Computer-Using Agent (CUA): el agente maneja un navegador en la nube, puede recorrer sitios y completar formularios, y devuelve el control al usuario para inicios de sesión, pagos y otros pasos sensibles. Una ola de agentes de navegador de código abierto siguió el mismo patrón, y el "agente de GUI" general se convirtió en un elemento estándar de las hojas de ruta de agentes.

OSWorld y las cuentas de fiabilidad

El progreso se sigue principalmente en OSWorld, un Benchmark de unas 370 tareas reales — editar hojas de cálculo, configurar aplicaciones, mover archivos entre programas — ejecutadas en máquinas virtuales Ubuntu activas, junto con suites centradas en la web como WebArena y WorkArena. Los humanos completan aproximadamente el 72 % de las tareas de OSWorld. El primer lanzamiento de uso de computadoras logró alrededor del 15 %, y CUA de OpenAI lo elevó a poco menos del 40 % a principios de 2025 — el estado del arte en ese momento, pero todavía lejos de ser fiable. La parte brutal es la acumulación: si cada paso tiene éxito el 95 % de las veces, una tarea de 30 pasos solo tiene éxito aproximadamente el 21 % de las veces, y una de 100 pasos casi nunca. Por eso la evaluación de agentes de GUI informa el éxito de la tarea completa en vez de la precisión por paso, y por eso los despliegues de producción mantienen las tareas cortas, verificables y reversibles.

No sustituirá tus API

Una idea equivocada común es que los agentes de GUI vuelven obsoletas las integraciones — ¿para qué construir conectores si el agente simplemente puede utilizar el software como una persona? En la práctica, hacer clic en píxeles es la opción de último recurso: es lento, frágil ante rediseños de UI y ventanas emergentes, y difícil de auditar frente a una llamada estructurada de Llamada de Funciones o una herramienta MCP con entradas y salidas tipadas. Si el sistema objetivo tiene una API, úsala; la GUI es para la larga cola de software que no tiene ninguna — aplicaciones de escritorio heredadas, portales de proveedores, herramientas internas de uso único. Los agentes de producción más sólidos son híbridos: manejan API siempre que están disponibles y bajan al control de pantalla solo cuando no existe un camino más limpio, lo cual limita la frágil interacción con píxeles a los pocos pasos que realmente la necesitan.

La prompt injection es la parte difícil

Un agente de GUI lee todo lo que hay en la pantalla, y en la web abierta parte de ese contenido es adversarial. Una página web, correo electrónico o documento puede contener instrucciones ocultas — texto invisible que indica al agente que reenvíe los archivos del usuario a alguna parte —, y un modelo que trata el contenido de la pantalla como órdenes a veces obedecerá, lo que constituye Prompt Injection respaldada por clics reales del ratón. Los dos productos insignia se lanzaron con esta advertencia: Anthropic recomienda ejecutar el uso de computadoras en una máquina virtual dedicada, con privilegios mínimos y sin credenciales a la vista, y Operator protege las compras y los inicios de sesión mediante confirmación del usuario y un modo de toma de control donde el humano escribe la contraseña. La guía práctica coincide con la postura de Inocuidad de la IA de cualquier sistema agéntico: aísla el entorno, crea una lista de sitios permitidos, nunca le des secretos más allá del paso actual y exige aprobación humana para todo lo irreversible, como enviar, pagar o eliminar.

← Todos los términos
ESC