Utilisation de l'ordinateur
Pourquoi c’est important
En profondeur
Un système d'utilisation d'ordinateur est une boucle, pas un modèle unique. Une capture de l'écran courant entre dans un modèle multimodal; le modèle raisonne sur la tâche et la conversation jusque-là, puis émet une action structurée — cliquer à ces coordonnées de pixels, taper cette chaîne, appuyer sur cette touche, défiler; un petit exécuteur pose l'action dans un environnement isolé, prend une nouvelle capture, l'ajoute à la conversation, et le cycle recommence. Une tâche comme « trouve un vol vers Tokyo sous 900 $ et remplis le formulaire de réservation » peut prendre de 30 à 100 étapes de ce genre et plusieurs minutes, parce que chaque étape est un appel de modèle complet avec des images dans le contexte. Ça en fait un contrat fondamentalement différent d'un agent autonome bâti sur des API : au lieu d'appeler des fonctions avec des arguments typés, l'agent manipule les mêmes pixels et widgets qu'un humain, avec toute l'ambiguïté et la fragilité que ça implique.
La boucle capture-action
La mécanique est délibérément simple. Le modèle voit des pixels, pas le DOM ni l'arbre d'accessibilité (bien que les agents de navigateur ajoutent souvent l'arbre d'accessibilité comme seconde entrée pour faciliter le référencement des éléments), et il répond par une action assortie de coordonnées exactes — « clic gauche à (412, 637) ». Obtenir les bonnes coordonnées est la partie difficile : le modèle doit ancrer un concept visuel comme « le bouton Enregistrer » dans une position de pixels, et c'est pourquoi l'utilisation d'ordinateur a poussé à entraîner les modèles multimodaux spécifiquement sur des captures d'écran aux éléments d'interface annotés. Les captures mangent aussi du contexte : une seule image de bureau peut coûter environ mille tokens, donc une séance de 50 étapes accumule beaucoup d'historique visuel, et les implémentations réduisent la résolution ou jettent les vieilles images pour rester dans la fenêtre. Chaque aller-retour coûte quelques secondes d'inférence plus l'exécution de l'action, et c'est pourquoi les agents d'interface graphique paraissent lents à côté de l'utilisation d'outils sur des API structurées — la latence est le prix de la généralité.
Les publications qui ont défini la catégorie
Anthropic a fait de l'« utilisation d'ordinateur » une catégorie de produit en octobre 2024, quand une version mise à jour de Claude 3.5 Sonnet a été livrée avec une bêta publique de la capacité : les développeurs recevaient un environnement de référence (un bureau Linux dans un conteneur avec affichage virtuel) et une définition d'outil permettant au modèle de demander des actions de souris, de clavier et de capture d'écran par l'API. Anthropic l'a présentée explicitement comme expérimentale — parfois lourde et sujette aux erreurs — et l'a destinée aux développeurs automatisant du travail de bureau répétitif. En janvier 2025, OpenAI a porté l'idée au grand public avec Operator, un produit hébergé propulsé par son modèle Computer-Using Agent (CUA) : l'agent pilote un navigateur infonuagique, peut naviguer sur des sites et remplir des formulaires, et rend le contrôle à l'utilisateur pour les connexions, les paiements et autres étapes sensibles. Une vague d'agents de navigateur à code source ouvert a suivi le même motif, et l'« agent d'interface graphique » général est devenu un item standard des feuilles de route d'agents.
OSWorld et l'arithmétique de la fiabilité
Les progrès se suivent surtout sur OSWorld, un banc d'essai d'environ 370 tâches réelles — modifier des tableurs, configurer des applications, déplacer des fichiers entre programmes — exécutées sur de vraies machines virtuelles Ubuntu, aux côtés de suites axées sur le web comme WebArena et WorkArena. Les humains complètent environ 72 % des tâches d'OSWorld. La première publication d'utilisation d'ordinateur atteignait environ 15 %, et le CUA d'OpenAI a poussé ça à un peu moins de 40 % au début de 2025 — l'état de l'art à l'époque, et encore loin d'être fiable. La partie brutale, c'est l'effet cumulatif : si chaque étape réussit 95 % du temps, une tâche de 30 étapes ne réussit qu'environ 21 % du temps, et une tâche de 100 étapes presque jamais. C'est pourquoi l'évaluation des agents d'interface graphique rapporte le succès de la tâche complète plutôt que la justesse par étape, et pourquoi les déploiements en production gardent les tâches courtes, vérifiables et réversibles.
Ça ne remplacera pas vos API
Une idée fausse répandue veut que les agents d'interface graphique rendent les intégrations obsolètes — pourquoi bâtir des connecteurs si l'agent peut simplement utiliser le logiciel comme une personne? En pratique, cliquer sur des pixels est l'option de dernier recours : c'est lent, fragile devant les refontes d'interface et les fenêtres surgissantes, et difficile à auditer comparé à un appel structuré d'appel de fonctions ou à un outil MCP aux entrées et sorties typées. Si le système cible a une API, utilisez-la; l'interface graphique est pour la longue traîne des logiciels qui n'en ont pas — applications de bureau vieillissantes, portails de fournisseurs, outils internes uniques. Les agents de production les plus solides sont hybrides : ils pilotent des API partout où c'est possible et ne descendent au contrôle d'écran que lorsqu'aucune voie plus propre n'existe, ce qui confine le clic de pixels fragile aux quelques étapes qui en ont vraiment besoin.
L'injection de prompt est la partie difficile
Un agent d'interface graphique lit tout ce qui est à l'écran, et sur le web ouvert une partie de ce contenu est adverse. Une page web, un courriel ou un document peut porter des instructions cachées — du texte invisible disant à l'agent de faire suivre les fichiers de l'utilisateur quelque part — et un modèle qui traite le contenu de l'écran comme des commandes obtempérera parfois, ce qui est de l'injection de prompt avec de vrais clics de souris derrière. Les deux produits phares ont été livrés avec cet avertissement : Anthropic recommande d'exécuter l'utilisation d'ordinateur dans une machine virtuelle dédiée à privilèges minimaux et sans identifiants qui traînent, et Operator verrouille achats et connexions derrière une confirmation de l'utilisateur et un mode de reprise où l'humain tape le mot de passe. Le plan de match pratique correspond à la posture de sûreté de l'IA de tout système agentique : isolez l'environnement, mettez en liste blanche les sites qu'il peut visiter, ne lui donnez jamais de secrets au-delà de l'étape courante, et exigez une approbation humaine pour tout ce qui est irréversible comme envoyer, payer ou supprimer.