Le problème que WikiSkill attaque est celui que rencontre tout bâtisseur d'agents : un agent résout quelque chose de difficile, et l'intuition s'évapore à la fin de l'exécution. Les travaux récents découvrent des compétences réutilisables à partir de l'expérience des agents, mais, comme le dit l'article, les intuitions qui guident le développement de ces compétences restent « éparpillées dans les historiques d'optimisation », si bien que rien ne s'accumule. La réponse de Google Research, dans un article paru cette semaine sous arXiv 2608.27454 signé Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan et Tu Vu, est de donner un wiki à l'agent.
La conception repose sur trois couches qui, délibérément, ne sont pas la même chose. La couche brute conserve les journaux d'exécution complets. La couche wiki contient les intuitions distillées sur ce qui a échoué, ce qui a fonctionné et pourquoi, et n'est jamais réinitialisée. La couche compétences contient des instructions procédurales, et peut être réinitialisée quand la performance se dégrade. Chaque itération enchaîne exécution, analyse, proposition de compétence, puis validation par une porte avant que quoi que ce soit soit consigné. Rien ici ne touche aux poids du modèle : l'apprentissage vit dans du texte que le même modèle relira la prochaine fois.
Les chiffres, tels que rapportés par The Decoder, couvrent cinq familles de tâches : raisonnement mathématique, recherche sur le web, manipulation de tableurs, questions-réponses sur documents et environnements interactifs, avec des modèles Qwen de 4B à 27B, Gemma et Gemini. Gemini 3.5 Flash passe de 49,5 à 68,1 pour cent en moyenne ; Qwen-27B de 39,4 à 63,3 ; les plus grands gains isolés sont LiveMath, de 33,0 à 72,6, et les tâches de tableur, de 50,5 à 76,6. Le motif rapporté est que les grands modèles tirent davantage des compétences évoluées, tandis que les petits peuvent s'approcher de la performance des grands en les empruntant.
Les limites valent autant que la manchette. Les gains varient fortement selon le type de tâche, les contextes de longs documents bougent à peine, et les compétences transférées d'un modèle à l'autre nuisent parfois. La direction reste la partie intéressante pour quiconque exploite des agents en production : il ne s'agit ni d'une fenêtre de contexte plus grande ni d'un meilleur moteur de récupération, mais d'un curateur, une étape explicite qui décide de ce qu'une expérience a voulu dire avant de la ranger. Si c'est l'encodage qui sépare une bibliothèque d'un bibliothécaire, cet article est une tentative sérieuse de coucher le bibliothécaire par écrit.
