Sources : AlphaSignal (4 octobre 2026), article de Ben Dickson. [Pas de lien disponible]
Un agent, c'est une IA qui accomplit une tâche en plusieurs étapes : chercher, écrire, vérifier, recommencer. Jusqu'ici, les développeurs réglaient à la main tout ce qui l'entoure : les consignes qu'on lui donne, les outils qu'il peut utiliser, ce qu'il garde en mémoire. Selon AlphaSignal, des chercheurs confient désormais ce réglage à l'agent lui-même. La question devient alors : quelle partie de l'agent doit rester fixe, et laquelle peut apprendre ?
Le principe ne varie pas. L'agent travaille, on garde la trace de ce qu'il a fait, on y cherche les erreurs qui reviennent, puis on modifie une pièce. On vérifie ensuite, sur des exemples mis de côté, que la nouvelle version fait mieux, et l'on ne garde le changement que si le score progresse. La pièce modifiée peut se situer à trois niveaux, du plus simple au plus lourd.
Le premier niveau, ce sont les « skills » : des fichiers de texte qui décrivent comment mener une tâche précise, et que l'agent consulte au besoin. SkillOpt, de Microsoft, y propose de petits ajouts ou retraits, et ne conserve que ceux qui font progresser l'agent. L'avantage tient au résultat, qui reste un texte qu'un humain peut lire et corriger. Ce niveau suffit quand l'agent dispose des bons outils mais répète des erreurs de méthode.
Le deuxième niveau est le « harnais », c'est-à-dire tout ce qui entoure le modèle : il décide de ce que le modèle voit, de ce qu'il peut faire et de sa réaction face à un échec. On y touche quand les pannes sont plus profondes : un agent qui relance la même commande cassée, ne vérifie pas son travail, ou oublie où il en était. Self-Harness repère ces faiblesses dans les traces et propose des corrections ciblées, testées pour ne rien casser ailleurs. Selon la lettre, le score progresse dans le meilleur des cas de 132 %, c'est-à-dire qu'il fait plus que doubler.
Le troisième niveau touche le modèle lui-même. HarnessX, de Xiaomi, se sert des mêmes traces pour améliorer le harnais et pour réentraîner le modèle, qui intègre ainsi les stratégies gagnantes. La lettre en précise la limite : il faut avoir accès aux paramètres du modèle, ce qui exclut les modèles fermés, accessibles seulement en ligne, et le coût grimpe. D'autres travaux poussent l'idée plus loin, d'un agent de programmation qui réécrit son propre code (la Darwin Gödel Machine) à des équipes d'agents qui réorganisent leur coordination (Raven, d'EverMind AI).
La lettre en tire une règle simple : modifier la plus petite pièce qui suffit à corriger le défaut. Une erreur de méthode se corrige dans une skill, une panne d'outil ou de mémoire dans le harnais, et l'on ne touche au modèle qu'en dernier recours. Pour qui construit ou configure des agents, le travail se déplace. On décide moins chaque amélioration à la main, davantage ce qui a le droit de changer et la façon de mesurer le progrès. Les chiffres cités sont ceux des auteurs des travaux, rapportés par la lettre ; les articles de recherche eux-mêmes n'ont pas été relus.