Le terme est déroutant car il est à la fois trop large et trop spécifique : la ligne commune dit qu'un harnais est l'environnement dans lequel un agent s'exécute, mais cette phrase n'explique jamais ce qui compte comme un harnais et ce qui ne l'est pas. La vidéo pose donc la question clairement dès le début : en quoi l'exploitation d'un agent est-elle réellement différente de l'écriture de prompts et de l'ingénierie de contexte ?
L'histoire fait un rapide retour en arrière. Le terme de harnais a été inventé début 2026, mais l'ingénierie le précède : lorsque ChatGPT a été lancé en 2022, la fenêtre contextuelle était d'environ 4 000 tokens, et aucun travail significatif ne tenait dans cet espace étroit. Puisque la simple demande ne suffisait pas, la question a changé : comment recycler ce petit espace mémoire pour faire plus avec moins ?
La réponse a été le passage de l'ingénierie de prompt à l'ingénierie de contexte. L'appel d'outils a permis aux agents de fouiller un dépôt et de ne lire que les fichiers pertinents tout en agissant à l'extérieur ; MCP a superposé des capacités spécifiques au fournisseur sur le modèle ; RAG a rendu des bases de données personnalisées disponibles à la demande. Ces trois techniques ont lancé l'ère des agents de codage, avec des acteurs précoces comme Cursor, Windsurf, Cline, Roo et Aider intégrant la gestion de contexte basée sur les outils dans des produits qui accomplissaient visiblement le travail.
Pendant ce temps, les modèles ont grandi, les fenêtres se sont élargies et les tâches demandées se sont allongées. Les demandes de fonctionnalités et de corrections de bugs ont explosé en portée, et les agents qui chargeaient le contexte de manière autonome ont pris en charge un travail de plus en plus complexe. Puis le mur : sur une tâche gigantesque comme le clonage d'un site web entier, un simple prompt produit un résultat unique et sommaire, et l'ingénierie de contexte est insuffisante face à l'énorme portée.
Le tableau des symptômes est familier : un site à moitié terminé, des boutons qui ne fonctionnent pas, des fonctionnalités jamais testées de bout en bout. La vidéo attribue la cause profonde à la synthèse de contexte : à mesure que la fenêtre se remplit, le contenu est résumé, de sorte que, par exemple, sur une tâche de 12 heures, l'agent vit à la merci de son propre résumé du travail antérieur. Le résumé confond le travail inachevé avec le travail terminé, traite les fonctionnalités non vérifiées comme faites et laisse des tâches à moitié terminées ou jamais tentées.
Entre-temps, tout le monde a attaqué le même problème différemment : des sous-agents pour la gestion hiérarchique du contexte, des essaims d'agents chacun avec sa propre fenêtre. Rétrospectivement, tous ces essais ont convergé vers un point : l'exploitation de l'agent sous-jacent. Une meilleure couche d'orchestration, un meilleur environnement d'exécution et une meilleure gestion de contexte sont apparus comme les trois ingrédients de l'exploitation.
Le terme est officiellement né début 2026. Certains l'appellent du jargon, mais la vidéo soutient que le mot capture un véritable changement industriel. Le changement critique est l'idée de boucle : passer une couche au-dessus de l'ingénierie de contexte et placer l'agent dans un cycle où chaque itération commence par un contexte frais et propre sous des règles strictes sur la façon dont le travail commence et se termine. L'exemple de Ralph qui a envahi Internet est exactement cela : d'abord un grand document d'exigences est écrit, le travail est décrit en JSON, puis la boucle avance fonctionnalité par fonctionnalité ; chaque étape est testée et documentée jusqu'à ce que tout le travail soit terminé. Le petit dépôt reflète la simplicité de l'architecture, et la même histoire se lit dans la démo minimale de harnais partagée par Anthropic.
Le segment sponsorisé au milieu ouvre une fenêtre séparée : travail multi-appareils, agents parallèles générés au besoin, agents cloud qui continuent de fonctionner lorsque la machine est éteinte et ouvrent une pull request une fois terminé, demandes de fonctionnalités envoyées via Slack, et automatisation qui vérifie quotidiennement les nouvelles versions de modèles pour maintenir un site à jour par lui-même. Le segment est précieux en tant que vitrine de la façon dont l'idée du harnais est emballée en tant que produit, mais il doit être regardé en se souvenant qu'il est sponsorisé.
L'exploitation ne jette pas ses prédécesseurs ; elle les absorbe tous les deux. Jeter un coup d'œil aux prompts système des agents de codage open source montre qu'un prompt bien écrit est toujours à l'œuvre : le prompt donne à l'agent son identité et sa personnalité, mais reste une petite composante de l'ensemble. La gestion de contexte se situe dans la couche supérieure. Le changement n'est donc pas l'abandon de ces deux approches mais un changement de paradigme : placer l'agent dans une séquence d'étapes qui génère un document d'exigences, en choisit une tâche et entre dans chaque itération avec un contexte frais.
L'image finale est claire : de nombreux agents de codage ont maintenant intégré cette couche de harnais dans l'application elle-même, chacun à sa manière. Cette affirmation d'efficacité explique pourquoi chaque entreprise parle de sa couche de harnais. En huit minutes, la vidéo fait plus que déballer un terme ; elle donne à quiconque effectue un travail d'agent à long terme un programme en une phrase : concevez d'abord l'environnement, souciez-vous du modèle plus tard.
Commentaire de l’IA
"« Pour moi, le point le plus éclairant de la vidéo est la façon dont elle nomme le piège de la synthèse : un agent qui ne cesse de se résumer à mesure que sa fenêtre se remplit devient prisonnier de son propre résumé. Je n'avais jamais vu aussi clairement que sur les tâches longues, le problème est l'environnement, pas le modèle. »"
Évaluation de l’IA
Pour défendre l'autre côté : boucler chaque tâche n'est pas le bon harnais, c'est de la suringénierie. Comme le souligne l'analyse de Bowne-Anderson, le harnais dont vous avez besoin dépend de la complexité de l'action et du contexte de la tâche ; de nombreux agents de support, de vente et d'entreprise n'ont jamais besoin de la gestion de contexte lourde d'un agent de codage. À mesure que les modèles s'améliorent, les fonctionnalités du harnais sont absorbées par le modèle, de sorte qu'une couche soigneusement construite aujourd'hui est vouée à vieillir demain. Le principe du harnais minimal viable est un frein sain à l'enthousiasme de la vidéo.
La vidéo sous-estime la discipline de la mémoire inter-sessions. Comme l'explique la note d'ingénierie d'Anthropic, la seule compaction ne suffit pas : l'agent essaie de faire trop de choses à la fois, manque de contexte en cours d'implémentation et transmet à la session suivante une fonctionnalité à moitié terminée et non documentée ; la session suivante perd alors du temps à deviner et à faire fonctionner à nouveau l'application de base. La solution proposée est un agent d'initialisation plus un agent de codage qui progresse progressivement à chaque session tout en laissant des artefacts propres. L'éloge du contexte frais par la vidéo éclipse cette discipline des artefacts et le fait que la rédaction du document d'exigences reste un travail humain.
Deux remarques sur la vérifiabilité. Premièrement, la vidéo est sponsorisée : l'éloge de l'agent cloud doit être lu à travers le prisme du payeur. Deuxièmement, les exemples de Ralph et Anthropic sont des réussites sélectionnées ; un petit dépôt ne signifie pas une tâche simple, et tous les dépôts ne correspondent pas au modèle. Les chiffres et les généralisations ne doivent pas être acceptés avant un essai sur mon propre dépôt au moment de la décision.
Mon principal enseignement pratique : face à un travail de codage de plusieurs heures, j'essaierais le modèle de boucle PRD, car le diagnostic du piège de la synthèse m'a semblé juste. Mais je ne construirais pas de harnais lourd pour les petites tâches ; le prompt et le contexte résolvent d'abord, les boucles seulement s'ils sont insuffisants. Je choisis le harnais en fonction de la durée et de la complexité de la tâche, et non du modèle.
Sources
7 liens ; 1 d’entre eux sont aussi cités par 1 autre article. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=1a1VXDdIyrk
- @anthropic https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents
- @anthropic https://www.anthropic.com/engineering/harness-design-long-running-apps
Également cité par : Harness Router: One Local Panel to Run Any Harness — Claude Code, Codex and Gemini CLI Together
- @martinfowler https://martinfowler.com/articles/harness-engineering.html
- @hugobowne https://hugobowne.substack.com/p/stop-overengineering-your-agent-harness
- @milvus https://milvus.io/blog/harness-engineering-ai-agents.md
- @github https://github.com/snarktank/ralph
harnais · architecture en boucle · ralph