EN
en direct
IA

AWS ouvre en source Strands Harness, un agent d’IA 45 % moins cher que Claude Code et Codex

Le 21 septembre 2026, AWS a publié Strands Harness, un agent d’IA open source qui regroupe outils, contexte et mémoire, et revendique 45 % d’économie de coût face à Claude Code et Codex. Les équipes qui paient leurs tokens au volume peuvent l’évaluer sans dépendre de l’infrastructure AWS.

Un faisceau de câbles gris s’évasant depuis un anneau métallique, un seul brin éclairé d’ambre.

21 septembre 2026. AWS publie Strands Harness en open source. Mai 2025. la société lançait Strands Agents, son SDK Python pour construire des agents. Février 2026. elle créait Strands Labs pour ses projets plus expérimentaux. Pourquoi c’est important : AWS revendique 45 % d’économie de coût face à Claude Code et Codex, et l’agent tourne sans dépendre de son cloud.

Strands Harness est un agent d’IA généraliste, préconfiguré, que les développeurs peuvent exécuter en local ou déployer sur n’importe quel cloud. Il s’appuie sur Strands Agents, le SDK open source qu’AWS avait lancé en mai 2025 en Python, puis porté en TypeScript. Le principe hérité du SDK est « model-driven » : le développeur fournit le modèle, les outils et les instructions, et c’est le modèle qui décide comment mener la tâche et quand appeler ses outils.

Un harnais, pas un simple SDK

Marc Brooker, vice-président et distinguished engineer chez AWS, décrit Strands Harness comme une couche au-dessus du SDK : un agent Strands déjà configuré, qui assemble la mécanique de fond nécessaire aux tâches longues. Sorti de la boîte, l’agent dispose d’outils fichier, shell et web, ainsi que de la gestion du contexte, de la mémoire, des sessions persistantes, de la mise en cache des prompts et de la délégation à d’autres agents.

La nuance est importante pour qui a déjà bricolé avec un SDK d’agents. « Un SDK vous donne les briques, mais vous devez encore décider comment gérer le contexte, persister les conversations, intégrer les outils et guider le comportement de l’agent », résume Brooker. Strands Harness tranche ces choix à la place du développeur, avec des valeurs par défaut fournies par AWS.

Chaque agent reste personnalisable : instructions, choix du modèle, outils et capacités disponibles, et possibilité de déléguer à un autre agent. La majeure partie du code ne dépend pas de l’infrastructure AWS : la boucle d’agent, les outils, la gestion du contexte, les sessions et la délégation sont dans la version open source et s’exécutent par défaut sur la machine qui fait tourner l’agent.

Un seul point d’ancrage AWS, et il est contournable

L’exception est l’appel au modèle sous-jacent. Sans surprise, AWS route l’accès au modèle via Amazon Bedrock, son service managé de modèles de fondation. C’est le seul défaut lié à AWS sorti de la boîte, et Brooker affirme qu’il se remplace « en une ligne ». Strands Harness peut utiliser Anthropic, OpenAI ou Google comme fournisseur, ou un modèle local via Ollama.

Changer de fournisseur ne change pas forcément le modèle, mais choisir un autre modèle influe évidemment sur le comportement de l’agent. Ce qui ne change pas, insiste Brooker : « la gestion du contexte, les sessions, les outils et la délégation fonctionnent de la même façon, quel que soit le fournisseur. Aucune fonctionnalité n’exige Bedrock. »

L’agent est pensé comme un agent généraliste, pas comme un assistant de code, même s’il s’inspire des harnais Claude Code et Codex. La différence mise en avant par AWS : on peut déployer Strands Harness sur le cloud de son choix, ce qui répond à un souhait récurrent des utilisateurs de Claude Code et Codex. Un CLI permet de prototyper et de configurer un agent de façon interactive, puis d’exporter le résultat en Python ou TypeScript via /export.

Le chiffre des 45 %, et comment il a été obtenu

La revendication de coût repose sur un banc d’essai de six benchmarksALFWorld, ContextBench, GAIA, WebShop, τ³-bench et Terminal-Bench 2.1 — sur lesquels AWS a moyenné son score et comparé le coût moyen par tâche. Face à Claude Code et Codex, Strands Harness ressort 45 % moins cher, avec une précision « largement comparable ».

Le chiffre tombe à 28 % une fois DeepSeek Harness intégré à la comparaison : AWS indique que ce dernier a tourné environ 14 % moins cher que Strands Harness sur des exécutions appariées. Sur Terminal-Bench 2.1, Strands Harness exécutant Fable 5 a coûté 77 % de moins que Claude Code56,29 $ contre 248,05 $ sur 89 essais — pour un score de 69,7 contre 61,8. DeepSeek Harness était encore moins cher, à 40,30 $, mais avec un score inférieur de 59,5.

AWS attribue ce résultat à ses réglages de gestion du contexte : Strands Harness tronque les sorties d’outils particulièrement volumineuses, compacte le contexte quand la fenêtre disponible dépasse un seuil, et tente de récupérer dans la boucle d’agent en cas de débordement. L’argument commercial est transparent : empaqueter ces réglages évite à chaque développeur de les redécouvrir seul avec le SDK.

Une porte ouverte vers AgentCore

Le projet entretient un lien étroit avec Amazon Bedrock AgentCore, le service managé d’AWS pour déployer et exploiter des agents. AgentCore Harness et Strands Harness sont construits par la même équipe, dans des dépôts séparés, et les améliorations circulent de l’un à l’autre. Brooker insiste : Strands Harness se déploie indépendamment d’AgentCore, hors d’AWS.

La trajectoire commerciale n’en est pas moins claire. Les développeurs peuvent adopter Strands Harness librement, et AgentCore devient la destination naturelle de ceux qui veulent, à terme, qu’AWS exploite l’infrastructure autour de l’agent.

Le harnais, nouveau champ de bataille des agents

L’annonce d’AWS s’inscrit dans un glissement plus large. Pendant deux ans, la bataille des agents de code s’est jouée sur les modèles — qui alignait le meilleur score sur SWE-bench ou Terminal-Bench. Strands Harness illustre le déplacement du curseur vers le harnais, c’est-à-dire l’ensemble des réglages qui entourent le modèle : gestion du contexte, outils, mémoire, sessions et délégation.

Le raisonnement économique est simple à suivre. À modèle égal, deux harnais peuvent produire des coûts par tâche très différents, simplement parce que l’un compacte le contexte à temps et que l’autre laisse la fenêtre déborder. Les chiffres d’AWS77 % d’écart sur Terminal-Bench 2.1 entre Strands Harness et Claude Code à modèle comparable — sont d’abord une démonstration de ce levier, avant d’être un argument de vente.

Pour une équipe d’ingénierie, la conséquence est concrète : le choix d’un harnais est devenu aussi structurant que le choix d’un modèle, et il mérite la même rigueur d’évaluation. Un harnais open source que l’on peut auditer et modifier offre, sur ce point, un avantage que les assistants fermés n’ont pas. AWS accompagne d’ailleurs le projet d’une Agent Skill destinée aux agents de code, qui documente l’ajout de serveurs MCP ou la génération de configurations de déploiement pour AWS, GCP, Azure, Cloudflare et Modal.

Ce que vous devez faire

Pour une équipe qui évalue des agents de code ou d’automatisation, Strands Harness se teste à faible coût — précisément parce qu’il est open source et qu’il tourne en local ou sur votre cloud. Le point de vigilance est la nature généraliste de l’agent : ce n’est pas un remplaçant direct de Claude Code ou Codex pour les tâches de code, et les chiffres de coût sont ceux d’AWS sur ses propres bancs.

Si vous payez vos tokens au volume et que le coût par tâche est votre critère dominant, intégrez Strands Harness à votre évaluation comparative, en reproduisant vos propres scénarios plutôt qu’en reprenant les six benchmarks d’AWS. Si vous êtes déjà sur Bedrock, l’essai est presque gratuit et le lien vers AgentCore peut simplifier la mise en production.

Verdict

Strands Harness ne bouleverse pas la hiérarchie des modèles, mais il déplace la question vers le harnais — la mécanique autour du modèle, devenue le vrai levier de coût et de fiabilité. Si vous cherchez un agent généraliste open source déployable hors d’AWS, c’est un candidat sérieux à tester sur vos scénarios. Si votre critère est le seul prix, vérifiez aussi DeepSeek Harness, moins cher encore sur les exécutions appariées d’AWS, mais avec un score inférieur.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Anthropic et OpenAI se livrent une guerre des prix avec Opus 5.5 et les modèles GPT-6 Sol et Luna

Le 22 septembre 2026, Anthropic a lancé Claude Opus 5.5 en baissant son prix de 20 %, et OpenAI a riposté quelques minutes plus tard avec deux modèles GPT-6, Sol et Luna, vendus moitié moins cher que leurs prédécesseurs. Le choix d’un modèle devient une décision budgétaire autant que technique : évaluez le coût au jeton en fonction de la charge réelle.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer