EN
en direct

AWS livre CloudWatch Omni pour observer et évaluer les agents IA

Le 22 septembre 2026, Amazon CloudWatch a lancé Omni, une expérience d’observabilité unifiée pour les applications et les agents IA, livrée dans VS Code, Kiro et une console web autonome. Adoptez-la pour tracer, comparer et évaluer vos agents avant qu’une régression de prompt ne dégrade vos réponses en production.

Un mur d’écrans éteints dans une salle de contrôle vide, une seule courbe sinusoïdale ambre allumée sur l’écran central.

22 septembre 2026. Amazon CloudWatch lance Omni, une expérience d’observabilité unifiée pour les applications et les charges d’IA. 22 septembre 2026. AWS décrit le produit comme « app-centric, AI-powered, built on open standards, delivered off-console ». 22 septembre 2026. Le service est annoncé gratuit et utilisable sans compte AWS. Pourquoi c’est important : pour la première fois, AWS déplace l’observabilité des agents IA dans l’IDE du développeur, avec un moteur d’évaluation intégré — et non plus une console de supervision qu’on consulte après coup.

Ce que CloudWatch Omni change

Le point de départ est un constat que AWS formule lui-même dans son billet de lancement : le comportement d’un agent est non déterministe. Un changement de prompt peut dégrader la qualité des réponses alors que les métriques classiques — latence, taux d’erreur — restent vertes. Les équipes passent des heures à recouper manuellement des journaux répartis sur plusieurs systèmes, sans pouvoir identifier ce qui a changé ni pourquoi.

CloudWatch Omni répond en capturant chaque trace et en y adossant des évaluateurs intégrés qui notent la cohérence, la pertinence du retrieval, la fidélité et le choix d’outil, entre autres. C’est le cœur du produit : transformer l’observabilité d’un agent en mesure de qualité, pas seulement en mesure de disponibilité.

Le positionnement est volontairement transversal. Omni fonctionne avec n’importe quel fournisseur de modèles, framework ou runtime, et s’appuie sur OpenTelemetry pour l’instrumentation. Le terme « off-console » n’est pas un détail marketing : il signifie que l’outil vit là où travaillent les développeurs, et non dans la console AWS.

Deux surfaces pour deux métiers

Le produit est livré sous deux surfaces complémentaires. Les développeurs reçoivent une extension native pour VS Code et Kiro — les deux IDE actuellement pris en charge — où les traces apparaissent au fil de l’exécution de l’agent, avec un playground et les évaluateurs à un clic. Les opérateurs reçoivent une expérience web autonome, distincte de la console de gestion AWS, accessible en SSO sans compte console.

Les deux surfaces partagent les mêmes données : la trace qu’un développeur débugue est exactement celle qu’un opérateur investigue en production. Cette unification est plus rare qu’elle n’y paraît — la plupart des outils d’observabilité de l’IA générative imposent encore de choisir entre un silo dédié au dev et un dashboard orienté ops.

La fonctionnalité Cloud Login relie ensuite l’environnement local au compte AWS, pour envoyer la télémétrie vers CloudWatch, partager des traces et accéder aux dashboards de production. Ce raccordement est optionnel : on peut utiliser Omni entièrement en local pendant le développement, puis se connecter au cloud au moment de passer en production.

L’évaluation devient la métrique de référence

La partie la plus structurante du produit est son approche eval-driven. Omni embarque 17 évaluateurs intégrés qui mesurent des dimensions comme la cohérence, l’utilité, la fidélité ou la correction du routage. L’utilisateur sélectionne des traces dans le Trace Explorer, choisit ses évaluateurs, puis obtient des scores par exemple et des métriques agrégées — sans construire de framework d’évaluation maison.

Le Trace Explorer affiche une timeline hiérarchique de chaque étape de l’agent : appels au LLM, invocations d’outils, étapes de raisonnement. On peut descendre dans n’importe quel span pour inspecter les entrées, les sorties, la consommation de tokens et la latence. Le mode Compare place deux traces côte à côte pour mesurer l’effet d’un changement de prompt, et l’assistant Ask Assistant fait analyser les anomalies par un agent — par exemple pour répondre à « pourquoi l’agent a-t-il appelé cet outil deux fois ? ».

Au-dessus des traces, trois briques ferment la boucle d’ingénierie. Le Playground compare des prompts et des modèles en temps réel. La vue Experiments exécute le même jeu de données contre deux variantes d’agent et compare leurs scores, leur latence et leur consommation de tokens. Le Prompt Management versionne les configurations et permet le rollback. Enfin, la Session Explorer relit les conversations multi-tours et la vue Agent Topology visualise l’architecture de l’agent — sous-agents, outils, interconnexions.

bash
# Lancer un agent GGUF local via transformers serve (API compatible OpenAI)
# puis pointer CloudWatch Omni sur le même endpoint pour le tracer
pip install -U "transformers[serving] @ git+https://github.com/huggingface/transformers.git" kernels
transformers serve "unsloth/Qwen3.5-4B-GGUF:Qwen3.5-4B-Q4_K_M.gguf"

Cette mécanique de golden datasets est ce qui distingue le produit d’un simple visualiseur de traces : on fige un corpus de référence, on rejoue l’agent, et toute régression de prompt déclenche une alerte chiffrée plutôt qu’une intuition.

Une instrumentation ouverte et un modèle gratuit

Omni s’appuie sur les frameworks d’agents déjà en usage : LangChain, LangGraph, CrewAI, OpenAI SDK, Strands, Vercel AI SDK, en Python comme en TypeScript. Deux chemins d’instrumentation sont proposés : l’auto-instrumentation via Kiro, qui détecte le framework et configure le tracing, ou l’instrumentation manuelle avec des extraits de code prêts à l’emploi.

Le produit intègre aussi les assistants de code — Kiro, Claude Code, Codex — pour configurer le serveur de développement, installer les dépendances et poser l’instrumentation à votre place. L’objectif affiché est de passer de l’installation à la première session tracée en quelques minutes.

Le modèle économique mérite qu’on s’y arrête : CloudWatch Omni est gratuit. Aucun compte AWS n’est nécessaire pour démarrer — seuls des credentials Bedrock ou des clés API pour OpenAI ou Anthropic sont demandés si l’on veut brancher des modèles hébergés. Pour un produit aussi riche, ce positionnement signale moins une générosité qu’une stratégie d’adoption : capter le développeur d’agents avant qu’il ne s’installe chez un concurrent, puis monétiser la télémétrie CloudWatch et les services adjacents.

La concurrence et le pari off-console

Le lancement s’inscrit dans un marché déjà saturé. Côté évaluation et tracing des agents, LangSmith, Langfuse et Braintrust se disputent la niche. Côté observabilité classique, Datadog, New Relic et Grafana Cloud ont tous ajouté un module LLM à leurs dashboards. La réponse d’AWS tient en deux choix structurants : fusionner l’évaluation dans l’observabilité plutôt que d’en faire un silo séparé, et livrer l’outil dans l’IDE plutôt qu’un dashboard distant.

Le pari off-console est le plus audacieux. Historiquement, l’observabilité a été construite pour les opérateurs — des consoles à consulter après coup. En plaçant le tracing au cœur de VS Code et de Kiro, AWS cible le moment où la qualité d’un agent se décide, pendant le développement, plutôt que celui où elle se constate, en production. Si le pari réussit, l’observabilité d’agents devient une étape du cycle de développement, au même rang que le linting ou les tests.

Prenons un cas concret. Une équipe modifie le prompt système pour corriger un biais de format, et le taux de « tool selection » correct chute de 92 % à 71 %. Sans Omni, la régression n’apparaît que dans les tickets utilisateurs, des semaines plus tard. Avec un golden dataset, elle est détectée avant le déploiement, avec le score exact qui a bougé et la trace qui montre le prompt fautif. C’est cette boucle — prompt, trace, évaluation, rollback — qui manquait aux équipes d’agents.

Verdict

CloudWatch Omni déplace la ligne de front de l’observabilité des agents : elle ne se joue plus dans une console qu’on consulte après un incident, mais dans l’IDE, au moment où l’agent s’exécute et où la qualité se décide. Si vous construisez des agents sur AWS, ou avec LangChain/CrewAI en Python, essayez-le dès maintenant — la gratuité et l’intégration OpenTelemetry en font un remplaçant crédible des stacks fragmentées type LangSmith + dashboard maison. Si vous êtes hors AWS, retenez surtout la mécanique des 17 évaluateurs intégrés et des golden datasets : c’est le standard que vos outils devront égaler. Dans tous les cas, traitez la régression de prompt comme un incident de production, avec une métrique chiffrée — plus comme une impression.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Amazon Corretto 27 rend le TLS post-quantique et les en-têtes compacts disponibles par défaut

Le 17 septembre 2026, AWS a publié Corretto 27, sa distribution OpenJDK gratuite, avec l’échange de clés hybride post-quantique pour TLS 1.3 et les en-têtes d’objets compacts activés par défaut. Testez ces gains en environnement non critique, mais gardez vos charges LTS sur Java 21 ou 25 : cette version n’est supportée que jusqu’en avril 2027.

← Retour au fil

Tapez au moins deux caractères.

↑ ↓ naviguer ↵ ouvrir esc fermer