AWS CloudWatch Omni s'attaque à la question la plus difficile de l'IA agentique : pourquoi l'agent a-t-il fait cela ?

Depuis des décennies, l’industrie de l’observabilité répond à une question fondamentale : est-elle opérationnelle ? L’intelligence artificielle agentique brise ce modèle. Un agent peut renvoyer une réponse claire, atteindre son objectif de latence et ne générer aucune erreur, tout en donnant une mauvaise réponse à un client, en appelant le mauvais outil ou en exploitant une base de connaissances obsolète.

Selon toutes les mesures traditionnelles, le système est sain, mais la seule mesure qui compte pour l’entreprise est son échec. C'est l'écart Amazon Web Services Inc. cible avec Amazon CloudWatch Omni (photo), qui est devenu généralement disponible la semaine dernière. AWS positionne Omni comme la prochaine génération de CloudWatch.

Il est centré sur les applications, s'exécute en dehors d'AWS Management Console, repose sur OpenTelemetry et intègre l'IA. Cela déplace l'observabilité de « Est-ce qu'il fonctionne ? » à « Pourquoi mon agent a-t-il fait ça? » Je dirais que c’est la question qui se pose entre la plupart des entreprises et l’IA agentique à l’échelle de la production. AWS cite une prévision d'IDC selon laquelle plus d'un milliard d'agents seront déployés d'ici 2029. Aucune équipe opérationnelle ne peut examiner manuellement un comportement aussi non déterministe.

Voici cinq considérations à l’intention des responsables des technologies de l’information et des entreprises :

L'évaluation est le nouveau suivi

La partie la plus importante d'Omni ne sont pas les tableaux de bord ; c'est le moteur d'évaluation. Omni capture chaque trace et est livré avec 17 évaluateurs intégrés qui évaluent la cohérence, l'utilité, la fidélité et l'exactitude du routage, entre autres mesures. Les équipes peuvent comparer les versions d'invite dans un terrain de jeu, créer des ensembles de données de test à partir du trafic de production et détecter automatiquement les régressions. Les évaluateurs peuvent également fonctionner en continu sur le trafic en direct, de sorte que la dérive de la qualité est signalée de la même manière qu'un pic de CPU le serait. La latence et les taux d'erreur ne peuvent pas vous dire si une réponse était bonne, mais la notation le peut.

Sony est l'un des premiers à l'adopter. « Chez Sony, notre plateforme d'IA agentique à l'échelle de l'entreprise prend désormais en charge des centaines de charges de travail de validation de principe et de production », a déclaré Masahiro Oba, directeur général senior de la division AI Acceleration chez Sony. « A cette échelle, l'observabilité et l'évaluation sont essentielles. Avec Amazon CloudWatch Omni, je peux passer directement d'une trace unique à l'évaluation, à l'analyse par l'IA, à la comparaison ou à la création d'un ensemble de données. »

Le mot clé dans cette déclaration est « centaines ». La plupart des entreprises avec lesquelles je parle ne se contentent pas de créer un seul agent. Ils sont obligés de gouverner des dizaines ou des centaines, chacune construite par une équipe différente avec une idée différente de ce à quoi ressemble le « bien ». Oba a également noté que l'assemblage d'ensembles de données d'évaluation constitue souvent un goulot d'étranglement du côté commercial, et que la création d'ensembles de données en un clic à partir de traces en direct supprime ce goulot d'étranglement.

Sortir de la console est une affaire plus importante qu'il n'y paraît

Les développeurs bénéficient d'une extension native pour Visual Studio Code, Cursor et Kiro, où les traces apparaissent lorsqu'ils exécutent un agent localement, sans qu'aucun compte AWS ne soit requis. Les opérateurs bénéficient d'une expérience Web autonome avec une authentification unique via des fournisseurs d'identité existants tels qu'Okta et Microsoft Entra ID. Les deux partagent une seule couche de données, de sorte que la trace qu'un développeur débogue est la même que celle qu'un opérateur étudie.

AWS reconnaît que sa console est conçue pour les administrateurs d'infrastructure, et non pour les ingénieurs en fiabilité des sites, les ingénieurs en IA et les propriétaires d'applications qui assument désormais la responsabilité opérationnelle. Rencontrer les développeurs dans l'environnement de développement intégré, où les assistants de codage IA tels que Claude Code et Codex peuvent configurer l'instrumentation, déplace la qualité du travail vers le point où les problèmes sont les moins chers à résoudre.

La couche de données unifiée est le véritable différenciateur

De nombreuses startups peuvent tracer des appels de modèles de langage volumineux. Ce qui est intéressant avec Omni, c'est que les traces d'agent, la télémétrie des applications et les signaux d'infrastructure résident tous dans le même magasin de données CloudWatch. En conséquence, une enquête peut commencer avec un agent recevant un résultat d'outil incorrect, passer à une erreur d'interface de programmation d'application à partir d'un service à capacité limitée et se terminer avec un pool de connexions à la base de données épuisé.

Aujourd'hui, dans la plupart des magasins, cela représente trois outils, trois équipes et de nombreuses réunions pour relier les points. AWS DevOps Agent est activé par défaut dans les sessions d'investigation, corrélant les signaux et conservant un historique d'investigation complet.

Capital One était un partenaire de conception. « Capital One exploite l'une des plus grandes empreintes d'observabilité dans le secteur des services financiers », a déclaré Parvez Naqvi, vice-président directeur de la plate-forme cloud et de l'ingénierie de la résilience chez Capital One. « En tant que partenaire de conception d'Amazon CloudWatch Omni, nous avons contribué à façonner une solution d'observabilité unique basée sur l'IA qui fournira à nos ingénieurs une intelligence basée sur la topologie et des requêtes en langage naturel sur toute la télémétrie à partir d'une seule surface, avec la pleine propriété des données via OpenTelemetry.

Pour les secteurs fortement réglementés, tels que le secteur bancaire, la portabilité des données est essentielle au succès, ce qui nécessite la propriété des données. L’historique des enquêtes capturé est également sous-estimé, car dans les secteurs réglementés, il s’agit d’une preuve d’audit de la façon dont un incident d’IA a été traité.

Les normes ouvertes abaissent la barre de verrouillage mais ne l’éliminent pas

L'instrumentation s'exécute sur OpenInference et AWS Distro pour OpenTelemetry, que les agents s'exécutent sur AWS ou dans d'autres cloud. Omni prend en charge LangChain, LangGraph, CrewAI, le SDK OpenAI Agents, Strands et le SDK Vercel AI, ainsi que des évaluateurs tiers tels que DeepEval. Les agents Amazon Bedrock AgentCore reçoivent automatiquement Omni. L’ingestion Azure est prise en charge aujourd’hui, avec une couverture multicloud plus approfondie à venir.

Cette ouverture est nécessaire dans un domaine encombré. Datadog, Dynatrace, New Relic, Grafana Labs et Splunk se développent tous dans l'observabilité des agents, tout comme les grands outils axés sur les modèles de langage tels que LangSmith et Arize AI.

OpenTelemetry rend les données portables, mais pas la couche d'intelligence. La topologie, les évaluateurs, l'historique des enquêtes et l'agent DevOps fonctionnent tous sur AWS. Les entreprises déjà fortement investies dans AWS considéreront Omni comme la valeur par défaut naturelle. Ceux qui exploitent des domaines Datadog ou Splunk matures sur plusieurs cloud l'utiliseront probablement pour le développement et l'évaluation d'agents, tout en conservant leur système d'observabilité là où il se trouve.

La tarification est conçue pour l'adoption, alors surveillez la facture de télémétrie

L'extension IDE est gratuite. Les clients paient pour la télémétrie qu'ils envoient et stockent. Les tableaux de bord et les alertes sont gratuits et des requêtes jusqu'à cinq fois le volume d'ingestion mensuel sont incluses. Les comptes éligibles reçoivent un essai de 30 jours et 1 000 $ en crédits d'ingestion OpenTelemetry.

Le problème, c'est que les agents sont bavards. Chaque invite, appel de modèle, appel d'outil et transfert de sous-agent génère un span. Multipliez cela par des centaines de charges de travail et d’évaluation continue, et les coûts d’ingestion peuvent dépasser le budget d’IA qui les a créés. DevOps Agent est également facturé séparément.

Ce que cela signifie pour les acheteurs

Omni est une plateforme complète d'observabilité des agents qui comble le manque de confiance qui maintient les agents en mode pilote. Les responsables informatiques doivent :

  • Définissez « bon » avant d’acheter l’évaluateur. La notation intégrée n'est utile que si les propriétaires de votre entreprise ont documenté à quoi ressemble une réponse correcte, conforme et utile pour chaque agent. La plupart ne l’ont pas fait.
  • Standardisez l’instrumentation dès maintenant. Mettez chaque pilote d'agent sur OpenTelemetry, quel que soit le backend. Cela maintient vos options ouvertes et facilite grandement les décisions futures en matière de plate-forme.
  • Modélisez les coûts de télémétrie à l’échelle de la production. Définissez des politiques d'échantillonnage, de rétention et de fréquence d'évaluation avant la mise en service des agents, et non après l'arrivée de la première facture.
  • Décidez où réside votre système d’enregistrement. Si AWS est votre cloud principal, Omni est un choix par défaut solide. Si vous êtes multicloud avec une plate-forme d'observabilité établie, envisagez Omni pour le développement et l'évaluation, et intégrez-la plutôt que de remplacer votre configuration existante.
  • Traitez l’historique des enquêtes dans le cadre de la gouvernance. Intégrez la piste d'enquête capturée par Omni dans les processus de risque et de conformité de l'IA, en particulier dans les secteurs réglementés.

L'industrie a passé une décennie à apprendre à observer les systèmes distribués. L'IA agentique nécessite d'observer les décisions, pas seulement les systèmes, et AWS vise à posséder cette couche pour ses clients. Les entreprises qui en tireront le meilleur parti seront celles qui considéreront l’évaluation comme une discipline opérationnelle et non comme une fonctionnalité à activer.

Zeus Kerravala est analyste principal chez ZK Research, une division de Kerravala Consulting. Il a écrit cet article pour SiliconANGLE.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine