本文へスキップ
MameTechNews
バックエンド

AWS、エージェント品質をIDEから測るCloudWatch Omniを一般提供

## POINTS

  • レイテンシ監視に加え、プロンプト変更前後の評価スコアを必須の回帰指標にする必要がある
  • IDE拡張は無料なので、本番へ送る前に局所トレースで品質基準を先に決める必要がある
  • 既存のLangChainやVercel AI SDKを載せ替えずに計装できるかから確認する

AWSは2026年9月22日、Amazon CloudWatch Omniを一般提供した。アプリケーションとエージェントを同じ観測面に載せ、AWS管理コンソールとは別に、SSOで入る専用WebとIDE拡張で使う。拡張はVS CodeとKiro向けで無料。局所開発にAWSアカウントは不要で、BedrockやOpenAI、Anthropicの鍵だけで始められる。

エージェントは非決定的で、プロンプト変更が品質を落としても従来指標は沈黙しがちだ。Omniは各トレースを残し、一貫性、有用性、忠実性、ツール選択など17の組み込み評価器で採点する。Playgroundでシステムプロンプトを並べ、Experimentsでデータセット対する2構成を比較し、Prompt Managementで版を戻せる。

計装はOpenInferenceとADOTで、LangChain、LangGraph、CrewAI、OpenAI SDK、Strands、Vercel AI SDKなどを対象にする。本番監視へ送るCloud Loginは任意。まずは局所でトレースと評価データセットを作り、回帰が出てからCloudWatchへ送る段階導入が現実的だ。