本文へスキップ
MameTechNews
バックエンド

Amazon ECS、エージェント切断を検知しFargate等で自動復旧を開始

## POINTS

  • AGENT_CONNECTIVITYにより制御プレーン切断を標準イベントとして観測できるようになる
  • FargateとManaged Instancesはドレインから置換まで自動、EC2は自前連携が必要になる
  • 静かな障害の見逃しを減らせる一方で、置換ポリシーとアラート設計の更新が必要になる

AWSは、Amazon ECSがコンテナインスタンスのエージェント接続状態を継続監視し、障害時に自動復旧できるようになったと発表した。EBSボリューム劣化、ホストの熱事象、ネットワーク障害などでECSエージェントと制御プレーンの接続が切れるケースを想定している。

すべての計算オプション(AWS Fargate、Amazon ECS Managed Instances、Amazon ECS on EC2)で、新しいコンテナインスタンス健全性変更イベントAGENT_CONNECTIVITYが公開される。Managed InstancesとFargateでは、実行中タスクのドレイン、代替キャパシティ起動、障害インスタンスの登録解除まで自動実施する。EC2上のECSは、同イベントを使って独自の置換ワークフローを組む想定だ。

これまで「タスクは生きているように見えるが実は制御不能」な状態を人手で拾う必要があった運用に対し、検知と置換の標準化が進む。可用性要件の高いサービスでは、イベント購読とRunbookの更新が当面の作業になる。

商用およびGovCloud(US)全リージョンで追加料金なし。詳細はECSのコンテナインスタンスヘルス監視ドキュメントを参照する。