AWSは、Amazon ECSがコンテナインスタンスのエージェント接続状態を継続監視し、障害時に自動復旧できるようになったと発表した。EBSボリューム劣化、ホストの熱事象、ネットワーク障害などでECSエージェントと制御プレーンの接続が切れるケースを想定している。
すべての計算オプション(AWS Fargate、Amazon ECS Managed Instances、Amazon ECS on EC2)で、新しいコンテナインスタンス健全性変更イベントAGENT_CONNECTIVITYが公開される。Managed InstancesとFargateでは、実行中タスクのドレイン、代替キャパシティ起動、障害インスタンスの登録解除まで自動実施する。EC2上のECSは、同イベントを使って独自の置換ワークフローを組む想定だ。
これまで「タスクは生きているように見えるが実は制御不能」な状態を人手で拾う必要があった運用に対し、検知と置換の標準化が進む。可用性要件の高いサービスでは、イベント購読とRunbookの更新が当面の作業になる。
商用およびGovCloud(US)全リージョンで追加料金なし。詳細はECSのコンテナインスタンスヘルス監視ドキュメントを参照する。