Amazon Web Servicesは2026年9月24日、Amazon SageMaker HyperPod Inference Gatewayを発表した。既存のHyperPod上にEKSマネージドアドオンとして入れ、アプリケーション変更なしで推論リクエストを振り分ける。
従来のラウンドロビンは、KVキャッシュの飽和や長い生成の途中を見ない。GatewayはHTTPSを終端するEnvoy、リクエスト本文のmodel名でプールを選ぶBody-Based Router、各ポッドを6指標で採点するEndpoint Pickerで構成される。指標はKVキャッシュ使用率、キュー長、LoRAアダプタの常駐、プレフィックスキャッシュ命中率、予測レイテンシ、実行中リクエスト数。vLLMやSGLangなどOpenAI互換のモデルサーバに対応する。
AWSは混合GPUやバースト条件下で、初回トークン遅延を最大82%、p99のTTFTを97〜98%減らしたと説明する。複数モデルを1エンドポイントで出す構成や、アダプタの載せ替え待ちを減らしたいクラスタが対象になる。クロスクラスタ・クロスリージョンのルーティングは今後の予定で、まずは単一クラスタの偏在解消から検証するのが現実的だ。