本文へスキップ
MameTechNews
AI

AWS、GPU負荷で推論を振り分けるHyperPod Inference Gatewayを公開

## POINTS

  • EKSマネージドアドオン1つで導入でき、クライアントやモデルサーバ側の改修は不要
  • 混合GPUやバーストでは、初回トークン遅延を最大82%削減したとAWSは説明する
  • 複数モデルの単一エンドポイント化とLoRA常駐を前提に、ルーティング指標を設計する

Amazon Web Servicesは2026年9月24日、Amazon SageMaker HyperPod Inference Gatewayを発表した。既存のHyperPod上にEKSマネージドアドオンとして入れ、アプリケーション変更なしで推論リクエストを振り分ける。

従来のラウンドロビンは、KVキャッシュの飽和や長い生成の途中を見ない。GatewayはHTTPSを終端するEnvoy、リクエスト本文のmodel名でプールを選ぶBody-Based Router、各ポッドを6指標で採点するEndpoint Pickerで構成される。指標はKVキャッシュ使用率、キュー長、LoRAアダプタの常駐、プレフィックスキャッシュ命中率、予測レイテンシ、実行中リクエスト数。vLLMやSGLangなどOpenAI互換のモデルサーバに対応する。

AWSは混合GPUやバースト条件下で、初回トークン遅延を最大82%、p99のTTFTを97〜98%減らしたと説明する。複数モデルを1エンドポイントで出す構成や、アダプタの載せ替え待ちを減らしたいクラスタが対象になる。クロスクラスタ・クロスリージョンのルーティングは今後の予定で、まずは単一クラスタの偏在解消から検証するのが現実的だ。