NVIDIAは9月3日、ローカルネットワーク上の対応PCへ独立した推論要求を振り分けるPersonal AI Router(PAIR)のベータを発表した。無料のオープンソースで、Windows/macOS/LinuxのGUIと端末から使える。対応はGeForce RTX 20シリーズ以降、Turing以降のRTX PRO、DGX Spark、Apple M4以降。
PAIRは新しい推論エンジンではない。OllamaまたはLM Studioが各ノードでモデルを実行し、PAIRはmDNS発見、相互TLSによるペアリング、モデル有無とGPU使用率を見ながら1要求を1ノードへ割り当てる。エージェントは従来のローカルエンドポイントを向ければよく、ハーネス変更は不要とされる。1リクエストを複数GPUで分割したり、VRAMを合算したりはしない。
公式のデモでは、Qwen 3.6 35B A3Bを使い、Hermesの5サブエージェント作業が単一RTX Sparkノートで平均18分、3台クラスタで平均8分48秒だった。非公式かつ構成依存で、線形スケールの約束ではない。複数エージェントをローカルで回す開発者は、遊休機の活用と主機の占有回避を実測で判断できる段階に入った。