本文へスキップ
MameTechNews
AI

NVIDIA、LAN内の複数PCへ推論を振り分けるPAIRベータを公開

## POINTS

  • Ollama/LM Studioの既存ポートをプロキシする。ハーネス改修なしで試せるが、要求モデルがそのノードに無いと割り当てられない
  • 1要求は1ノード完結。VRAM合算やモデル分割はしない。並列サブエージェントが多い作業向き
  • 通信はペアリング後にmTLS。家庭・社内LAN前提であり、信頼できないネットワークへ広げない

NVIDIAは9月3日、ローカルネットワーク上の対応PCへ独立した推論要求を振り分けるPersonal AI Router(PAIR)のベータを発表した。無料のオープンソースで、Windows/macOS/LinuxのGUIと端末から使える。対応はGeForce RTX 20シリーズ以降、Turing以降のRTX PRO、DGX Spark、Apple M4以降。

PAIRは新しい推論エンジンではない。OllamaまたはLM Studioが各ノードでモデルを実行し、PAIRはmDNS発見、相互TLSによるペアリング、モデル有無とGPU使用率を見ながら1要求を1ノードへ割り当てる。エージェントは従来のローカルエンドポイントを向ければよく、ハーネス変更は不要とされる。1リクエストを複数GPUで分割したり、VRAMを合算したりはしない。

公式のデモでは、Qwen 3.6 35B A3Bを使い、Hermesの5サブエージェント作業が単一RTX Sparkノートで平均18分、3台クラスタで平均8分48秒だった。非公式かつ構成依存で、線形スケールの約束ではない。複数エージェントをローカルで回す開発者は、遊休機の活用と主機の占有回避を実測で判断できる段階に入った。