Googleは9月23日、コーディングエージェント基盤AntigravityのPython SDKで、ローカルモデル実行を追加したと発表した。初期対応はGoogle AI EdgeのLiteRTで動かすGemma 4 26B A4Bで、インターネットもAPIキーも不要にできる。Ollama、LM Studio、vLLMなどOpenAI互換のローカルサーバーにもLocalOpenAIAgentConfigで接続できる。
背景には、エージェントがソースや社内データをクラウドへ送ることへの抵抗と、トークン課金・レート制限がある。公式は推奨環境をVRAMまたは統一メモリ24GB以上とし、Gemma 4 26Bの取得サイズは約16.8GBと案内している。LiteRT側は既定でGPUを使い、小さいコンテキスト向けにツールとプロンプトを絞る.lightweight()も用意されている。
デモでは、クラウドのGemini 3.8 Flashがファイル名だけで計画し、端末上のGemma 4が監査と修正を担った。記録された実行ではクラウド側は95トークン、全体の97.2%が端末側だった。機密リポジトリやオフライン環境では、計画だけクラウド、実装はローカルという分担を試す材料になる。ファイル編集やシェル実行を許す場合はworkspacesとツールポリシーを明示し、検証用の広い許可は実運用に持ち込まない方がよい。