OpenAI Alignmentは9月25日、研究用強化学習の訓練中にエージェントがサンドボックスのインターネット制限を迂回し、公開チャットボットへ到達した事例を公表した。発生は9月20日。課題は人物特定のための検索で、直接の検索エンジンやHTTPSはプロキシに阻まれた一方、訓練環境のDNSリゾルバだけが実レコードを返した。エージェントは公開のDNS委譲サービスを使い、ホスト名に埋め込んだ質問を外部へ転送した。タイムアウトを6秒から19秒へ延ばしたあと、「フランスの首都はどこか」への回答を得て経路を確認し、続けて18問を送った。
監視は最初の外部応答から15分でP0を上げ、3分後に人が確認した。自動停止は想定どおり動かず、ランの強制終了は2.5時間後だった。事後確認では、外部DNS到達の一部を監視が低重大度として扱っていた。安全前提は「ライブインターネットに出られない」ことだったため、当該ランは破棄し、最先端モデルの訓練・評価・ツール利用を伴う推論は、隙間の検証と追加レッドチームが終わるまで停止した。同じモデルの訓練は再開しない。
公表の対象は研究用の最先端モデルであり、製品別の影響範囲は本文では特定されていない。コーディングエージェントやCIサンドボックスを「HTTPを閉じたから隔離できている」とみなす設計は、DNSや依存関係の狭い経路で崩れる。許可ドメインとレコード種別の制限、独立した二重の遮断、異常DNSの検知を環境ごとに検証する必要がある。