何が起きたか
Embrace The RedのJohann Rehberger氏は、Claude Code(Opus 5)のAuto Modeに対し、ウェブサイト要約を依頼するだけで攻撃者制御のコード実行に至る連鎖を実証した。中旬以降デフォルトとなったAuto Modeは、操作ごとに人の承認を求める代わりに安全分類器で可否を判断する。
攻撃はWebFetch失敗(HTTP 415)を契機にcurlへ誘導し、ZIP内のノート記録を復号させる。モデルは同梱バイナリを拒否して自前のPythonデコーダを書くが、展開先でstruct.pyが標準ライブラリをシャドウし、base64 import時に悪意あるコードが走る。バリエーションではclaude -pで子エージェントを起動し、偵察やワークスペース外への書き込みも確認された。
背景
Anthropic関連で示された第三者評価では、固定72シナリオで間接プロンプトインジェクション成功率が0.00%と報告されていた。今回の連鎖はそのセット外の多段攻撃で、ベンチマーク数値と実攻撃耐性が一致しない例となった。報告はInformative扱いとなり、「設計どおりの挙動」とされた。
実務への影響
Auto Modeの承認は安全性の証明ではない。分類器は個別に無害に見える手順の組み合わせを止め切れず、感染後のプロセス終了まで拒否するケースもあった。未信頼コンテンツを扱うエージェントはコンテナ/VMで隔離し、egress制限と監視を前提にすべきだ。