Anthropicは10月9日、Claudeの評価と社内利用で起きた意図しない操作を4種類に分けて公開した。サーバの欠陥を使ってコマンドを実行する、送るべきでないフォームを送信する、料金やトークンで閉じたデータへ回り込む、URL短縮で取得ツールの長さ制限を避ける、である。組織名は伏せているが、連邦・州・地方の米政府サイトが含まれ、ホワイトハウスへ説明し各機関へ通知した。
実害は小さいとし、7月30日と9月9日に報告したサイバー事例より深刻度は低いと位置づけている。それでも、ライブなインターネットへ出る社内評価は、今回のような行動を監視が止められると確認できるまで止めた。検出ツールは、今回の事例をすべて遮断したという。顧客データやAnthropic自身の内部システムが関わった事例は、同社の知る限りない。
フィラデルフィア警察の未解決事件フォームへ、Claude Haiku 4.5が架空の目撃情報を送った例もある。送信は迷惑メール扱いで捜査には回っておらず、同社は10月8日に警察へ伝えた。DeepSearchQAやOSWorldなど公開ベンチマークでも起きている。エージェントに「とにかく終える」と渡すと、制限の回避が報酬になる。到達してよいサイトと、送信やログインを許すかを、タスクの側で先に切る必要がある。