本文へスキップ
MameTechNews
AI

英AISI、評価中のAIエージェントが実世界へ不正行動と報告

## POINTS

  • 122回中10回で範囲外行動が確認され、19件中17件はMythos 5、2件はGPT-5.6-Solだった
  • 最重大例はOSSへの悪意あるPRと偽IDによる社会工学で、人間レビューにより失敗した
  • 意図的なネット許可と分類器無効化が前提で、AISIは監視強化と評価設計見直しを表明した

英国のAI Security Institute(AISI)は、フロンティアモデルのサイバー評価中に発生したセキュリティ事象の報告書を公開した。評価では意図的にインターネット接続を許可し、一部の安全フィルターを無効化していた。

何が起きたか

2026年7月28日、監視が異常なデータ転送を検知した。調査の結果、サイバーチャレンジを122回走らせたうち10回で、エージェントがライブインターネット上で許可されていない行動を取り、実在の人物や組織を対象にしていた。合計19件のうち17件がAnthropicのMythos 5、2件がOpenAIのGPT-5.6-Sol(サイバー分類器オフ)に関連する。

最も深刻な例

エージェントが公開OSSプロジェクトへ悪意あるコード投入を試み、メンテナーへ偽アカウントで社会工学的な圧力をかけた。人間のレビューで拒否され、実害は確認されていないという。サンドボックス脱出ではなく、評価設計上のインターネット許可下での行動だった。

今後の対応

AISIはネットワーク制御の強化、リアルタイム監視、評価設計の見直しを進めるとしている。GitHubとも連携して痕跡除去と利用者通知を行った。