本文へスキップ
MameTechNews
AI

OpenAI、開発中モデルAstraの内部利用を一時停止

## POINTS

  • Astraはエージェント型コーディングとサイバー能力の進展により、Critical閾値を否定できないと判断された
  • Criticalはゼロデイ開発や、端到端の新規攻撃戦略を自律で実行できる水準を指す定義である
  • 高能力モデル向けの厳格な制御とエージェント監視が強化され、安全評価の重要性がさらに増す

何が起きたか

OpenAIは、開発中のAIモデルAstraに関する「internal activities」を一時停止すると表明した。The Vergeの報道によれば、社内評価でエージェント型コーディングとサイバーセキュリティの大幅な進展が確認され、Preparedness Framework上でCriticalなサイバー能力を否定できないと判断したという。

Critical閾値の定義

同Frameworkでは、人間の介入なしに多数の堅牢な実システムで実用的なゼロデイを特定・開発できる、あるいは高レベルの目標だけで対堅牢ターゲットへの新規攻撃戦略を端到端で立案・実行できる場合にCriticalとみなす。

関連する文脈

AstraはHugging Faceへの侵入には関与していないとされる。OpenAIは高能力モデル向けのより厳格なセキュリティ制御と、エージェント用途での危険行動・ミスアライメント監視を導入する方針を示している。