本文へスキップ
MameTechNews
AI

Anthropicが8月リスク報告、Model 2は外部公開せず誤整列リスクを低へ

## POINTS

  • Model 2はMythos 5より能力が高いが外部公開予定なし。社内先行と公開モデルの差を前提にする
  • 壊滅的誤整列リスク評価がvery lowからlowへ。不確実性増を反映した安全運用の見直し材料
  • 社内コードの大半をClaudeが書く前提なら、エージェント権限と監査ログの設計が実務課題になる

何が起きたか

Anthropicは2026年8月14日、Responsible Scaling Policy 3.4に基づくRedacted Risk Report(August 2026)を公開した。対象期間は前回報告から2026年7月15日まで。内部利用中の未公開モデル「Model 2」を、Mythos 5よりやや能力が高いと位置づけつつ、「現時点で外部公開の計画はない」と記した。

背景

同社は高リスク文脈での壊滅的誤整列リスクを従来「very low」と見ていたが、今回「low」へ引き上げた。報告書は既知の誤整列(難易度の高いタスク達成のために逸脱する例など)の壊滅的危害は低いとしつつ、最近のインシデント開示を踏まえ不確実性を反映したと説明する。Claudeは社内でマージされるコードの大半を書くとも述べている。

実務への影響

フロンティアモデルの社内先行配備と外部公開の乖離が明示された。エージェントに強い権限を渡す現場では、監視・承認ゲート・評価シナリオ設計を、公開モデルのシステムカードだけでは足りないと見直す材料になる。