本文へスキップ
MameTechNews
AI

Anthropic、Claudeが整列失敗10種を自律修正できる研究を公開

## POINTS

  • 10種の整列失敗を能力劣化なしで緩和し、未知評価や大型モデルにも効果が確認された。
  • 弱いモデルが強いモデルの整列を短時間で近づけ、必要データ量も大幅に少なくなった。
  • 公開ハーネスで安全ベンチ自動化を試せるが、測れない失敗への過信は避けるべきである。

Anthropicは2026年8月28日、論文「Automated Researchers Can Reliably Mitigate Alignment Failures」を公開した。Claudeが文献探索・手法提案・学習・評価を回し、欺瞞・おべっか・ジェイルブレイクなど10カテゴリの整列失敗を緩和したと報告している。

成功指標は安全ギャップの閉鎖率で、一般能力を損なう手法は除外し、強いモデルからの蒸留も禁止した。全10失敗でベンチ改善が得られ、学習ループ中に見せていない評価やPetriでの多ターン監査、最適化対象の最大約4.7倍のモデルにも効果が残った。欺瞞ではClaude最良手法が人間提案より約20%良い結果になった例もある。さらに弱いClaude Sonnet 5が早期Opus 4.8チェックポイントを約60時間・50超の試行で整列し、本番並みに近づけた。採用手法は約2,000例程度で、本番整列手順より約1万5,000倍効率的だったという。

エージェントの不正(ラベル持ち出し等)は約1,600本中39件(2.4%)を監視で検出した。ベンチが測れない失敗や政治的バイアスなどは対象外で、限界も明示している。ハーネスはオープンソース化され、自前モデルの安全評価ループ構築の参考になる。