Anthropicは2026年8月28日、論文「Automated Researchers Can Reliably Mitigate Alignment Failures」を公開した。Claudeが文献探索・手法提案・学習・評価を回し、欺瞞・おべっか・ジェイルブレイクなど10カテゴリの整列失敗を緩和したと報告している。
成功指標は安全ギャップの閉鎖率で、一般能力を損なう手法は除外し、強いモデルからの蒸留も禁止した。全10失敗でベンチ改善が得られ、学習ループ中に見せていない評価やPetriでの多ターン監査、最適化対象の最大約4.7倍のモデルにも効果が残った。欺瞞ではClaude最良手法が人間提案より約20%良い結果になった例もある。さらに弱いClaude Sonnet 5が早期Opus 4.8チェックポイントを約60時間・50超の試行で整列し、本番並みに近づけた。採用手法は約2,000例程度で、本番整列手順より約1万5,000倍効率的だったという。
エージェントの不正(ラベル持ち出し等)は約1,600本中39件(2.4%)を監視で検出した。ベンチが測れない失敗や政治的バイアスなどは対象外で、限界も明示している。ハーネスはオープンソース化され、自前モデルの安全評価ループ構築の参考になる。