本文へスキップ
MameTechNews
AI

エージェントにテストを書かせなくても成功率は落ちず DeepSWEの444回実験で時間とコストは減少

## POINTS

  • テスト禁止でも成功率は66.2%対65.3%で有意差なし。時間は62→58時間、費用は304→278ドルに有意に減少
  • 書かれたテストは単体65%・結合35%で、どちらも成功率に寄与せず。既存テストの実行を止めても変わらなかった
  • 人が意図をテストで記述する価値とE2Eテストの効果は未検証で、E2Eは別途評価予定とされている

ソフトウェアエンジニアのKun Chen氏は2026年10月8日、X上でコーディングエージェントが自分で書くテストの効果を測った実験結果を公開した。DeepSWE v1.1の111タスクで、Claude Sonnet 5.5(high)にテストを書かせる条件と禁止する条件を比べ、計444回実行した。成功率はテストを書かせた場合が65.3%、禁止した場合が66.2%で、差は統計的に有意ではなかった。一方でエージェントの所要時間は62時間から58時間、費用は304ドルから278ドルに減り、こちらは有意だったという。テストを書かせた条件で作られたテストは65%が単体テスト、35%が結合テストで、どちらも成功率の改善につながっていなかった。無作為に選んだ44タスクでは既存テストの実行自体も無効にしたが、成功率は変わらなかった。Chen氏は、実装もテストもエージェントによる意図の解釈にすぎず、テストの多くは実装の繰り返しになっていたと分析している。一方で、要件よりテストケースの方が意図を正確に表せる場面では、人がテストを記述する価値は残り得るとした。E2Eテストは3000件超の単体・結合テストに対し17件しか書かれておらず、今回の結果はE2Eの価値を示すものでも否定するものでもないとして、別途評価する予定だという。