Cognitionが新モデルSWE-2を発表した。FrontierCode 1.1 Mainで50.0%、DeepSWE v1.1で73.0%、Terminal-Bench 2.1で92.8%など、最先端モデル並みの指標をコスト約70%減で出したとされる。RLを大規模に拡張し、Kimi K3基盤からの後学習成果として、Devinのデスクトップ・CLI・クラウドプレビューへ搭載。Normal/Maxや努力レベルの選択も可能。日本ユーザーからは速さへの即反応が相次ぎ、Devin Pro向けの期間限定無料提供も語られている。
エンジニア視点:
- コーディングエージェントのコスト性能比が再び動き、既存のClaude/Codex系との比較軸が増えた
- Devinエコシステム内での標準モデル更新として、実務での試用価値が高い
- ベンチ指標は要一次確認。導入判断は自社ワークロードでの再現性が鍵