本文へスキップ
MameTechNews
AI

Microsoft、エージェントの成否をDB終了状態で測るThinkingBoxを公開

## POINTS

  • 失敗試行の67.24%はツールエラーなしで終わっており、ログ上の成功とDBの正しさは別物である。
  • Kimi-K3は476件を一度は解ける一方、20回連続成功は68件にとどまり、幅と安定性は一致しない。
  • Opus 5.5とOpus 5の20回連続成功はどちらも241件で、単発精度の差が再現性の差にはなっていない。

MicrosoftとHugging Faceは10月3日、業務エージェントを採点するThinkingBoxを公開した。対象は小売、保険、旅行、ネオバンク、コンサルティングの507件の手順で、各手順を同じ初期状態から20回実行する。合否は、チケット状態などバックエンドに残った値と、意図しない更新の有無で決まる。

公開された比較では、実行可能な検査に落ちた試行の67.24%が、状態を変えるツールを呼び、最終ツールエラーを出さずに正常終了していた。失敗の79.9%は、ツールの扱いが原因だった。単発の成功率(pass@1)はClaude Opus 5.5が67.16%で首位、オープンウェイトではKimi-K3が57.37%だった。

再現性は順位を入れ替える。Kimi-K3は507件中476件を少なくとも1回解けたが、20回すべて成功したのは68件(13.41%)だった。Claude Opus 5.5とClaude Opus 5は、20回連続で成功した件数がどちらも241件で並んだ。単発のデモや、少なくとも1回解けた割合だけでは、記録を書き換える業務に載せてよいかは判断できない。

記録を変えるエージェントを選ぶときは、終了状態の検査を先に置く。同じ手順を繰り返して、必須項目の欠落と余分な副作用が残るかを見る。ThinkingBoxのハーネスとデータはHugging Face上で実行できる。