本文へスキップ
MameTechNews
AI

llama.cpp、選択肢を1回の推論で確率付き返す決定モデルに対応

## POINTS

  • choice、score、noulの3型があり、1回の前向き計算で選択肢ごとの確率を返す。
  • RTX PRO 6000ではJulia-1が3ミリ秒、Kev-4Bが12ミリ秒、OpenJevが43ミリ秒だった。
  • 確信度はモデルで大きく違い、OpenJevは画像と日本語に対応するが非商用ライセンスである。

llama.cppのサーバーが10月2日、決定モデルを /v1/systemone で扱えるようになった。利用者が状態(テキスト、JSON、スクリーンショット)と型付きの質問を送ると、モデルは自由文の生成を省き、用意した選択肢ごとの確率を1回の前向き計算で返す。APIはTypeSafeのJevが導入したSystem One形式に沿っており、既存クライアントは接続先の変更が中心になる。

質問は3種類ある。choiceは選択肢と任意の説明から最有力と確率を返し、scoreは2〜10段階の期待値、noulは yes の確率を返す。公開された例では出力トークン数は0だった。NVIDIA RTX PRO 6000での質問1件の中央値は、144MのJulia-1が3ミリ秒、4BのKev-4Bが12ミリ秒、27BのOpenJevが43ミリ秒である。画像を読めるOpenJevは日本語を含む複数言語に対応するが、ライセンスはCC BY-NC 4.0だ。Apache 2.0のClefも載るが、言語は英語で、同表に速度は記載されていない。

閉じた選択肢への振り分け、内容の判定、エージェントの1手順が期待どおり終わったかの確認に向く。選択肢の説明を省くと、小さいモデルは請求の問い合わせを配送へ誤って振ることがあった。同じ曖昧な依頼でも、Julia-1の確信度は0.25、Kev-4Bは0.80と差がある。しきい値はモデルごとに実データで決める。複数の質問は独立に答えられ、一部モデルは状態の処理を1回にまとめられる。