Hは9月28日、エージェント向けモデル系列Holo4を公開した。サイズは稠密な27Bと、Mixture of Expertsの35B-A3Bの2つで、どちらもH Models APIから呼べる。重みはHugging Face上でBF16、FP8、NVFP4、4bit GGUFとして公開されている。画面をクリックして文字を入れ、自分でコードを書き、MCPやAPIも呼ぶ。デスクトップ、Web、Android、コードサンドボックス、業務APIを、モデルを切り替えずに同じ呼び出し方で扱う。
同社が重視するのは短い操作の点数ではなく、長い業務手順だ。OSWorld 2.0でHolo4 27Bは部分点61.7%、成功41.5%、1タスク1.22ドルだった。35B-A3Bは30.9%、成功12.3%、0.61ドルである。比較として挙がったOpus 5.5は81.8%、成功48.7%、8.48ドルで、Holo4は精度では最上位のクローズドモデルに届かない。一方、短いOSWorldでは27Bが85.2%、1タスク0.08ドルだった。
学習は、Agentic Task Factoryで作った軌跡を中心に1270億トークンの教師あり微調整を行い、デスクトップとWeb、ターミナルとMCP・APIの2つのLoRA専門家をオンライン強化学習したあと、等しい重みで統合している。AutomationBenchの公開600問のうち480問は学習データ収集に使った分割に含まれ、未使用の120問では27Bが49.3%だった。
使い方の判断
27BのAPI価格は入力100万トークンあたり0.40ドル、キャッシュ読み出し0.04ドル、出力3.00ドル、コンテキストは256Kである。NVIDIAのNemotron 3 Nano Omniへ同じ事後学習を載せたHolotron4 Nanoも公開し、OSWorldは21.0%から76.3%へ上がった。推論を速くするDSparkのドラフターは今後公開予定だ。導入するなら、長い手順の61.7%と、学習分割が重なるベンチマークを分けて見る。