DeepSeekはDeepSeek-V4-Flash-Vision-ExpをHugging Faceで公開した。V4-Flash系に視覚モジュールを足した実験版で、パラメータ規模は約305B、ライセンスはMIT。トークナイザ、プロンプト符号化、最小PyTorch推論実装、safetensorsのシャード定義が含まれる。
ベンチマークと提供形態
公式モデルカードでは、ApexBench Pass@1が36.5(テキストのみのV4-Flash-0731は26.2)、Agents' Last Examが27.3、Terminal Bench 2.1が83.9などと報告している。テキスト系エージェント指標は前世代と同程度を維持しつつ、マルチモーダル側を伸ばした位置づけだ。READMEには4×GPU想定のvLLM起動例と、SGLangでDSparkを使うサービング例が載っている。
API公開(8月21日)から約10日後の重み公開であり、画像入力をホストAPIに依存せず再現したい研究・推論事業者向けの一手となる。一方で実験扱いであり、本番向けの並列推論やメモリ最適化、セキュリティ統制は利用側の実装が前提になる。
実務への影響
オンプレやVPCで画像とツール呼び出しを組み合わせたエージェントを試すチームは、ハーネスと量子化経路の検証を始められる。個人開発者はVRAM要件が大きく、当面はAPI併用が現実的だ。依存ライブラリやサービングレシピの追随状況も合わせて確認したい。