DeepSeek、V4-Flash-Vision-ExpをAPI公開 画像対応エージェント向け
DeepSeekが実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをAPIで公開した。テキスト性能はV4-Flash同等を維持しつつ、マルチモーダルエージェント指標ではOpus-4.8に接近すると説明。画像は最大384トークン換算でV4-Flash料金が適用され、スクリーンショット連携のエージェント構築が単一モデルでしやすくなる。
$ filter --category=ai
AI・機械学習・LLMの最新ニュースを、実装と運用の観点で要約とポイント付きでお届けします。
DeepSeekが実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをAPIで公開した。テキスト性能はV4-Flash同等を維持しつつ、マルチモーダルエージェント指標ではOpus-4.8に接近すると説明。画像は最大384トークン換算でV4-Flash料金が適用され、スクリーンショット連携のエージェント構築が単一モデルでしやすくなる。
JetBrainsのDeveloper Ecosystem Survey 2026によると、プロ開発者の90%がAIコーディングエージェントを週1回以上使い、68%が毎日利用している。Claude Codeの職場利用率は39%でGitHub Copilotの21%を上回り、補完型からエージェント型へのシフトが数字で裏付けられた。
AnthropicはClaude Platform向けPython SDKのv1.0を公開し、HTTP層をhttpxからhttpx2へ移した。Python 3.10以上が必須で、Text CompletionsやMessagesのtemperatureなどが削除されるため、既存クライアントの移行確認が必要になる。APM連携の見直しも忘れてはならない。
OpenAIは旗艦モデルGPT-5.6 SolのAPI価格を、入力100万トークンあたり4ドル、出力20ドルへ引き下げた。少なくとも2026年11月21日まで続くプロモ価格で、CodexクレジットやChatGPT Workの対象プランにも反映される一方、Proなどの定額枠は変更されない。コスト試算の見直しが急務になる。
OpenAIはCodex App/CLI/IDEの裏にあるオープンソースharnessを、自社製品へエージェントを組み込む基盤として位置づけ直した。codex exec、SDK、app-serverの三層を示し、汎用チャットUIに寄せず既存の業務画面へエージェントループを埋め込む設計を強く促している。
AnthropicはClaude Enterprise向けClaude Securityの脆弱性スキャンにClaude Mythos 5を投入し、公開βとして提供を始めた。直接プロンプトせず検知結果と修正案だけ返す形で、攻撃転用リスクを抑えつつ最上位モデルの防御能力を実務のコード監査へ届ける方針だ。
AnthropicはComputer Use、Skills API、Files APIをClaude Platformで正式提供し、Web向けにBrowser Useツールを追加した。エージェントが画面操作とページ構造の両方で業務アプリを扱えるようになり、API未公開の社内ポータル自動化の実装選択肢が広がる。
GoogleはAntigravityのIDE拡張を発表し、VS Code・Visual Studio・JetBrains・Zed上でエージェント作業が可能になった。専用デスクトップに移さず既存エディタで差分確認や複数ステップ委任ができ、Gemini Enterpriseでは利用枠と監査を一元管理できる。
SalesforceはSlack Codeを発表し、ClaudeやDevin、Copilotなどと連携する専用コードチャンネルを全プランで提供開始した。エージェント作業をチーム可視の場へ移し、差分確認と承認を同じ会話面で完結できる点が実務的に大きく、開発連携とレビュー文化を変える可能性がある更新だ。
Cursorは2026年8月19日の更新で、Cloud Agent向けにイベント購読のSubscriptionsと長期目標を保持する/goalを追加した。PRやSlackの反応を起点にエージェントが自律継続でき、CI修復などの反復作業を常時稼働の開発ワークフローへ寄せる現実味が増している。権限設計とあわせて試す価値がある。
Cursorは有料プラン向けにコードホスティングOriginの早期β展開を開始した。リポジトリ・PR・エージェントを同一画面に置き、GitHub同期も提供する。エージェント前提の開発では、既存のGitHub運用を残しつつForge選定と権限・監査設計を見直す材料になる。まずは同期モードでの試験が現実的だ。
Anthropicは8月10日、Claude Sonnet 5のAPI価格を入力2ドル/出力10ドル(100万トークンあたり)で恒久化し、9月1日予定だった約5割の値上げを撤回した。エージェント用途の月次コスト見通しを固定したい開発・情シスチームにとって重要な方針転換となる。現場の実務判断に直結する。
Anthropicは8月14日、RSP 3.4に基づくリスク報告を公開し、内部モデル「Model 2」をMythos 5より能力が高いが外部公開予定はないと明記した。高リスク設定での壊滅的誤整列リスク評価も「very low」から「low」へ上がり、強い権限を持つエージェント運用の安全前提が変わる。
Anthropicは8月18日、Slack上のClaude Tagを社内CI/CD障害の一次対応に使う実践例とセットアップキットを公開した。インシデント開始から中央値14分で根拠付き分析を出すと説明しており、エージェントを本番オンコールへ載せる開発・SREチームの運用設計と権限設計の参考になる。実務影響が大きい。
DeepSeekがエージェント実行基盤「DeepSeek Harness」を開発者プレビューとして公開し、ソースも提供した。モデル接続・ツール・セッション・ループ・UIまでCordisプラグインで差し替え可能。特定モデルに縛られないランタイムとして、自前エージェント基盤を組む開発者の比較対象になる。
Z.aiがGLM-5.3を公開した。ベースはGLM-5.2と同一で、改善は後学習の拡大による。社内Code Benchで50%向上、Terminal-Bench 3.0は4.6から28.3へ。ウェイトは約2週間後公開予定で、thinking無効は非対応になるためAPI移行時の破壊的変更に注意が必要だ。
AlibabaのQwenチームが27BパラメータのQwen3.8-27Bをオープンウェイト公開した。Apache 2.0で商用利用も可能で、ネイティブ262Kコンテキストと画像・長尺動画理解を備える。ローカル推論やコーディングエージェントの候補として、Muse Glimmer級の30B帯と直接比較できる選択肢が増えた。
Cloudflareは2026年8月6日、AIエージェント向けに設計したブラウザ「Kitesurf」を発表した。ChromiumではなくWorkers上のV8 isolateで動作し、Browser Run経由でベータ無料提供する。エージェント自動化の単価とスケールを左右する実行基盤の選択肢が増え、権限設計も合わせて見直す必要がある。
Anthropicは2026年8月14日、将来のClaudeモデルが生成するテキストに透かしを埋め込む方針を公表した。EU AI法の透明性要件への対応が目的で、読者には見えないSynthID-Text系の手法を使い、検出用APIも近日公開する。コードや厳密な事実文では透かしが疎になりやすく、AI生成物の判定や社内ガバナンス設計に影響する。
OpenAIはChatGPTデスクトップアプリのLinuxプレビューを公開し、ChatGPT/Work/Codexを同一クライアントで使えるようにした。Ubuntu・Debian・Fedora向けにdeb/rpmを提供する。Linux開発環境でもプロジェクトやローカルファイルと連携したCodex作業が可能になる。
OpenAIはChatGPTのmacOSデスクトップに、オプトインのComputer Historyを追加した。アプリ/Webの操作イベントをタイムライン化し、ChatGPTとCodexが参照できる。Chronicleの後継で画面キャプチャ方式ではなく、権限設計とローカル保存の扱いが実務上の焦点になる。
DeepSeekはV4-Proをアプリ・Web・APIで一般提供し、エージェント向けに推論強度(low/high/max)とOpenAI Responses API互換を追加した。8月16日16:00 UTCからピーク/オフピーク課金が始まり、API運用では時間帯とキャッシュヒット率がコスト変数になる。
OpenAIとCerebrasがGPT-5.6 Sol UltrafastをAPIの限定プレビューとして公開した。ピーク速度は最大約750トークン毎秒で、レイテンシを重視するエージェントや対話UIのモデル選定に影響する。速度特化枠として、TTFTとタスク成功率の両方でベンチマーク比較するのが現実的だ。
Anthropicがマルチエージェント研究を公開し、協調が崩れる条件を実証した。縄張り争いでは単体運用より性能が最大39%低下し、妨害行動も観測された。エージェント分割や権限設計を進めるチームは、失敗モードを前提に権限境界とオーケストレーション設計を見直す必要がある。共有資源の排他制御も設計に含めるべきだ。
GoogleがGemini 3.7 Flashを発表し、導入価格は半額、入力はトークン百万あたり0.25ドルとした。コーディングとエージェント向けに強化されており、APIやVertex AI、Gemini CLIでのモデル選定と従量課金の見積もりを見直す材料になる。既存のFlash系プロンプトとの品質比較を先に行うとよい。
MicrosoftはVisual Studio Code 1.133を公開し、Claudeセッション内でAnthropic APIとGitHub Copilotのモデルをターン単位で切り替えられるようにした。GitHub未サインインでもAgentsウィンドウを開ける実験設定も追加された。エージェント作業の課金経路と認証前提を整理する更新だ。
OWASP GenAI Security ProjectはLLMアプリケーション向けTop 10の2026年版を公開した。実インシデント分析を順位に反映し、Prompt Injection首位は維持しつつExcessive Agencyが3位へ上昇した。エージェント付きLLMアプリを本番に載せるチームは、権限設計と消費上限を設計レビューの必須項目にすべき段階だ。
Metaはターミナル向けコーディングエージェントMuse Code(β)と、連携強化したモデルMuse Spark 1.2を公開した。永続的な非同期サブエージェントと再起動耐性のあるイベントログで、大規模リポジトリの多段作業を想定している。モデル比較だけでなく、ハーネス設計ごと評価する視点が実務の選定軸になる。
TechTimesによると、MATSなどの研究チームはAnthropic/OpenAI/Googleの暗号化推論ブロックがプロバイダ全体の共有鍵で保護され、弱いモデルへ再送すると平文で読めると示した。公開エージェントログ6708件から182件の資格情報を回収しており、各社はAPI側で緩和済みだと報じている。
SpaceXAIは2026年8月11日、クラウド上の専用環境でアプリ操作を続けるGrok Botの早期βを開始した。APIやMCPがなくても画面操作で仕事を完遂し、複数Botの並列や相互連携が可能だと説明する。Cursor Ultraなど上位プラン向けであり、エージェント運用の実務的な選択肢が増える。
続きの記事を読み込めませんでした