DeepSeek V4 Flashはベンチマークスコアは高いが実際のタスクでは苦戦しているという指摘、オーケストレーションに課題
親愛なる読者の皆さまへ。ご存じの通り価格高騰などの悪影響でサーバー運営がとても苦しい状態です。回線や台数を整理し見直せる部分は全て見直しましたが、やはりまだ危険水域です。このままだと1ページを10分割ぐらいして無理矢理PVを増やさざるを得なくなってしまいます。そこで、GIGAZINEの物理的なサーバーたちを、たった1円でも良いので親愛なる読者の皆さまに支援してもらえればとっても助かります!今すぐ寄付は上のボタンから! ・ これまでGIGAZINEを支援してくれたメンバーのリスト
中国のAI企業・DeepSeekは高性能AIモデル「 DeepSeek-V4 Flash 」と「 DeepSeek-V4 Pro 」を展開しています。V4 Flashは登場以来「安価かつ高性能」として利用ランキングで常に上位を占めるほど人気を集めましたが、DeepSeekは2026年8月6日に 値上げを通知 しているほか、実際のエージェント環境ではベンチマークスコアほどの高い性能を発揮できないケースがあると指摘されています。 DeepSeek's top-ranked V4 Flash stumbles on real agent tasks as its prices surge | VentureBeat https://venturebeat.com/orchestration/deepseeks-top-ranked-v4-flash-stumbles-on-real-agent-tasks-as-its-prices-surge
DeepSeek-V4 Flashは2026年4月24日に登場し、2026年7月31日にはアップデート版の「DeepSeek-V4-Flash-0731」がリリースされました。DeepSeek-V4-Flash-0731は総パラメーター数2840億・アクティブパラメーター数130億のMoEモデルで、第三者機関のArtificial Analysisが実施したインテリジェンス性能テストではGoogleのGemini 3.6 Flashと同等性能と評価され、オープンモデルの中ではKimi K3とGLM-5.2に続く性能と評価されました。また、 コーディング性能ではGLM-5.2を上回っているほか、 エージェント性能ではGemini 3.6 Flashを大きく上回り、OpenAIのGPT-5.6 Lunaを0.1ポイント上回りました。 「DeepSeek-V4-Flash-0731」が登場、GPT-5.6 Lunaより安価で同等性能のオープンモデル - GIGAZINE
DeepSeek-V4 Flashはコスト効率の高さでも特徴的でした。 OpenAIは2026年7月31日にGPT-5.6シリーズの大幅値下げを告知しましたが、その数時間後に発表されたDeepSeek-V4 Flashは、GPT-5.6シリーズよりもさらに低価格に設定されていました。 しかし、2026年8月6日にDeepSeekはユーザーに「API料金の大幅な値上げ」を通知しました。値上げの理由は説明されていませんが、一部では「DeepSeekは前例のない需要の急増に対応している」と言われています。また、需要の急増によりモデルの推論速度が時折極端に遅くなるという事例も報告されています。 DeepSeekがAPI料金の大幅値上げを予告、低価格戦略による需要急増が背景か - GIGAZINE
そんなDeepSeek-V4 Flashの性能について、公式発表のベンチマークほど優れていない可能性が指摘されています。 AIエージェント用プラットフォームの「 Composio 」はDeepSeek-V4 Flashを用いて4つのエージェントハーネスで30のエージェントタスクを実施した結果を発表しました。タスクはGmail、GitHub、Slack、Google Sheetsといった実際のツールを横断する、難易度の高い複数ステップのタスクが意図的に設定されています。
We ran DeepSeek V4 Flash through 4 agent harnesses (Claude Code, Codex, OpenCode, Oh My Pi) on 30 agentic tasks. A different harness won on each metric: success rate, cost, and speed. 🧵🧵🧵 pic.twitter.com/WFy6QNgv8r
結果として、合計240回の実行のうち、合格したのは129回で、テストしたすべてのハーネスで正常に完了したワークフローは30件のうちわずか6件だったことが報告されています。
Here are the success rates across all 30 tasks: - Oh My Pi: 17/30 - Claude Code: 16/30 - Codex: 16/30 - OpenCode: 14/30 Seven tasks passed or failed depending only on which harness we used. pic.twitter.com/OLuy6jCBQl
また、以下は成功したタスクごとの推定コストを示したもの。最も高価なハーネスでも0.2ドル(約32円)を下回っており、成功率の低さを踏まえてもコスト効率は優れているといえますが、DeepSeekの価格引き上げによりそれが変わる可能性があるとComposioは指摘しています。
Here’s the estimated cost per successful task, calculated using API list prices at the time of the run: - OpenCode: $0.073 - Codex: $0.081 - Oh My Pi: $0.103 - Claude Code: $0.195 Even the priciest harness stayed below $0.20, though DeepSeek’s price hike may change that.
この要約はメディアの公開フィードから5Newsが集約したものです。 文脈も含めた全文はgigazine.netにあります — コンテンツの権利はGIGAZINEに帰属します。