「Qwen3.8-Flash-Next」がオープンモデルとして公開される、Qwen4の次世代アーキテクチャを使用
親愛なる読者の皆さまへ。ご存じの通り価格高騰などの悪影響でサーバー運営がとても苦しい状態です。回線や台数を整理し見直せる部分は全て見直しましたが、やはりまだ危険水域です。このままだと1ページを10分割ぐらいして無理矢理PVを増やさざるを得なくなってしまいます。そこで、GIGAZINEの物理的なサーバーたちを、たった1円でも良いので親愛なる読者の皆さまに支援してもらえればとっても助かります!今すぐ寄付は上のボタンから! ・ これまでGIGAZINEを支援してくれたメンバーのリスト
AlibabaのAI研究チームであるQwenがAIモデル「 Qwen3.8-Flash-Next 」を2026年8月26日に公開しました。Qwen3.8-Flash-NextはQwen4シリーズで採用される予定の次世代アーキテクチャを用いて開発されており、学習コストを抑えつつ高性能なモデルを構築することに成功しています。また、すでにUnslothによる量子化版モデルも公開されています。 Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency https://qwen.ai/blog?id=qwen3.8-flash-next
⚡Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $ 0.16/1M input tokens and $ 0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O
Qwen3.8-Flash-Nextは履歴の効率的な圧縮が可能な「Gated DeltaNet(GDN)」やアテンション処理のコストを大幅に削減する「Qwen Sparse Attention(QSA)」を取り入れたハイブリッドアーキテクチャを採用しています。また、モデルの表現可能な語彙をわずかな追加計算で拡張できる「N-gram Embedding」も組み込んでいます。総パラメーター数は1250億、アクティブパラメーター数は60億で、N-gram Embeddingのパラメーター数は510億です。標準状態で26万2144トークンのコンテキスト長に対応し、コンテキスト長を拡張する「YaRN」によって最大100万トークンまで対応できます。
「Qwen3.8-Flash-Next」「Qwen3.8-27B」「Qwen3.7-Plus」「DeepSeek-V4-Flash-0731」「Claude-Opus-4.8(Max)」の各種ベンチマーク結果が以下。Qwen3.8-Flash-Nextは多くのテストでClaude-Opus-4.8(Max)を上回っています。なお、Qwen3.8-Flash-Nextのトレーニングに必要な期間はQwen3.8-27Bの9分の1とのこと。
Qwen3.8-Flash-Nextは長大なトークンを処理する際のプリフィルとデコード双方のスループット低下を抑えられているのも特徴です。以下のグラフはQwen3.7-Plusを基準としてコンテキスト長ごとのプリフィルの速度差を示したもの。100万トークンを処理する場合、Qwen3.8-Flash-NextはQwen3.7-Plusの8.6倍高速です。
Qwen3.8-Flash-NextはオープンモデルとしてHugging FaceとModelScopeで公開されています。 Qwen/Qwen3.8-Flash-Next · Hugging Face https://huggingface.co/Qwen/Qwen3.8-Flash-Next
千问3.8-Flash-Next · 模型库 https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
また、Unslothによる量子化版も発表と同日に公開されています。1bit版は75GB以上のRAMを搭載したマシンで実行可能で、フルモデルの80%の精度を維持しているとのこと。 Unslothのドキュメント では「RAMに読み込んで実行する場合でも、VRAMに読み込んだ際と同等の性能を実現可能」とアピールされています。 unsloth/Qwen3.8-Flash-Next-GGUF · Hugging Face https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
・関連記事 謎の高性能AI「Ox Alpha」の正体は「GLM-5.3-Flash」だったことが判明、Claude Opus 4.8と同等性能のオープンモデル&中国製チップで運用可能 - GIGAZINE ローカルで動く中国製オープンモデル「Qwen3.8 27B」はGPT-5.6 Terra超えのエージェント性能で同等規模のモデルより圧倒的に高性能という分析結果 - GIGAZINE アリババのAI「Qwen」が6カ月間に30億回ダウンロードされる世界1位のAIモデルに - GIGAZINE 音声クローンが可能な音声合成AI「Qwen-Audio-3.0-TTS」が登場、日本語対応でGemini超えの性能 - GIGAZINE 画像生成AI「Qwen-Image-3.0」が登場したので使ってみた、イラストや日本語テキストの描画性能はいかに - GIGAZINE
You can read the machine translated English article 'Qwen3.8-Flash-Next' is released as an o… .
この要約はメディアの公開フィードから5Newsが集約したものです。 文脈も含めた全文はgigazine.netにあります — コンテンツの権利はGIGAZINEに帰属します。