総125Bでも、動くのは6B — Qwen3.8-Flash-Nextは「Qwen4の予告編」として出てきた
新しいモデルが出るたびにパラメータ数が話題になるが、今回のAlibabaの発表は、その数字の読み方そのものを問いに変えてくる。
8月26日に公開された Qwen3.8-Flash-Next は、総パラメータ125B。それだけ聞くと「中規模モデル」に分類したくなるが、1トークンを処理するときに実際に火が入るのはわずか6Bだ。しかもマルチモーダル。そして重みはオープンウェイトで降ろされている。
さらに引っかかるのが、Qwenチーム自身がこれを「次のQwen4に載せるアーキテクチャの先取り」と位置づけていることだ。完成品というより、次世代の設計図を、動くモデルの形で先に配った——そういう毛色の発表になっている。
「125B」の中身を分解する
まず数字を整理したい。ここを誤解すると立ち位置を見誤る。
| 項目 | Qwen3.8-Flash-Next |
|---|---|
| バックボーン | 約125B(超スパースMoE) |
| アクティブ | 約6B / トークン |
| 付加構造 | 51BのN-gram埋め込みテーブル、4Bのマルチトークン予測モジュール |
| コンテキスト長 | 262,144トークン(YaRNで最大100万まで拡張可) |
| モダリティ | テキスト + 画像(マルチモーダル) |
| 配布 | オープンウェイト(ModelScope / Hugging Face 等) |
チェックポイント全体では、125Bのバックボーンに51Bのルックアップメモリを足して合計170B超という数え方もできる。ただ、このN-gram埋め込みテーブルは「容量は足すが1トークンあたりの計算はほとんど増やさない」設計で、必要ならホスト側のメモリに逃がせるという。つまり見かけの総量と、推論のときに動く量が、意図的に大きく引き離してある。
この「総量は大きく、アクティブは極小」という振り方自体は、先日のフラッグシップ Qwen3.8-Max(総2.4兆・アクティブ95B)と同じ発想だ。違うのは倍率で、Flash-Nextはそれを一段極端に押し切っている。専門家(エキスパート)を大量に抱えながら、入力ごとにごく一部だけを起動する。だから見かけほど推論は重くならず、コストも上がりにくい。
なぜ「Qwen4の予告編」なのか
Qwenチームがこのモデルを実験的な位置づけで出したのは、性能そのものより構造を先に世に問うためだと思われる。
公開された設計を見ると、Gated DeltaNet と Qwen Sparse Attention を組み合わせ、MoE層を挟んだブロックを積み、それを Gated Residual で束ねる——という、これまでのTransformer一辺倒とは明らかに毛色の違う構成になっている。細部を暗記する必要はないが、要点はひとつ。「訓練と推論のコストをどう下げるか」に全振りした設計だということだ。
Bloombergの報道によれば、Flash-Nextは前世代のQwen3.7-Plusを上回りながら訓練コストは約9分の1、フラッグシップのすぐ下の性能を約12分の1のコストで出す、とされる。数字は自己申告を含むので鵜呑みにはしないが、方向性は明快だ。賢さの天井を上げにいくのではなく、同じ賢さをどこまで安く出せるかという勝負に軸を移している。
これが「Qwen4の予告編」と呼ばれる理由だ。次のメジャー世代を、性能競争ではなくコスト構造の作り替えから始める——その宣言を、ベンチの数字ではなく動くモデルで示してきた。
日本で「重みが手元にある」ことの意味
個人的にいちばん効いてくると思うのは、Flash-Nextがオープンウェイトだという点だ。
ここは前回の Qwen3.7 Flash との対比で見ると面白い。あのFlashはAPI限定で重みを出さず、「Qwenはもうオープンの旗手ではない」という流れを象徴していた。ところが今回のFlash-Nextは、次世代アーキの実験台をあえてオープンウェイトで配っている。安く量をさばく廉価版でありながら、手元に落とせる——この2つが揃うと、使い方の幅が変わる。
たとえば日本の現場でよくある「顧客データや社内文書を外部APIに投げられない」という制約。ここにアクティブ6Bという軽さが噛み合うと、そこそこのGPUでも自社内で回せる射程に入ってくる。フル精度で快適に動かすには相応のVRAMが要るし、量子化すれば精度は多少落ちるが、それでも「170B級の総量を持つマルチモーダルモデルを、閉じた環境で、低コストで」という選択肢が、机上の空論ではなくなりつつある。
262Kのコンテキストと画像入力が組み合わさる点も見逃せない。長い仕様書とスクリーンショットをまとめて読ませて横断的に質問する、といった処理を、従量課金の恐怖なしに社内で回せるなら、これまで採算が合わずに諦めていた自動化がいくつも現実に寄る。単価が二桁変われば、「やらない」判断だったものが「とりあえず流してみる」に変わる。ここが安いモデルの本当の効きどころだ。
冷静に見ておきたいところ
いいことばかり書いたので、引っかかる点も正直に。
まず、これはあくまで実験的な先行公開だという点。Qwen4そのものではなく、その手前のアーキを検証するためのモデルだ。設計が野心的なぶん、既存の推論スタックとの相性や、ロングコンテキスト時の安定性は、実際に触ってみないと分からない。目新しい構造は、こなれるまで細かい落とし穴が出るのが常だ。
次に、性能数字が基本的にメーカー側の申告だという点。「Opus 4.6やDeepSeek V4-Flashに対抗する」という評価も出ているが、第三者の独立検証が追いつくのはこれからだ。日本語での実務精度は、ベンチの順位とは別に各自のタスクで測るしかない。
それでも、「総量は大きく、動くのは極小」という設計を、次世代の予告としてオープンで出してきたこと自体に意味がある。パラメータ数の大きさで殴る時代から、同じ性能をどれだけ安く配れるかという時代へ——その転換点を、Qwen3.8-Flash-Nextは一足先に見せている。まずはQwen公式やModelScopeのモデルページで、自分の環境に載るかどうかから確かめてみる価値はある。
関連記事
中国最大の2.4兆パラメータが「Fable 5に並んだ」と言い出した — Qwen3.8-Maxの実際
Alibabaのフラグシップ Qwen3.8-Maxは総2.4兆パラメータのMoE。ベンチ、料金、オープンウェイト、Fable 5比較の主張をどこまで信じるかを整理する。
Alibabaが「非公開」をやめた — 2.4兆パラメータのQwen3.8-Max、重みごと公開の狙い
AlibabaのフラグシップQwen3.8-Maxは2.4兆パラメータ・100万トークン文脈のMoE。Fable 5に迫るベンチ、料金、オープンウェイト回帰の意味を解説する。
Qwen3.8 Max、正式版でベンチマークが出た — 「Fable 5に次ぐ」は、勝った項目と負けた項目に分かれた
Alibabaが8月3日にQwen3.8 Maxを正式リリース。プレビュー時に不在だったベンチマークがついに公開。PaperBenchでFable 5超え、一方SWE-bench Proでは及ばず。2.4兆パラメータMoEの実力を整理する。