Qwen3.8 Max、正式版でベンチマークが出た — 「Fable 5に次ぐ」は、勝った項目と負けた項目に分かれた
半月前、Qwen3.8 Max のプレビューが出たとき、この記事で「『Fable 5に次ぐ』を名乗るなら、それを裏づけるベンチマークをセットで出してほしかった」と書いた。飛びつくのは第三者スコアが出てからで十分だ、とも。
その答え合わせのタイミングが、思ったより早く来た。Alibabaは8月3日、Qwen3.8 Max を正式にリリースし、今度はちゃんとベンチマークの表を添えてきた。結論から言うと、自己申告は半分当たっていて、半分は盛っていたというのが正直な読後感だ。
まず数字を並べる
正式版のQwen3.8 Maxは、総パラメータ2.4兆、リクエストごとにアクティブになるのは95BというMoE(Mixture-of-Experts)構成。テキスト・画像・動画を扱えるマルチモーダルで、コンテキストは最大100万トークン。巨大さのわりに、実際に火が入るのは一部の専門家(エキスパート)だけなので、推論コストと応答速度を抑えられるという設計だ。
肝心のベンチマークはこうだ。
- PaperBench: 93.0 — GPT-5.6 Sol(90.5)、Fable 5(88.8)、Opus 4.8(80.3)をいずれも上回る
- Terminal-Bench 2.1: 86.6 — ターミナル操作系で高スコア
- SWE-bench Pro: 67.7 — Fable 5の80.0には届かず
この並びを見て、「Fable 5に次ぐ」というプレビュー時の主張がどう評価できるか、少し立ち止まって考えたい。
「勝ち」と「負け」がきれいに分かれている
面白いのは、勝敗が能力の種類できっぱり分かれている点だ。
論文の読解・再現を問うPaperBenchや、ターミナル上のタスクをこなすTerminal-Benchのような、指示追従と長い推論が効く領域では、Qwen3.8 Max はFable 5を含む西側フロンティアを上回っている。ここは素直にすごい。中国のオープン志向モデルが、Anthropicの最上位を数字の上で抜いたという事実は、半年前には考えにくかった。
一方で、実際のリポジトリを相手にバグを直しissueを閉じるSWE-bench Pro——つまり「現場のソフトウェアエンジニアリング」に近いタスクでは、Fable 5に12ポイント以上の差をつけられている。プレビュー記事で触れた既視感、「ベンチマーク1位でも、毎日触るとClaudeの方が扱いやすい」というQwen Maxシリーズのパターンは、今回も部分的に踏襲されているように見える。
だからこの一枚の表から読み取れるのは、「Qwen3.8 MaxはFable 5に次ぐ」ではなく、**「タスクによってはFable 5を超え、実装作業では届かない」**という、もう少し解像度の高い現実だ。ベンチマークをどう選ぶかで、いくらでも「世界2位」にも「一歩後退」にも見せられる。公開されたのが自社選定のベンチである以上、有利な項目が並んでいる可能性は差し引いて読むべきだろう。
それでも見逃せない点
留保をいくつも並べたが、このモデルの本当の重みは順位表の外にある。Alibabaは、モデルの重み(ウェイト)を来週HuggingFaceとModelScopeで公開すると予告している。
2.4兆パラメータのマルチモーダルモデルが、少なくとも一部のベンチでFable 5を上回る水準で、オープンウェイトとして降ってくる。これが現実になれば、意味することは大きい。クラウドのクローズドAPIに毎回課金する前提が崩れ、機密性の高い業務——社内文書の解析や、外に出せないデータでのファインチューニング——を、手元で回せる選択肢が一段現実味を帯びる。
指示追従と長い推論に強いという特性は、自律エージェントの頭脳としても相性がいい。大量のツール呼び出しを重ねるワークフローで、SWE-bench Proのスコアがそのまま足を引っ張るとは限らない。むしろPaperBenchやTerminal-Benchで示した強さは、「調べて・計画して・手を動かす」タイプのエージェントで効いてくる領域だ。
今の見立て
プレビュー時点での結論は「オープンウェイトと第三者ベンチが出てから」だった。そのうち後者は出た。ただし出てきたのは自社選定の表で、真の答え合わせは重み公開後、独立した評価が出そろってからになる。
現時点での評価はこうだ。特定のタスクでFable 5を超える中国製オープンモデルが現れた、という事実は本物。ただし「次ぐ」という総合順位の主張は、まだ検証の途中。来週の重み公開と、そのあとに続くであろう外部ベンチマークが、次の——そしておそらく本当の——見どころになる。詳細は Qwenの公式 を追うのがいい。
関連記事
Alibaba、2.4兆パラメータのQwen3.8 Maxを公開 — 「Fable 5に次ぐ」という自己申告の中身
Alibabaが7月19日にフラッグシップ「Qwen3.8 Max」プレビューを公開。2.4兆パラメータ・初のマルチモーダル大型モデルで、オープンウェイト化も予告。性能の自己申告とベンチマーク不在を整理する。
35時間放置したらコードが10倍速くなっていた — Qwen 3.7 Maxの自律コーディング実験
Qwen 3.7 Maxが知能指数1位。Opus比1/10の料金で35時間自律コーディング。性能と制約を整理
GPU1枚に載る27BのAIが、Claude Opus 4.6を15項目で上回った — Qwen3.8-27Bの何がすごいのか
Qwen3.8-27Bは24GBのGPU1枚で動くオープンウェイトのマルチモーダルモデル。Apache 2.0、262Kコンテキスト、公開初週末に300万DL。ローカルAIを塗り替える実力を検証する。