FlowTune Media

DeepSeekが「格安モデル」の中身を作り直した — V4.1-Flashは新設計で自社フラッグシップ超え

前回のDeepSeek-V4-Flashの更新(通称「0731」ビルド)は、「アーキテクチャは一切いじらず、事後学習だけで性能を跳ね上げた」のが売りだった。今回はその逆をやってきた。中身の設計そのものに手を入れている。

2026年9月10日、DeepSeekは新モデル DeepSeek-V4.1-Flash を公開した。552BパラメータのMoEで、重みはMITライセンスのオープンウェイト。ポイントは3つ——新しいアーキテクチャ、1Mトークンのコンテキスト、そして相変わらずの激安価格だ。

「Causal Encoder-Decoder」という新しい骨格

いちばん目を引くのは、V4.1-Flashが Causal Encoder-Decoder と呼ばれる新設計を採用したことだ。ここ数年、大規模言語モデルはほぼ一択でDecoder-only(GPT系と同じ骨格)に収れんしていた。そこにDeepSeekがEncoder-Decoderの発想を持ち込んできた形になる。

効いてくるのは効率だ。V4.1-Flashは総パラメータこそ552Bと大きいが、入力時にアクティブ化するのは8B、出力時でも16Bにとどまる。巨大な知識量を抱えながら、実際に動かすのはごく一部——これがMoEの旨みで、新しい骨格はそれをさらに突き詰めた設計と読める。DeepSeekは、性能・コスト・速度・総実行時間のいずれでも自社最上位のV4-Proを上回ると主張している。

コンテキストは1Mトークン、出力は最大384,000トークンまで。画像とテキストをネイティブに扱える。長大なコードベースや大量のドキュメントを一気に読ませて、そこから長い回答を吐かせる——このサイズ感は、RAGを組まずに「全部そのまま投げる」乱暴なやり方を現実的にする。

価格は、やっぱりおかしい

DeepSeekの真骨頂は価格だ。今回もその期待を裏切らない。

料金はピーク時とオフピーク時で変わる。オフピークなら入力100万トークンあたり$0.15(キャッシュミス時)、出力$0.6。キャッシュヒット時の入力に至っては**$0.003**——つまり100万トークンで0.5円しない水準だ。ピーク時は入力$0.3、出力$1.2に上がる。

ピーク時間帯はUTCで月〜金の01:00〜04:00と06:00〜10:00。日本時間に直すと、おおむね10:00〜13:00と15:00〜19:00がピークにあたる。日本の日中の業務時間がほぼピークに重なるので、コストを詰めたいなら夜間バッチに寄せる——といった運用が効いてくる。

正直な評価

素直にすごいと思う一方で、いくつか留保もある。

まず「V4-Proを上回る」というのはあくまでDeepSeek自身の主張で、第三者ベンチの積み上がりはこれからだ。新アーキテクチャが本当に効いているのか、それとも事後学習の巧みさなのかは、外部の検証を待ちたい。

もう一つ、Flash系はコストと速度に振ったモデルだという前提は変わらない。最難関の推論タスクで常にトップを取る、という種類のモデルではないだろう。あくまで「実務で回すコストパフォーマンス最強クラス」という位置づけで見るのが正しい。

それでも、オープンウェイトで1Mコンテキスト、しかもこの価格。エージェントのように1タスクでモデルを何十回も叩く用途では、この安さがそのまま実現可能性の差になる。今まで「コストが合わない」と諦めていた自動化を、もう一度机に乗せてみる価値はある。中国勢がまた一段、価格の常識をずらしてきた。

関連記事