DeepSeekが「格安モデル」の中身を作り直した — V4.1-Flashは新設計で自社フラッグシップ超え
前回のDeepSeek-V4-Flashの更新(通称「0731」ビルド)は、「アーキテクチャは一切いじらず、事後学習だけで性能を跳ね上げた」のが売りだった。今回はその逆をやってきた。中身の設計そのものに手を入れている。
2026年9月10日、DeepSeekは新モデル DeepSeek-V4.1-Flash を公開した。552BパラメータのMoEで、重みはMITライセンスのオープンウェイト。ポイントは3つ——新しいアーキテクチャ、1Mトークンのコンテキスト、そして相変わらずの激安価格だ。
「Causal Encoder-Decoder」という新しい骨格
いちばん目を引くのは、V4.1-Flashが Causal Encoder-Decoder と呼ばれる新設計を採用したことだ。ここ数年、大規模言語モデルはほぼ一択でDecoder-only(GPT系と同じ骨格)に収れんしていた。そこにDeepSeekがEncoder-Decoderの発想を持ち込んできた形になる。
効いてくるのは効率だ。V4.1-Flashは総パラメータこそ552Bと大きいが、入力時にアクティブ化するのは8B、出力時でも16Bにとどまる。巨大な知識量を抱えながら、実際に動かすのはごく一部——これがMoEの旨みで、新しい骨格はそれをさらに突き詰めた設計と読める。DeepSeekは、性能・コスト・速度・総実行時間のいずれでも自社最上位のV4-Proを上回ると主張している。
コンテキストは1Mトークン、出力は最大384,000トークンまで。画像とテキストをネイティブに扱える。長大なコードベースや大量のドキュメントを一気に読ませて、そこから長い回答を吐かせる——このサイズ感は、RAGを組まずに「全部そのまま投げる」乱暴なやり方を現実的にする。
価格は、やっぱりおかしい
DeepSeekの真骨頂は価格だ。今回もその期待を裏切らない。
料金はピーク時とオフピーク時で変わる。オフピークなら入力100万トークンあたり$0.15(キャッシュミス時)、出力$0.6。キャッシュヒット時の入力に至っては**$0.003**——つまり100万トークンで0.5円しない水準だ。ピーク時は入力$0.3、出力$1.2に上がる。
ピーク時間帯はUTCで月〜金の01:00〜04:00と06:00〜10:00。日本時間に直すと、おおむね10:00〜13:00と15:00〜19:00がピークにあたる。日本の日中の業務時間がほぼピークに重なるので、コストを詰めたいなら夜間バッチに寄せる——といった運用が効いてくる。
正直な評価
素直にすごいと思う一方で、いくつか留保もある。
まず「V4-Proを上回る」というのはあくまでDeepSeek自身の主張で、第三者ベンチの積み上がりはこれからだ。新アーキテクチャが本当に効いているのか、それとも事後学習の巧みさなのかは、外部の検証を待ちたい。
もう一つ、Flash系はコストと速度に振ったモデルだという前提は変わらない。最難関の推論タスクで常にトップを取る、という種類のモデルではないだろう。あくまで「実務で回すコストパフォーマンス最強クラス」という位置づけで見るのが正しい。
それでも、オープンウェイトで1Mコンテキスト、しかもこの価格。エージェントのように1タスクでモデルを何十回も叩く用途では、この安さがそのまま実現可能性の差になる。今まで「コストが合わない」と諦めていた自動化を、もう一度机に乗せてみる価値はある。中国勢がまた一段、価格の常識をずらしてきた。
関連記事
論文の手法を、そのまま再現実験まで走らせる — 上海発の巨大オープンモデル「Atria Dawn」
上海AI研究所が744BのエージェントMoE「Atria Dawn Preview」をMITライセンスで公開。研究エージェントに特化し、Claude CodeやCodexから差し替えて使える。中身と現実的な使い所を解説。
AIエージェントの運用コストを最大100分の1に — オープンウェイトの「Smaug」3モデルが公開された
Abacus.AIがエージェント特化のオープンウェイトモデル群Smaug(Agentic/Flash/Mini)を公開。Hugging Faceで配布、フロンティア比10〜100分の1のコストを謳う。3モデルの中身と実力の見方を解説。
格安モデルに「目」がついた — DeepSeek V4-Flashが画像を読み始め、値段は据え置き
DeepSeekが実験版のマルチモーダルモデルV4-Flash-Vision-Expを公開。画像理解を追加してもテキスト性能と価格は据え置き。何ができるようになったのかを整理する。