Geminiが世代をひとつ上げた — 出力が16倍になったGemini 4 Argon、でも最初に触れるのは防御側
ベンチマークの数字より先に、この一行に目が留まった。出力トークンの上限が64Kから100万に増えた、と。
Googleは2026年9月30日、Gemini 4世代の最初のフロンティアモデル「Gemini 4 Argon」を発表した。発表に立ったのはGoogle DeepMindのSVP、Koray Kavukcuoglu。位置づけは「長時間タスク向けのフロンティアモデル」で、想定用途として実世界のソフトウェアエンジニアリング、法務・金融のナレッジワーク、そしてサイバー防御が挙がっている。
Gemini 3.x系はこの半年ほどで3.1、3.5、3.8と刻むように更新されてきた。そこから数字がひとつ繰り上がって「4」になったわけで、Googleとしてはそれなりに力の入ったリリースだ。ただ、今回いちばん面白いのは性能そのものよりも、誰に、どの順番で渡すかという配り方のほうだった。
出力1Mトークンが意味すること
入力のコンテキストウィンドウが広いモデルは、もう珍しくない。Gemini 3.5 Proの200万トークンのように、大量の資料を一度に読ませる競争はずいぶん前から続いている。
Argonで変わったのは入力ではなく出力のほうだ。これまでの多くのモデルは、一回の応答で吐ける長さに数万トークン程度の天井があった。Argonはその天井を100万トークンまで引き上げた。64Kからだと16倍である。
地味な数字に見えるかもしれないが、エージェント的な使い方を考えると効いてくる。長い作業を途中で切らずに、ひとつの連続した出力として最後まで書き切れる、ということだからだ。たとえばコードベース全体にまたがるリファクタリングを、何度も「続きを書いて」とつつかずに一気通貫でやらせる。あるいは長大な契約書のドラフトを、途中で文脈を見失わずに生成しきる。「長時間タスク向け」という触れ込みは、この出力の長さに裏打ちされている。
正直なところ、入力の広さほど分かりやすい指標ではないので地味な扱いになりがちだ。でも、エージェントに腰を据えた仕事を任せたい人ほど、この1行の重みが分かるはずだ。
ベンチマークは「法務」で差がついた
Googleが公開した数字のなかで目を引くのは、コーディング系のDeepSWE v1.1だ。
- Gemini 4 Argon: 77.9%
- Claude Opus 5.5: 74.2%
- GPT-6 Astra: 74.1%
Claude Opus 5.5やGPT-6 Astraといった現行のトップどころに対して、3ポイント強のリードをつけている。僅差ではあるが、この層での3ポイントは小さくない。
さらにGoogleは、エンタープライズ向けのナレッジワーク系ベンチで軒並み首位を取ったと主張している。とりわけ**法務タスクでの差は「接戦ですらない(not close)」**と強気だ。契約レビューやリサーチのような、文脈を長く保ちながら正確さを問われる領域は、まさに出力1Mトークンが活きる場所でもある。ベンチの数字と設計思想が噛み合っている印象は受ける。
もっとも、ベンダー自身が選んで出したベンチマークである以上、ここは割り引いて見るのが筋だ。実際の法務・開発の現場でどう振る舞うかは、第三者の検証とユーザーの実戦投入を待ちたい。「法務で独走」はあくまでGoogleの言い分、という温度で受け取っておくのがいいと思う。
開発者より先に、セキュリティ企業へ
今回いちばん引っかかったのは、提供の順番だ。
Argonは、一般の開発者より先に、サイバー防御のチームに渡される。使えるのは当面「Fairwind Program」のメンバーだけ。このプログラムは9月3日に、小型のGemini 3.8 Flash Cyberで先にスタートしていて、すでにCrowdStrikeやPalo Alto Networksを含む650以上の組織が参加しているという。
理由は、Argonが持つ能力の性質にある。このモデルは、重大なソフトウェア脆弱性を自分で見つけ、検証し、パッチまで当てられるとされる。防御側にとっては強力な武器だが、同じ能力は裏返せば攻撃にも使える。だからGoogleは、信頼できる防御者と自社の内部チームに対してはサイバー関連のガードレールを外した状態で提供する一方、その提供先を審査制の枠内に閉じ込めている。
この「強い能力は、まず審査を通った防御側だけに」という配り方は、Gemini 3.8 Flash Cyberのときと同じ発想だ。Googleはフロンティアモデルのサイバー能力を、オープンにばらまくのではなく、ゲートの内側で運用する方針を一貫させてきている。Argonはその方針を、最上位モデルにまで広げた格好だ。
考えてみれば、これはモデルの配布が「公開するか・しないか」の二択から、「誰に・どの条件で開けるか」という設計の問題に移りつつあることを示している。能力が上がるほど、APIを叩けば誰でも最強モデルに触れる、という当たり前は崩れていくのかもしれない。便利さと安全性のトレードオフが、料金プランではなく審査制という形で表に出てきた、と言ってもいい。
料金と、現時点での距離感
価格は入力が100万トークンあたり**$2**、出力が**$10**。Googleはこれを「導入価格(introductory price)」と呼んでいる。日本円だと、おおよそ入力300円・出力1,500円前後(1ドル150円換算)という水準だ。
面白いのは、この価格が同日に発表されたClaude Sonnet 5.5の$2 / $10とぴったり同じという点。フロンティアの最上位モデルが、ミドルクラスと同じ値付けで出てきたことになる。導入価格という但し書きがあるので、いずれ上がる可能性は頭に置いておきたいが、入り口としては悪くない。
ただし、多くの開発者にとって当面の距離感は「価格」ではなく「そもそも触れない」ことのほうだ。Fairwindの外にいる個人開発者が、いつ・どの形で手を出せるようになるのかは、現時点では明確になっていない。開発者向けの一般提供は「後日」とされているだけだ。
筆者の見立て
性能面は、正直まだ評価を保留したい。ベンチの数字はたしかに強いが、Googleが選んだ土俵での勝利でもある。本当に法務やコーディングで「独走」なのかは、現場の声が出てこないと分からない。
むしろこのリリースで記憶しておく価値があるのは、最強クラスのモデルが、最初から全員には開かれない時代に入ったという事実のほうだと思う。出力1Mトークンという能力の拡張と、審査制という配布の絞り込みが、同じ発表のなかに同居している。能力が上がるほど入り口が狭くなる——その非対称が、Argonを一言で表している。
Gemini 4という新しい世代の本番は、Argonに続く標準モデルが一般提供されてからだろう。それが開発者の手元に届いたとき、出力1Mトークンが日々の作業を本当に変えるのか、あらためて確かめたい。公式の発表はGoogle公式ブログにまとまっている。
関連記事: GPT-6.1 Sol・Gemini 4 Argon・Claude Sonnet 5.5を比較【2026年最新】
関連記事
Geminiが自分で脆弱性を見つけて直す — ただし、使える相手は審査制
Googleが9月2日に防御専用のGemini 3.8 Flash Cyberを発表。脆弱性の自動発見とパッチ生成に特化し、CyberGymで大型モデルを上回る。なぜ一般公開せず審査制の「Fairwind」経由なのかを整理する。
DeepMindのCEOが交代した — Hassabisは会長へ、WaveNetを作った男が指揮を執る
Google DeepMindのCEOがDemis HassabisからKoray Kavukcuogluへ。同日のBrain Drainと合わせ、Gemini遅延・OpenAI/Anthropic猛追の背景で組織が動いた意味を整理する。
Geminiの音声AIが「考えながら話す」ようになった — 返事しながら裏で作業を進めるGemini 3.8 Live
Googleが9月15日に公開したGemini 3.8 Liveと3.8 Live Extended Thinkingを解説。話しながら裏で処理を進める非同期ツール実行、97言語の自動切替、2モデルの使い分けと正直な評価を整理する。