FlowTune Media

中位モデルが上位モデルを追い抜いた — Claude Sonnet 5.5が値上げなしでやったこと

面白い逆転が起きている。

Anthropicが9月28日(日本時間29日)に公開した Claude Sonnet 5.5 は、同社のラインナップでいえば「真ん中」のモデルだ。上には1週間前に出たばかりのフラッグシップ Opus 5.5 がいる。普通に考えれば、真ん中は真ん中の性能で、上位には届かない。

ところが、コーディングエージェント向けの Terminal-Bench 4.0 というベンチマークでは、Sonnet 5.5 が 70.6% を叩き出した。同じ指標で Opus 5.5 は 66.4%。中位モデルが、より高価な上位モデルをはっきり上回っている。しかも Sonnet 5.5 の料金は Opus 5.5 の半額だ。

数字だけ見ると「え、じゃあ上位モデルは何のためにあるの」と言いたくなる。もう少し丁寧に中身を見ていく。

一番の驚きは、前世代からの伸び幅

Opus との比較の前に、まず同じ Sonnet 同士で見てほしい。

Terminal-Bench 4.0 のスコアは、Sonnet 5 が 10.3%、Sonnet 5.5 が 70.6%。1桁台から70%台へ、一世代でこれだけ跳ねた。ターミナル上でコマンドを組み立てて作業を進める、いわゆる「エージェント的な操作」が、前バージョンではほとんど機能していなかったのが、急に実用ラインに乗ったという読み方ができる。

他のベンチも底上げされている。

ベンチマーク Sonnet 5 Sonnet 5.5 Opus 5.5
Terminal-Bench 4.0(ターミナル操作) 10.3% 70.6% 66.4%
CursorBench 4.0(IDE内コーディング) 34.1% 55.5% 57.8%
GDPval-AA v2.1(知識労働 Elo) 1449 1844 1846
FrontierCode v1.1(高難度コード) 42.4% 46.2% 54.4%

GDPval-AA(一般的な知識労働の評価)に至っては、Sonnet 5.5 が 1844 Elo、Opus 5.5 が 1846 Elo とほぼ横並びだ。日常的な調べ物や文章作成、業務タスクのレベルなら、両者の差はほとんど体感できないところまで来ている。

一方で、Opus がきちんと差を守っている領域もある。FrontierCode(難しいコード生成)は 54.4% 対 46.2%、CursorBench も 57.8% 対 55.5% で、僅差ながら Opus が上。難易度の高い一発勝負では、まだ上位モデルに分がある。

値上げしていないのに、実質は安くなっている

料金は Sonnet 5 から据え置きだ。入力100万トークンあたり $2、出力 $10、キャッシュ読み取り $0.20。Opus 5.5 は入力 $4・出力 $20 なので、単価でちょうど半分になる。

ここで注意したいのは、Anthropic が「タスクあたり最大30%安くなる」と言っているときの意味だ。トークン単価は下がっていない。安くなる理由は、同じ仕事を終わらせるのに使うトークン数とツール呼び出しの回数が減ったから。出力は30%以上速く、途中の試行錯誤が減れば、結果として1タスクの合計コストが下がる。

これは地味だが、エージェント用途では効いてくる話だ。自律的に何ステップも回すワークフローでは、1回1回の無駄が積み重なる。ツール呼び出しが減れば、その分ループが早く終わり、料金も時間も削れる。単価表を眺めているだけでは見えない、実運用でのコスト差がここにある。

これで何が変わるか

一番わかりやすいのは、コーディングエージェントの「デフォルトモデル」の選び方だ。

これまでは「安いモデルで様子を見て、ダメなら上位モデルに切り替える」という使い方が定石だった。だが Sonnet 5.5 がターミナル操作で Opus を上回るとなると、Claude Code のような環境では 普段使いを Sonnet 5.5 に寄せて、本当に難しい一部だけ Opus に回す という構成が現実的になる。半額で速く、しかも多くのタスクで上位と互角なら、わざわざ高い方を常用する理由が薄い。

もう一歩進めて考えると、「1タスクの完了コストが下がる」ことのインパクトは、単発のチャットより自動化の文脈で大きい。たとえば毎晩リポジトリを巡回して小さな修正PRを出すような常時稼働のエージェントを組む場合、1回の実行が速く安くなれば、同じ予算でより多くの回数を回せる。今まで「コストが読めないから週1」だったものが「毎日」に変えられる、という判断が出てくる。ここが揃えば、AIエージェントを常設インフラとして置くハードルは一段下がる。

正直に言えば、ベンチマークの数字はプロンプトやツール設計にも左右されるので、70.6% という値をそのまま自分の環境に当てはめるのは危うい。GDPval のようなElo評価も、あくまで相対順位の話だ。とはいえ「中位が上位に追いつく(一部で追い抜く)」という方向性自体は、ここ数世代のSonnetで一貫している。安い方の性能が上がり続ける限り、ユーザー側が払う金額は下がっていく。この構図は素直に歓迎したい。

使えるようになった場所

Sonnet 5.5 は Claude アプリ、API(モデルID claude-sonnet-5-5)、Claude Code に加え、AWS・Google Cloud・Microsoft Azure 経由でも利用できる。既存のSonnet 5を使っているなら、モデルIDを差し替えるだけで移行できる。料金は変わらないので、まずは普段のタスクで置き換えてみて、速度とコストの体感がどう変わるかを見るのがいい。

詳細はAnthropicの公式ページにまとまっている。

真ん中のモデルがここまで来ると、次に気になるのは「では上位モデルはどこで差を見せるのか」だ。難問特化なのか、より長い自律実行なのか。Opus 側の次の一手が、この階層構造をどう描き直すのかを見ておきたい。


関連記事: GPT-6.1 Sol・Gemini 4 Argon・Claude Sonnet 5.5を比較【2026年最新】

関連記事