Perplexityが「文章を返さないAI」を出した — yes/noを確率で答えるDecisions API
大規模言語モデルに「このレビューは肯定的か、yesかnoで答えて」と頼むと、たいてい素直に答えてくれる。だが時々、頼んでもいない前置きや言い訳をくっつけてきたり、「文脈によりますが…」と濁したりする。分類やモデレーションのように、答えを機械的に処理したい場面では、この「おしゃべり」がノイズになる。
10月1日にPerplexityが公開した Decisions API は、その逆を行く。文章を返さない。代わりに、型が決まった答えと、その確からしさ(確率)だけを返す。背後で動くのは、判定に特化した新モデル Decider v1 27B だ。
何が普通のLLMと違うのか
Decisions APIの入力は、普通のマルチモーダルLLMと同じだ。テキストも画像も、人間の言葉で書いた質問として渡せる。
違うのは出力だ。文章を生成する代わりに、以下のような型付きの答えを返す。
- yes / no — 二択の判定
- 選択肢のうち一つ — こちらが与えた候補からの多肢選択
- ルーブリック上のレベル — 採点基準に沿った段階評価
しかも、それぞれに校正済みの確率が付く。「yes、確信度87%」のように、答えと一緒に「どれくらい自信があるか」が数字で出てくる。この確率が“校正済み(calibrated)”であることが肝心で、要は「87%と言ったものは、だいたい87%くらいの頻度で当たる」ように調整されているということだ。
この違いは地味に見えて、使う側の設計を大きく変える。通常のLLMで分類をやると、返ってきた文章をパースして、表記ゆれを吸収して、確信度は別途プロンプトで無理やり出させて……という後処理が必要だった。Decisions APIは最初から構造化された答えと確率を返すので、その面倒がまるごと消える。閾値を決めて「確信度90%以上なら自動処理、それ未満は人間に回す」といった制御が、素直に書ける。
価格と精度
価格設定も用途をよく表している。入力が 100万トークンあたり $0.04、出力は無料、リクエストごとの課金もなし。判定だけなら出力は短いので、実質「読ませた量」だけで課金される格好だ。大量のテキストを捌く分類・モデレーション用途を、かなり安く回せる。
精度について、Perplexityは11種類のテスト・合計7,210サンプルで 85.71% の正解率を示したとしている。競合とされるJevの84.51%をわずかに上回る、という主張だ。
正直に言えば、この1%強の差は、実タスクで体感できるほどの違いにはならないだろう。ベンチマークの顔ぶれが変われば逆転してもおかしくない範囲だ。注目すべきは順位より、「判定専用モデル」という土俵そのものが立ち上がってきたことのほうだと思う。
「判定モデル」という新カテゴリ
実は同じ10月1日、Cloudflareが Clef / Clef-flash を、AWSのStrands Labsが Strands Decider 2B を出している。判定に特化したモデルが、申し合わせたように複数社から同時に登場した。
これは偶然というより、需要が顕在化したサインだ。エージェントやワークフローが普及すると、その内部で「次にどの道具を呼ぶか」「この出力は合格か」「この入力は危険か」といった小さな判定が無数に発生する。そこに毎回フラッグシップの対話モデルを呼ぶのは、速度の面でもコストの面でも重すぎる。判定だけを安く速く正確にこなす専用モデルは、この隙間にちょうどはまる。
これで何が現実的になるか
Decisions APIのような判定モデルが安定して使えると、「LLMに判断させる」タイプの仕組みを本番に載せやすくなる。
たとえば、問い合わせの自動振り分け。「この問い合わせは返金依頼か、技術的な質問か、クレームか」を確率付きで判定し、確信度が低いものだけ人間がレビューする——という運用は、校正済み確率があって初めて安心して組める。確信度という「自信の目盛り」がないと、AIが自信満々に間違えたときに気づけないからだ。
モデレーションや、エージェントの行動を監視するガードレールにも向く。本処理のモデルとは別に、安い判定モデルを“審判”として横に置き、「この出力を出していいか」を逐一チェックさせる。本処理に強いモデルを使いつつ、判定は専用の安いモデルに任せる、という分業が現実的なコストで組めるようになる。これが広がれば、AIシステムの「信頼できなさ」を一段抑え込める可能性がある。
一方で、これは明確に開発者向けの部品であって、単体で何かができる完成品ではない。APIを叩いて自分の仕組みに組み込む前提なので、非エンジニアがすぐ恩恵を受けるものではない。また、校正済みと言っても確率はあくまで確率で、最終的な判断を丸投げしていいという話ではない。重要な判定ほど、閾値の設計と人間のレビューをどう残すかが腕の見せどころになる。
どう見るか
派手さはないが、筋のいいリリースだと思う。「文章を返さないAI」という引き算の発想が、エージェント時代に増える一方の小さな判定を、安く確実に処理する部品として効いてくる。
まず試すなら、自分のサービスで今ルールベースやキーワードで雑に振り分けている処理を一つ選び、Decisions APIに置き換えて精度と確信度を比べてみるといい。仕様や使い方は公式ドキュメントにまとまっている。Perplexityの他の動き、たとえばエージェントの記憶機能と合わせて見ると、同社がどこへ向かっているのかが見えてくる。
関連記事
AIのAPIに「ラッシュアワー」が生まれた — DeepSeek V4、ピーク時間帯は料金2倍に
DeepSeek V4が7月中旬に正式リリース。ピーク/オフピーク料金制を導入し、旧モデルは7月24日に廃止。新料金の仕組みと移行方法を整理する。
中位モデルが上位モデルを追い抜いた — Claude Sonnet 5.5が値上げなしでやったこと
AnthropicがClaude Sonnet 5.5を公開。ターミナル作業のベンチで上位のOpus 5.5を上回り、Sonnet 5から値上げなしで30%以上高速化。料金・ベンチ・使いどころを整理する。
Claude Opus 5.5が来た — 40%安く、30%速く、そして「推論を盗ませない」新しい防御
AnthropicがClaude Opus 5.5を公開。Opus 5比で実行コスト40%減・出力30%高速化に加え、蒸留を防ぐ「preserved thinking」を搭載。ベンチ・料金・使いどころを整理する。