文字起こしAPIを1時間15円に — Grok Voice Transcribe 2の「精度2倍」はどこまで信じていいか
文字起こしAPIを選ぶとき、いつも同じジレンマにぶつかる。精度で選ぶと料金が跳ね上がり、料金で選ぶと精度が物足りない。会議の議事録やコールセンターのログを大量に処理したい人ほど、この「精度とコストのシーソー」に悩まされてきたはずだ。
そこにxAIが9月18日、Grok Voice Transcribe 2.0を出してきた。触れ込みは「1.0の2倍の精度を、同じ価格で」。しかもその同じ価格というのが、バッチ処理で音声1時間あたり0.10ドル。日本円にして15円前後(1ドル150円換算)だ。この数字を見て、まず「安すぎないか?」と身構えた。安いものには理由があるのが常だからだ。
この記事では料金・精度・機能の3点を競合と並べて眺めていく。結論を先に言えば、これは英語圏の音声処理をやる人にはかなり効くカードだが、日本語ユーザーには一つ大きな留保がつく。
そもそもGrok Voice Transcribeとは何か
Grok Voice Transcribeは、xAIが提供する音声認識(STT: Speech-to-Text)のAPIだ。ChatGPTのようなチャットのGrokとは別物で、こちらは「音声を文字に起こす」一点に特化した裏方のサービスにあたる。GUIのアプリではなく、開発者が自分のプロダクトに組み込むための部品だと考えるといい。
今回の2.0はそのモデルを刷新したバージョンだ。xAIによれば、実世界の評価全般で1.0の約2倍の精度になったという。ノイズの多いライブ音声や多言語の録音でトレーニングし、後処理で磨いたと説明している。ポイントは、この精度向上に対して料金を1.0から一切上げていないことだ。普通は新モデルなら値段も上がる。それをやらなかったのは、xAIが音声APIの価格そのものを競争の武器にしにきている証拠に見える。
料金 — 「安い」の中身を分解する
料金体系はシンプルで、課金は音声の長さ(時間)に対してかかる。
| モード | 料金(1時間あたり) | 日本円換算(1ドル150円) |
|---|---|---|
| バッチ(録音済み音声) | 0.10ドル | 約15円 |
| ストリーミング(リアルタイム) | 0.20ドル | 約30円 |
しかも、後述する話者分離・タイムスタンプ・キー用語指定といった機能は追加料金なしで込みになっている。文字起こしAPIは「基本料金は安いが、話者分離をオンにすると割増」というパターンが多いので、全部込みでこの値段というのは地味に効く。
比較の目安として、公開されている料金ベースでざっくり並べると、OpenAIのWhisper APIは音声1分0.006ドル、つまり1時間で0.36ドル(約54円)ほど。Grokのバッチはそのおよそ3分の1だ。Deepgramの主力モデルも1時間0.25ドル前後で、やはりGrokの方が安い。ストリーミングでも0.20ドルは相当踏み込んだ価格で、KuCoinなどは「OpenAIの5分の1」と報じている。
ただし安さの比較には注意も要る。Whisperはオープンソース版を自前のGPUで動かせば料金そのものはゼロだ(その代わりサーバー費と運用の手間がかかる)。Geminiのように音声をトークン単位で課金するモデルは、そもそも「1時間いくら」という同じ土俵で比べにくい。だから「Grokが最安」と一言で片付けるのは雑で、正しくは「マネージドAPIを時間課金で使うなら、現状かなり安い部類」というのが実際のところだ。
「精度2倍」はどこまで本当か
一番気になるのが精度の主張だ。マーケティングの「2倍」は割り引いて聞く癖がついているので、根拠となる数字を見ていく。ここで使われるのはWER(Word Error Rate、単語誤り率)で、低いほど良い。
xAIが挙げている改善幅は、たとえば8kHzの電話音声でWERが10.6%から7.1%へ、会話音声で8.7%から3.3%へ。多言語の短いフレーズ(19言語)では20.6%から6.8%へと大きく下がっている。電話番号やメールアドレスといった「聞き間違えると致命的な情報」の誤りも7.2%から3.2%に減ったという。
外部の裏付けもある。第三者ベンチマークのArtificial Analysisは、ストリーミング精度のリーダーボード(AA-WER Streaming)でGrok Voice Transcribe 2.0を32モデル中トップと評価し、発話終了から0.49秒後の時点でWER 2.7%という数字を出している。自称の「2倍」だけでなく、独立系の指標でも一位を取っているのは素直に評価していい。
ただ冷静に見れば、会話音声の8.7%→3.3%のような伸びは「多言語や騒がしい環境がもともと弱かったのが、まともになった」という側面も大きい。もとが悪ければ改善幅は大きく出る。だから「静かな環境で1話者を録っただけ」のようなイージーな条件で劇的に変わるかというと、そこは過度に期待しない方がいい。効いてくるのは、電話・会議・多言語といった現実のノイジーな音声だ。
主要機能 — 「全部込み」の中身
このモデルが面白いのは、文字起こしの周辺機能を一通り抱えている点だ。主なものを挙げる。
- 単語ごとのタイムスタンプ:各単語に開始・終了時刻と信頼度スコアが付く。動画字幕の同期や、特定発言の頭出しに使える
- 話者分離(ダイアライゼーション):誰が話したかをラベル付け。会議の議事録で「Aさんの発言」を切り分けられる
- 最大8チャンネルの同時処理:ステレオ通話や複数マイクの音源をチャンネルごとに独立して起こせる
- キー用語バイアス:1リクエストにつき最大100語まで、製品名や専門用語をあらかじめ渡して認識精度を上げられる
- フィラー除去:「えー」「あのー」のような言い淀みを自動で落とす
- スマートターン検出:話者が話し終わったタイミングを検知する。音声エージェント向けの機能
- 書式整形:数字・日付・通貨・電話番号・メールアドレスを、書き言葉の形で返す
単体では地味だが、組み合わせると効いてくる。キー用語バイアスと話者分離を同時に使えば、社内用語だらけの商談を「誰がどの製品名に言及したか」まで構造化できる。スマートターン検出とストリーミングを組み合わせれば、電話にリアルタイムで応答する音声エージェントの土台になる。1時間30円でこの土台が手に入るなら、「精度が微妙だから」と見送っていたリアルタイム系のアイデアを机に載せ直す価値は出てくる。
Whisper・Deepgram・Geminiのどこに座るのか
では既存の選択肢の中で、Grok Voice Transcribe 2はどこに位置するのか。
Whisper(OpenAI)は事実上の業界標準で、オープンソース版を自前で動かせるのが最大の強み。オフライン処理や機密データを外に出したくない用途では今も第一候補だ。ただ素のWhisperは話者分離やリアルタイム処理を標準では持たず、そこは自分で足す必要がある。日本語の実績が厚いのも見逃せない。
Deepgramはリアルタイムと話者分離に強く、コールセンターなどエンタープライズ用途での採用が多い。機能面ではGrokと最も近い競合で、ここは純粋に価格と精度の勝負になる。
Gemini(Google)はそもそも音声認識専用ではなく、マルチモーダルLLMの一機能として音声を扱う。長い音声の要約や、文字起こしと同時に内容を分析させるような「文字起こしのその先」を一気にやりたいなら選択肢になるが、単純な文字起こしのコスト効率では専用APIに分がある。
こう並べると、Grok Voice Transcribe 2の立ち位置ははっきりする。**「Deepgram級の機能一式を、Whisper API以下の価格で、しかもストリーミング精度は一位」**という、コストパフォーマンスで殴りにきているポジションだ。マネージドで手早く、かつ安く音声処理を組み込みたい開発者には、かなり刺さる。
日本語対応は、正直まだ不透明
ここが日本のユーザーにとって最大の注意点だ。xAIは「数十の言語に対応し、言語を自動検出し、録音の途中で言語が切り替わっても一度の処理で追従する」と説明している。多言語がこのモデル最大の改善点だとも言っている。
ただ、公式が精度を示した多言語ベンチマークは19言語の短フレーズ評価で、その中に日本語が明示的に含まれているという記述は現時点で確認できない。「数十言語対応」の中に日本語が入っている可能性は高いが、xAIが日本語のWERを公表しているわけではない。
これは正直に受け止めておくべきだ。英語や電話音声で見せたあの精度が、日本語でそのまま出るとは限らない。日本語の文字起こしが主目的なら、現段階では過度な期待は禁物で、実際に自分の音声データで試してから判断するのが安全だ。日本語実績の厚いWhisper系や、日本語UIの整った国産の文字起こしサービスと比較検討したうえで、Grokは「英語や多言語が混ざる案件で試す一枚」として持っておく、くらいの温度感が現実的だろう。
結局、誰のためのツールか
Grok Voice Transcribe 2が最も活きるのは、英語や多言語が中心のコールセンター・音声エージェント・大量バッチ文字起こしを、APIで安く組み込みたいケースだ。ストリーミング精度が一位という強みがそのまま効いてくる領域で、1時間15〜30円という価格は、これまでコストで諦めていた規模の処理を現実的にする。逆に、日本語オンリーの議事録を今すぐ確実に回したい人や、コードを書かずGUIで完結させたい人、機密音声を外に出せずローカル処理が必須の人には、今のところ第一候補にはなりにくい。GUIが欲しいならNottaのような完成品サービス、ローカル処理ならセルフホストのWhisperの方が素直だろう。
筆者の評価
正直に言えば、これは音声APIの価格破壊として素直に面白い。性能を上げて値段を据え置く、というのは言うほど簡単ではなく、xAIが音声インフラの土俵で本気を出してきた証拠に見える。独立系ベンチマークで一位を取っている以上、「安かろう悪かろう」ではないのも確かだ。
一方で、日本語の扱いが公式に語られていないのは、日本のメディアとしては素通りできない弱点だ。ここが「数十言語対応です」の一言で片付けられている限り、日本語主体のユーザーが飛びつくにはまだ材料が足りない。英語・多言語の案件を持っている開発者なら今すぐ触る価値があるし、日本語勢は自分のデータで一度試して、公式が日本語の数字を出すのを待つ。それが今の妥当な距離感だと思う。
関連記事
xAI Voice Agent Builder公開 — Grok Voiceで音声エージェントをノーコード構築、$0.05/分
xAIがGrok Voiceベースの音声エージェント構築ツール「Voice Agent Builder」をベータ公開。ノーコード、$0.05/分。競合との違いを整理する。
Grokが「毎回同じ説明をする」問題を解決した — Skills機能で何が変わるのか
Grok Skillsの全容。ワークフローの作り方、標準スキル、ChatGPTとの違い、料金を整理した。
車のダッシュボードがAIの激戦区になった — GrokがCarPlayに3番目のAIとして乗り込む
GrokがCarPlayに参入準備中。ChatGPT・Perplexityに続く3番目のAI。車内音声AI3社の特徴と選び方を整理。