【2026年8月】Grok Voice Think Fast 2.0が音声AI指数で首位|API導入のポイント解説
2026.09.10
2026年8月24日、Grok Voice Think Fast 2.0が音声AIの総合指数で首位になったと報じられました。
評価元はArtificial AnalysisのSpeech-to-Speech Indexです。 同モデル自体は7月29日に公開されました。つまり、今回は新製品の発表ではなく、公開後の評価結果がニュースです。 現在の指数ページでは79.0%です。音声推論、タスク成功、エージェント性能などをまとめた値です。 一方で、発売時の公式発表には82.9%という別の数値があります。 この差は見落とせません。指数の構成と更新時点が異なるためです。 さらに、首位でも複数工程の成功率は56.5%にとどまります。 音声APIとして何が変わったのでしょうか。数字の読み方、料金、実装時の注意点を解説します。
CONTENTS
Grok Voice Think Fast 2.0は7月29日に公開
SpaceXAIは7月29日、Grok Voice Think Fast 2.0を発表しました。 公式説明では、知能、文字起こし精度、会話能力を改善した次世代モデルです。 また、ツール利用の信頼性も重点項目に挙げました。 Speech-to-Speechは、利用者の音声を受けて音声で返す方式です。 一般的な構成では、音声認識、言語モデル、音声合成を別々に接続します。 一方で、Grok Voice Think Fastは会話しながら推論する設計を掲げます。 そのため、返答を始めるまでの待ち時間を抑えながら、外部ツールも呼び出します。 公式発表では、2.0の初回音声までの時間は0.70秒です。 1.0の1.25秒から0.55秒短縮しました。 さらに、推論トークンの中央値は旧版を1.0とした場合に0.4倍です。 つまり、使用量を約60%減らしたとの説明です。 ただし、この効率値はSpaceXAIが示した本番環境の集計です。 すべての会話や通信環境で0.70秒になる保証ではありません。
8月24日の首位報道は79.0%
Crypto Briefingは8月24日、同モデルがArtificial Analysis指数で首位になったと報じました。 現在の公式指数ページでも、Grok Voice Think Fast 2.0 Highは79.0%です。 音声推論は97%、タスク成功率は94.7%でした。 また、複数工程を実行するエージェント性能は56.5%です。 Artificial Analysisは現在、四つの要素を同じ重みで指数化しています。 音声推論、エージェント性能、利用者の選好、タスク成功率です。 そのため、特定の会話能力だけが高くても総合点は決まりません。
| 指標 | Think Fast 2.0 | 読み方 |
| 現行Speech-to-Speech Index | 79.0% | 4要素の総合値 |
| 音声推論 | 97% | 音声で出された推論課題 |
| タスク成功率 | 94.7% | 指示された会話タスクの達成 |
| エージェント性能 | 56.5% | ツールを伴う顧客対応シナリオ |
| 初回音声まで | 0.70秒 | 短いほど応答開始が速い |
なお、発売時の公式比較表は「Overall AA Speech-to-Speech Quality Index」を82.9%としていました。 当時はThink Fast 1.0が75.7%、GPT-Realtime-2.1 Highが79.1%です。 一方で、現在のArtificial Analysisページは利用者選好などを含む79.0%を掲載しています。 したがって、82.9%から79.0%へ単純に性能低下したとはいえません。 名称、構成要素、取得日をそろえずに二つの値を比較できないためです。 首位の表現は8月24日の報道と現行ページに基づきます。
強みは速度と会話の両立
電話や音声案内では、正答率だけでなく間の長さが重要です。 応答開始が遅いと、利用者は通信が切れたと考える場合があります。 そのため、0.70秒という値は実用上の分かりやすい強みです。 ただし、Artificial Analysisの現行ページでは最速ではありません。 Deepslate Opalは0.44秒、Gemini 2.5 Flash系は0.63秒です。 つまり、Grokは速度単独で首位なのではありません。 音声推論やタスク成功を含めたバランスで総合首位になっています。 会話の割り込みや重なりを見るFull Duplex Benchは95.1%でした。 1.0の77.8%から大きく伸びています。 一方で、発売時の比較表ではGPT-Realtime-2.1 Highが95.7%でした。 そのため、すべての個別項目を上回ったわけではありません。 文字起こしについて、SpaceXAIは24言語の短文を評価しました。 そして、Think Fast 1.0より1.4倍改善したと説明しています。 騒音と電話圧縮にも強いとしていますが、これは自社評価です。 導入先の言語、方言、マイク、回線で再検証する必要があります。
エージェント性能56.5%は弱点も示す
エージェント性能のτ-Voiceは、顧客対応の模擬シナリオを測ります。 たとえば、注文を確認し、規則を調べ、ツールを呼び出して返答する流れです。 Think Fast 2.0の56.5%は、比較表では高い値でした。 ただし、絶対値で見れば約43.5%のシナリオを解決できていません。 つまり、自然に話せることと、業務を最後まで完了できることは別です。 予約変更、返金、本人確認には例外処理があります。 また、利用者が途中で条件を変える場合もあります。 そのため、本番では人への引き継ぎ、確認画面、操作上限が必要です。 さらに、ツールの戻り値が欠けた際に勝手に補わない設計も重要です。 ベンチマーク首位を理由に、無監督で全通話を任せるのは早計です。 まず、FAQや営業時間案内など、失敗時の影響が小さい範囲から測ります。 次に、注文照会など読み取り中心の処理へ広げます。 最後に、変更や決済など書き込み処理を人の承認付きで試す流れが安全です。
音声APIはWebSocketで接続する
開発者はSpeech-to-Speech APIをWebSocketで利用します。 接続先はxAIのRealtime APIです。 モデルIDはgrok-voice-think-fast-2.0です。 また、grok-voice-latestという追従型の別名もあります。 8月5日、この別名は1.0から2.0へ切り替わりました。 そのため、別名を使う既存アプリはコード変更なしで挙動が変わる可能性があります。 再現性が必要な検証では、2.0のモデルIDを固定する方が明確です。 一方で、常に新しいモデルへ追従したい場合はlatestを選べます。 APIはFunction Callingに対応します。 さらに、Web検索、X検索、Collections、MCP、独自関数を利用できます。 つまり、音声だけを生成するTTSとは異なります。 会話を理解し、在庫確認や予約照会を行い、その結果を音声で伝えるAPIです。 ただし、検索ツールや外部システムの権限は開発者側で制限する必要があります。
料金は音声1分0.08ドル
公式料金は、送受信する音声1分当たり0.08ドルです。 1時間では4.80ドルになります。 また、音声を伴わないテキスト入力イベントは1件0.004ドルです。 旧Think Fast 1.0の音声料金は1分0.05ドルでした。 したがって、別名の自動移行では単価も60%上がります。 10分の通話なら音声部分は0.80ドルです。 ただし、電話回線、録音、外部ツール、監視基盤の費用は別です。 また、会話が長引けばそのまま音声費用が増えます。 導入判断では、1分単価より完了した問い合わせ1件の総費用を測ります。 途中離脱、人への転送、再入電も含める必要があります。 テキストモデルの進化は「Grok 4.5の解説」をご覧ください。 https://xtep.tools/news_blog/5322 また、開発主体の名称変更は「SpaceXAIへのリブランディング」で整理しています。
よくある質問(FAQ)
Grok Voice Think Fast 2.0の指数は82.9%と79.0%のどちらですか?
発売時の公式比較表は82.9%でした。一方で、8月24日の報道と現行Artificial Analysisページは、構成を更新した指数として79.0%を掲載しています。
総合首位なら業務をすべて自動化できますか?
できません。エージェント性能は56.5%で、複数工程の失敗が残ります。人への引き継ぎと操作権限の制限が必要です。
既存のgrok-voice-latestは変更が必要ですか?
8月5日に2.0へ自動移行しました。新モデルを使うだけなら変更不要ですが、挙動と料金を固定したい場合は明示的なモデルIDを使います。
まとめ
- Grok Voice Think Fast 2.0は7月29日に公開され、8月24日にArtificial Analysisの音声総合指数首位と報じられた
- 現行指数は79.0%で、発売時の82.9%とは構成と取得時点が異なる
- 初回音声まで0.70秒、音声推論97%、タスク成功率94.7%が強み
- エージェント性能は比較上高い56.5%だが、無監督の業務自動化には不十分
- API料金は音声1分0.08ドルで、latestの別名は8月5日に2.0へ切り替わった
一次情報はSpaceXAIの発表とArtificial Analysisの指数ページです。
【今だけ!!】7日間、無料でXTEPの全ての機能をお試しいただけます!!
X(旧Twitter)の自動DM・自動リプライ・抽選キャンペーンなら、Xチャットボット「XTEP」をご活用ください。導入はこちら(7日間無料)▷ https://xtep.tools/lp 【今だけ!!】通常月額22,000円(税込)の利用料が、7日間は無料で全ての機能をご利用いただけます。トライアル中に解約すれば費用は発生しません。ぜひこの機会にお試しください。
機能例
- オートDM/オートリプライ(いいね・リポスト・フォロー・リプライ・ハッシュタグ等)
- シークレットリプライ/固定リプライ
- 抽選(即時DM型・後日抽選・web遷移型)
- デジタルギフト配布/プレゼント用URL管理
- 予約投稿/Threads同時投稿/ステップ配信
- 成功事例ギャラリー など
XTEPはXの公式APIを利用し、開発者ポリシーや自動化ルールに準拠する形で設計・開発されています。そのため、非公式ツールを利用する場合とは異なり、XTEPを利用していること自体が理由となってアカウントが凍結されることはありません。 ※ XTEPは、Xの利用規約、開発者ポリシー、および自動化ルールに準拠する形でのみ動作するよう設計されています。ただし、XTEPを利用しているかどうかに関わらず、ユーザー様ご自身の投稿内容や運用方法がXの規約に違反した場合(例えば、スパム行為、過度な自動化、ハラスメントと見なされるDM送信など)は、当然ながらX社による凍結の対象となります。 操作ガイドはヘルプセンター、最新情報はXTEPブログもあわせてご確認ください。 メタディスクリプション:
今だけ!!
ご利用いただけます!
-
01
平均インプレッションが100倍、
フォロワー数は5倍伸びる -
02
リスト獲得効率、売上が伸びる
-
03
オートDM、オートリプライ機能により
双方向のコミュニケーション活性化 -
04
今まで平均50万程かかっていた
抽選キャンペーンが使い放題 -
05
5分で導入可能!操作も簡単!
自動返信で顧客の
エンゲージメントアップ!