Gemini Live API で音声エージェントを作る場合、音声の有料単価は入力 1 分あたり $0.005、出力 1 分あたり $0.018 です。2026 年 9 月 21 日現在、公式料金表には Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking が同じ表に掲載されています。
Google は 9 月 15 日の公式発表で、会話中のバックグラウンド処理や多段階の推論を紹介しました。開発を発注する側が次に知りたいのは、自社の通話量でいくらになるか、長時間の応対を継続できるか、既存実装をどこまで変更するかでしょう。
本記事は 2026 年 9 月 21 日時点の一次情報を照合した仕様整理です。AI Studio での実機試験は行っていません。後半の検証項目は FIXIT の設計提案であり、音声エージェントを運用した実績値ではありません。
Gemini 3.8 Live と Extended Thinking は、任せる仕事で選ぶ
Gemini Live API は、音声などの入力を送りながら応答を受け取る双方向の API です。Overviewでは、状態を持つ WebSocket 接続を使うと説明されています。録音後の一括処理を扱うローカル文字起こしの記事や、読み上げを生成する Irodori-TTS の記事とは、対象とする処理が異なります。
モデル一覧では、3.8 Live の両モデルは Stable です。旧モデルの gemini-3.1-flash-live-preview は Legacy と説明され、3.8 Live への更新が推奨されています。Gemini API と Google AI Studio から利用できますが、Gemini Enterprise 経由での提供は発表上プライベートプレビューです。提供経路を混同しないでください。
Thinking の公式比較をもとに、選定と実装に関わる差を並べます。
| 比較する項目 | 標準版 | Extended Thinking |
|---|---|---|
| モデル ID | gemini-3.8-live | gemini-3.8-live-extended-thinking |
| 主な用途 | 一次受付、直接的な指示、高速なツール処理 | 多段階の問題解決、複数 API を使う計画・照会 |
| 推論 | 遅延特性が固定された interleaved reasoning | 会話と並行するバックグラウンド推論 |
| 推論レベル | thinking_level 非対応 | low / medium / high。MINIMAL 非対応 |
| ターン終了 | turnComplete: true で待機へ戻る | 発話の終了と処理全体の終了を分ける |
| 処理中の相づち | ツールの完了を待ってから発話 | 推論・処理中にも中間の発話を送信 |
| ツール宣言 | BLOCKING / NON_BLOCKING に対応 | NON_BLOCKING が必須 |
問い合わせの分類や、短時間で結果を返す在庫照会なら標準版から検証できます。複数の予約先を照会して条件を比較する場合や、数秒かかる処理の間も進捗を伝えたい場合は Extended Thinking が候補です。標準版は非同期の関数実行が既定で、BLOCKING も指定できます。ただし、推論中の相づちまで同じ挙動とは見なせません。
将来のモデル変更を見込むなら、会話状態を扱う処理と、予約・検索などの業務処理を分離して見積もることを勧めます。成果物の所有権や引き継ぎ条件は、ベンダーロックインを避ける発注設計も参照してください。
Gemini Live API の料金を、自社の通話量で概算する
次表は公式料金ページの有料枠を、2026 年 9 月 21 日に確認したものです。金額は USD の公表単価で、円換算や税額は含めていません。標準版と Extended Thinking、旧 3.1 Flash Live Preview は同じ料金表に載っています。
| 課金対象 | 100 万トークンあたり | 公式に掲載された分換算 |
|---|---|---|
| 入力テキスト | $0.75 | — |
| 入力音声 | $3.00 | $0.005 / 分 |
| 入力画像・映像 | $1.00 | $0.002 / 分 |
| 出力テキスト | $4.50 | — |
| 出力音声 | $12.00 | $0.018 / 分 |
音声部分の概算は「入力音声の分数 × $0.005 + 出力音声の分数 × $0.018」です。入力 60 分・出力 30 分と仮定すると、計算は次のとおりです。
60 × $0.005 + 30 × $0.018 = $0.84これは仮定に基づく音声部分の計算例で、1 時間の通話の総額や実測値ではありません。通話時間をそのまま入力・出力の両方に代入せず、実際に送受信する音声量を見積もります。出力料金には思考トークンも含まれるため、Extended Thinking の総額を音声の分数だけで確定しないでください。
テキスト、映像、検索、電話回線や周辺基盤の費用も別に集計してください。Google 検索グラウンディングは Gemini 3.x 全体で月 5,000 リクエストを無料で共有し、超過分は 1,000 リクエストあたり $14 です。無料枠と有料枠では、送信したデータを製品改善に利用する条件も異なります。この条件は「社内審査では、認証とデータの扱いを先に決める」で扱います。
同じ単価でも、回答の長さや処理の反復で月額は変わります。予算を見積もる際は「通話件数」だけでなく「業務を完了した 1 件あたりの総費用」も確認しましょう。計測の考え方は LLM アプリのコスト最適化で扱っています。
ベンチマークは「1 位」の対象と差を確認する
Google が紹介した Speech to Speech Quality Index は、正答率ではなく合成指数です。Artificial Analysis のページでは、現在「AA-Speech to Speech Index」という名称で表示されています。Artificial Analysis の評価方法と結果では、音声推論 (Speech Reasoning)、エージェントとしての処理能力 (Agentic Performance)、利用者の好み (Arena Preference)、タスク成功率 (Task Success Rate) の 4 指標を等加重で平均しています。対象は必要な評価結果がそろったモデルです。
2026 年 9 月 21 日に同ページを確認した比較を示します。0〜100 のインデックス値であり、数値に % は付けません。
| 順位 | モデル・設定 | 指数 |
|---|---|---|
| 1 | Gemini 3.8 Live Extended Thinking (High) | 82.6 |
| 2 | GPT-Live-1 (Astra, medium) | 81.5 |
| 3 | Grok Voice Think Fast 2.0 High | 81.3 |
| 4 | GPT-Live-1 (Sol, low) | 80.1 |
| 5 | Gemini 3.8 Live | 76.0 |
1 位と 2 位の差は 1.1 ポイントです。「Gemini 3.8 Live が 1 位」とだけ説明すると、標準版と Extended Thinking の High 設定を取り違えます。合成指数の差を、日本語の予約受付が成功する確率の差へ読み替えることもできません。
また、Google の発表記事の 9 月 17 日更新版では、Extended Thinking の τ-Voice が 68.6%、Sierra の τ-Voice-banking が 35.1%、Big Bench Audio が 97.7% と報告されています。標準版の Speech Agent Arena 2 位という記載もありますが、上表の総合指数とは別の評価です。
発注前の検証では、予約内容の正確さ、利用者が話し始めたときの応答停止、人間への引き継ぎを自社の会話例で測ります。ベンチマークの測定条件を読む考え方は GPT-6 Astra の解説にも共通します。ただし GPT-6 Astra は、上表の GPT-Live-1 を解説した記事ではありません。
長時間通話は、セッションと接続を分けて設計する
音声だけで 15 分話せるとしても、1 本の接続が 15 分間続くという意味ではありません。セッション管理の公式ガイドでは、次の制約が別々に説明されています。
| 管理する対象 | 公式の制約 | 実装で対応すること |
|---|---|---|
| 圧縮なしの音声セッション | 15 分 | contextWindowCompression で圧縮を設定 |
| 圧縮なしの音声・映像セッション | 2 分 | 映像入力を含めた圧縮と会話継続を検証 |
| WebSocket 接続 | 約 10 分 | GoAway を扱い、接続を再開 |
| セッションの再開トークン | 最後のセッション終了から 2 時間有効 | 最新のトークンを保持し、sessionResumption で再開 |
圧縮は会話を長く続けるための処理、再開は接続が終了した後もセッションを引き継ぐための処理です。片方の設定だけで両方の制約が解消するわけではありません。
コンテキスト上限も、一律 32k と書くと誤解を招きます。Capabilitiesの区分は、native audio output モデルが 128k、それ以外の Live API モデルが 32k です。一方、3.8 Live の個別仕様と Extended Thinking の個別仕様には、いずれも入力上限 131,072・出力上限 65,536 トークンと明記されています。共通ガイドの 32k を両モデルの入力上限として転記しないでください。
設計上は、予約日時や利用者が確定した条件を業務システム側で保持することを勧めます。長い会話を圧縮した後にも必要な値を確認でき、再接続時に同じ予約を二重に登録しないためです。PoC では接続終了をまたぐ会話と、外部 API の応答待ちに切断する場面を検証対象にします。
FIXIT話せる時間を延ばせば、長い電話にもそのまま使えるの?
Dodai会話を延長しても、接続は約 10 分で終了します。再接続で予約処理が重複しない設計が必要です。
レート制限と同時セッション数の具体値は未確認です。本番の受電数を確約する前に、公式のレート制限案内から利用プロジェクトの上限を確認し、ピーク時の同時通話数と照合してください。
移行では、モデル名と会話終了の判定を別々に確認する
gemini-3.1-flash-live-preview から標準版へ移る場合、公式の移行説明は、モデル文字列の変更と thinking_level または thinking_config の除去を示しています。ターンの進行と turnComplete の信号は同じです。
ただし、標準版のモデルページでは非同期の関数実行が既定と説明されています。同期処理を維持したいツールには behavior: "BLOCKING" を明示する案内があります。変更箇所が少なくても、既存のツール宣言と応答順序は回帰確認の対象です。
Extended Thinking では、短い相づちの後も推論やツール処理が続くため、turnComplete: true を受けて待機状態へ戻す実装を変更します。確認箇所は次のとおりです。
interaction_statusがIN_PROGRESSなら処理中、IDLEになってから待機として扱う- すべての関数宣言に
behavior: "NON_BLOCKING"を設定する - 推論レベルを
low/medium/highから設定し、応答品質と費用を測る
上記の識別子は公式説明の表記です。JavaScript の掲載例では interactionStatus・thinkingConfig・thinkingLevel となるため、採用する SDK の形式にそろえてください。Extended Thinking に同期のツールを宣言するとエラーになると、同ガイドに明記されています。
非同期ツールの結果をいつ発話へ反映するかは、ツール利用ガイドの scheduling で指定します。次表の右列は業務への適用例です。
| 値 | 結果の扱い | 検討する場面 |
|---|---|---|
INTERRUPT | 現在の処理を中断して結果を知らせる | 受付不能など、直ちに伝える必要がある結果 |
WHEN_IDLE | 現在の処理が終わってから知らせる | 案内中に届いた追加の検索結果 |
SILENT | 直ちに発話せず、後の会話で利用する | 補助情報の取得結果 |
なお、標準版のモデルページには INTERRUPTED という表記もあり、ツール利用ガイドの INTERRUPT と一致していません。本記事の表はツール利用ガイドに合わせていますが、実装時は利用する SDK の定義も照合してください。
発注範囲には、結果の通知だけでなく失敗時の扱いを含めましょう。たとえば予約 API が応答しない場合に再試行するのか、人間へ引き継ぐのかを決め、結果未確定のまま予約完了と読み上げないことを合格条件にします。
日本語は対応一覧にあるが、言語数は資料間で一致しない
2026 年 9 月 21 日時点で、Google 自身の資料に異なる言語数が掲載されています。確認できた数字を出典ごとに示します。
| 出典 | 記載された言語数 |
|---|---|
| Gemini 3.8 Live の公式発表 | 97 |
| Live API Overview | 70 |
| Live API Capabilities | 99 |
Capabilities の対応表には Japanese (ja) があります。ただし、言語数の違いが更新時差なのか、対象範囲の違いなのかは確認できていません。社内資料では出典と確認日を添え、数字を 1 つに統一して断定しないでください。
日本語対応の記載だけで、電話越しの固有名詞や住所、数字の復唱まで保証されるわけではありません。予約受付なら「日時の訂正」「人名の聞き返し」「利用者が途中で話し始める場面」を評価用の会話に含めることを提案します。
社内審査では、認証とデータの扱いを先に決める
Live API の認証は既定ではサーバー間向けです。バックエンドから接続する構成なら、API キーはバックエンドに保持します。ブラウザやモバイルから直接接続する場合は、ephemeral token の公式ガイドに沿って短命のトークンを発行する構成にしてください。
クライアントはまず自社のバックエンドで認証し、バックエンドが取得したトークンを受け取って Live API に接続します。既定値と意味は次のとおりです。
| 設定 | 既定値・指定例 | 意味 |
|---|---|---|
newSessionExpireTime | 発行から 1 分 | 新しいセッションを開始できる期限 |
expireTime | 発行から 30 分 | 接続でメッセージを送信できる期限 |
uses: 1 | 1 セッション | 新規セッションの開始回数を制限 |
30 分は接続が維持される保証ではありません。約 10 分ごとの再接続には sessionResumption を使い、同じセッションの再開は uses: 1 でも可能と説明されています。ephemeral token 自体は公式ガイド上 Preview なので、モデルの Stable 表記とは別に審査してください。
FIXITブラウザから直接つないだほうが、作りは簡単じゃないの?
Dodaiまず壊れ方から考えます。API キーを画面側に置くと、流出したときに止められません。
料金表のデータ利用欄では、無料枠で送信したデータは製品改善に利用され、有料枠で送信したデータは利用されないと区分しています。機密情報や顧客の音声を無料枠へ送る前に、入力可能なデータの範囲を決めてください。有料枠の「製品改善に利用しない」を、ログの保存や自社側の情報管理が不要という意味には扱えません。
入力の分類や監査ログを整理する観点は、生成 AI の情報漏洩対策で扱っています。構成の審査や運用ルールを具体化する場合は、セキュリティコンサルティングもご利用ください。
Google は生成音声に SynthID の電子透かしを付与すると公式発表で説明しています。電子透かしの存在と、通話相手へ AI 応対をどう案内するかは別の設計事項です。
発注前に、PoC の合格条件と本番の運用範囲をそろえる
ボイスボット SaaS と独自開発を比べる場合、API 単価だけでは判断できません。既存契約の通話課金、ピーク時の同時接続数、保守に使う人の時間を、自社の条件で並べる必要があります。本記事では競合の音声 API 単価と他社 SaaS の契約条件を一次確認していないため、価格の優劣や倍率での比較は行いません。
音声エージェントの見積もりでは、会話の品質に加えて次の作業を確認してください。
- 再接続時に会話と業務処理を引き継ぎ、処理の重複を防ぐ
- 利用者の割り込みやツールの遅延・失敗に応じて、発話を停止・再開する
- 通話ログの保存範囲と閲覧権限を決め、人間への引き継ぎに必要な情報を残す
- 許容する応答時間、誤案内、総費用の基準を決め、継続して評価する
まず予約受付などの対象業務を絞り、会話の開始から業務完了までを評価します。手順と評価設計は AI エージェントの PoC の進め方を参照してください。未確認の同時セッション上限と、日本語の実測品質が判明するまでは、本番の対応件数を確約する段階には進めません。
AI 駆動開発のクリエイティブスタジオである FIXIT の AI エージェント開発は、PoC 300 万円〜、本格運用 800 万〜1,800 万円 (税抜) が公開の目安です。サービス全体では PoC は 3 週間でも可能、本格運用まで 6〜10 週間と案内していますが、Gemini Live API による音声案件の確約値ではありません。接続基盤、外部連携、審査、評価の範囲を確認して個別に見積もります。
検討を始める際は、想定する通話量、対象業務、接続するシステム、保存してよい音声・ログの範囲をお持ちください。お問い合わせでは、モデルの選定から PoC の合格条件、本番運用の設計までご相談いただけます。



