Google AI Studioの音声生成|Gemini 3.8 TTSの選び方

Google / Gemini
ページの位置 未計測

Google AI Studio・音声生成

台本と声を選び、音声を残す

読了時間の目安

しっかり読む
約23分
要点を読む
約15分

文字量と図表からの目安です。操作・実践・X投稿の閲覧時間は含みません。

Google AI Studioでは、利用条件を満たす場合、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSで日本語の台本から読み上げ音声を作れます。用途別の判断表でモデルと声を選び、無料枠・API料金・完成音声と声設定の保存条件を確認できます。音声生成の公式ガイド・利用条件(2026年9月26日確認)。

本記事では、利用条件を満たすことを確認し、公開可能な短い台本と既成音声で最初の1本を作ることを勧めます。モデルと利用枠を決めたら、台本と話し方を分けて入力し、生成音声を聞いてから保存します。初回制作の順序は本文内で確認できます。

現行のログイン後の画面操作は未確認です。公式資料で確認できる条件と、筆者が勧める確認順を分けて説明します。

  • 日本語の解説動画や案内のナレーションを業務で作りたい人
  • 無料枠・API料金と、音声・声設定の保存条件を整理したい人

Google AI Studioの音声生成は何を選ぶ?

Google AI Studioで音声を作る場合は、まず読み上げ・音声会話・文字起こしを分け、読み上げには制作目的と利用条件に合うGemini TTSのモデルと声を選びます。文章を読み上げた音声ファイルが欲しいなら、本記事のTTSが対象です。

読み上げ・音声会話・文字起こしを分ける

TTSとは、テキストを音声へ変換する仕組みです。会話の途中で相手へ応答する音声対話や、録音を文章へ変える文字起こしとは、入出力と目的が異なります。TTSと音声対話の違いを説明する公式ガイド

Google AI StudioはGoogleが提供する試作環境、Geminiはそこで利用するモデルの名称です。APIとは、プログラムから機能を呼び出す接続口のことで、Gemini APIの仕様をStudioのすべての画面操作へそのまま当てはめることはできません。Google公式のTTS発表

会話や文字起こしが目的だった場合は、Gemini・AI Studioの記事を目的から選ぶと、進む先を整理できます。

Flash TTSとFlash-Lite TTSはどちらを選ぶ?

無料枠で試せると確認できた場合は、画面で選べる対象のTTSモデルと既成音声から始めることを勧めます。有料APIで出力単価を優先するならFlash-Lite、演技や表現の調整を重視するならFlashを候補にします。後者は公式の用途説明とAPI単価を踏まえた筆者の提案で、日本語音質の実測順位ではありません(2026年9月26日確認)。無料枠と有料APIの掲載料金

対象はGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSです。両モデルは日本語に対応し、声を文章から設計するVoice designと、本人の録音から声を複製するVoice replicationにも対応しています。ただし、個々のStudio画面に表示されるモデルや機能は利用時点で確認してください(2026年9月26日確認)。Flash TTS公式モデル資料・Flash-Lite TTS公式モデル資料

Google AI Studio公式も、両モデルをXで紹介しています。紹介投稿で製品の位置づけを確認し、続く判断表で自分の制作目的に合うモデルと声を選びましょう。

公式X投稿:Gemini 3.8の音声生成モデルを紹介

Google AI Studio(@GoogleAIStudio)/

原文抜粋:“our most expressive audio generation models yet”

日本語訳:「私たちの音声生成モデルの中で、これまでで最も表現力豊かなモデル」

投稿の要約:Google AI Studio公式がGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを紹介した投稿です。クリエイター・開発者・企業による表現豊かな音声制作を用途に挙げ、Gemini APIとAI Studioで試せると案内しています。

日本語訳・要約は本記事によるものです。「最も表現力豊か」はGoogleによる製品紹介の表現で、本記事の日本語音質の実測評価ではありません。利用枠・料金・声の複製条件は、以下の判断表と各節の公式資料で確認してください。

日本語ナレーション制作の選択・開始判断表
対象:Gemini 3.8 Flash TTS/Flash-Lite TTS。2026年9月26日確認。モデルの選択は筆者の提案です。

全行に共通する利用条件:18歳以上で、対象地域とアカウントの利用条件を満たすこと。GoogleはStudioとGemini APIを、業務・ビジネス目的でGoogleのAIモデルを使って開発する開発者向けとし、一般消費者向け用途ではないと規定しています。組織の許可、入力データの条件、素材を使う権利も確認し、不明な条件があれば入力を保留します。利用目的・年齢・データ条件/対象地域/組織アカウントの利用条件

無料枠の試作では:画面で無料枠を利用できると確認できた対象モデルと既成音声を選びます。下の費用比較は有料APIの出力単価に基づきます。継続制作・本人の声の行は、制作目的の行と合わせて確認します。

表は横にスクロールできます。

制作目的 モデルの候補 声の選択 始める条件・保留する条件 次回へ残すもの
API従量課金の出力費用を抑える Flash-Lite TTS 既成音声 同じ出力トークン数で比較する場合の候補。課金プロジェクトと単価を確認し、不明なら保留 完成音声、台本、モデル名、選んだ声
演技・表現を調整する Flash TTS 既成音声、またはVoice design 声の印象と話し方を分けて指定。個別台本の品質は生成後に判断 完成音声、台本、演出指示、声の識別情報
同じ声で継続制作する 用途に合うFlash/Flash-Lite 既成音声、または保存した設計声 声の再利用方法を確認。APIの保存声には期限がある 完成音声に加え、声名・voice_id・作成日など
本人の声を使う Flash/Flash-Lite Voice replication 成人本人の参照録音・同意録音と提供条件を確認。同意不明なら開始しない 完成音声、声の設定、利用範囲と同意の記録
会話する・録音を文字にする TTSの選択から外れる この表では選ばない 音声対話/文字起こしの機能へ目的を切り替える 目的に応じて別途判断

出典:Flashの用途/Flash-Liteの用途/API料金/声の設計・保存/本人の声の複製条件

声を文章から作ることと、読み上げ方を指示することも別です。特定の声にこだわる理由がなければ、まず既成音声で台本を確かめると、確認する条件を絞れます。

音声生成は無料?料金と上限の確認

Google AI Studioの費用は利用する機能やAPIキーの課金設定によって変わるため、無料枠・サブスクリプション特典・API従量課金を分けて確認します。少量の試作でも、どの枠で実行するかを確認してから始めます(2026年9月26日確認)。Gemini API公式料金ページ・公式の課金説明

無料枠・サブスク・API課金を分ける

無料枠はありますが、「Studioだから、どの機能も常に無料」とは判断できません。両3.8 TTSモデルのStandardにはFree Tierがあり、Studioで有料機能へ有料APIキーをリンクした場合は、そのキーの利用が課金対象になります(2026年9月26日確認)。モデル別の無料枠・Studioと有料APIキーの課金条件

Google AI Pro/UltraにはStudioの利用枠に関する特典や条件付きのCloudクレジットがありますが、月額契約だけでGemini APIが使い放題になるわけではありません。TTSの枠を増やす目的で契約するなら、自分のアカウントに適用される特典を確認してから判断してください(2026年9月26日確認)。Google AIプランとStudioの公式説明

Google CloudのWelcome creditは通常の無料枠とは別です。公式課金資料では、現行の新規Welcome creditをGemini API/AI Studioへ利用できないと案内しています(2026年9月26日確認)。試用クレジットの適用条件

API料金の適用期間を確認する

API料金は入力テキストと出力音声を別々に数え、掲載された適用期間を合わせて確認します。トークンとは、モデルが情報を処理する単位です。日本語の文字数や音声の分数と同じ単位ではありません。

Gemini API・Standardの掲載料金
米ドル/100万トークン当たり。各セルは「入力テキスト/出力音声」。2026年9月26日確認。Studio全体の一律料金ではありません。

表は横にスクロールできます。

モデル2026年12月31日まで2027年1月1日からの掲載額
Gemini 3.8 Flash TTS$0.50/$9$1/$18
Gemini 3.8 Flash-Lite TTS$0.50/$6$1/$12

出典:Gemini API公式料金ページ

表の音声出力単価ではFlash-Liteが低いため、費用優先の試作候補にしています。この表はトークン単価の比較です。実際の費用は入力テキストと出力音声の使用量で変わり、無料枠で生成できる回数も、この単価表だけでは分かりません。

音声生成の利用上限を確認する

生成できる回数は全員共通の固定値ではなく、利用プロジェクト・モデル・利用階層によって確認する必要があります。APIの制限はプロジェクト単位で、現在の上限はStudioで確認するよう案内されています(2026年9月26日確認)。API利用上限の公式説明

筆者なら、モデル、無料・有料の区分、課金対象のプロジェクトを確認できた段階で小さく試します。上限の表示や請求条件を把握できないまま、連続生成や追加契約へ進むことは勧めません。

日本語の台本から音声を作るには?

Gemini 3.8 TTSのAPIでは、読み上げる文章と話し方の指示を別の項目に渡すため、Google AI Studio向けの入力も両者を分けて準備し、実際の画面で入力先を確認します。以下は、入力内容と確認順を整理した手順です(2026年9月26日確認)。Flash TTSの入力仕様・Flash-Lite TTSの入力仕様

音声生成の入口と利用条件を確認する

Google AI Studioの音声生成ページを開く前に、判断表の共通利用条件を確認してください。以下は筆者が勧める制作順です。現在のログイン後の画面は未確認のため、ボタン名・位置は断定しません。

  1. 利用条件と実行枠を確認する。アカウント・組織の許可、無料/有料の区分、入力データの扱いを確かめ、不明な条件があれば入力を保留します。
  2. 画面で選べるTTSモデルと声を決める。初回は既成音声を候補にします。本記事と異なるモデルなら、そのモデルの入力仕様を確認します。
  3. 台本と話し方を分けて用意する。下の2つの原文を使う場合も連結せず、画面でそれぞれの入力先を確認します。
  4. 生成して読み方を聞き直す。画面に表示される生成操作を確認して実行し、固有名詞・数字・文の区切り・指示文の混入を確認します。
  5. 音声を保存し、保存先で再生する。利用できる保存操作を確認し、完成音声と台本・声の設定を分けて残します。保存操作が見つからない場合は、手元への保存が完了したと判断しません。

画面が英語で困る場合は、画面表示を日本語にする方法も参考になります。画面の翻訳と、日本語の音声を生成できることは別の話です。

台本と話し方の指示を分けて準備する

読み上げる原文には発話してほしい文章だけを入れ、声の調子は別の指示として用意します。3.8 TTSのAPIではspeech_metadataのstyle/speakerなどを使う形式が案内されており、旧形式の指示を本文へ入れると、その指示自体が読まれる場合があります(2026年9月26日確認)。旧入力形式からの移行説明

次は解説動画の導入を想定した作例です。生成結果を確認した実証済みプロンプトではありません。Studioの現行入力欄名は未確認のため、台本用・話し方用として表示されている入力先を確かめて使ってください。

読み上げる台本例

今日は、AIで作った音声を公開する前に確認したいことを紹介します。
大切なのは、声の印象だけで決めないことです。
読み方、数字、言葉の区切りを確認してから、使う音声を選びましょう。

原文を選択して手動でコピーすることもできます。

話し方の指示例

落ち着いた日本語で、初めて聞く人にも伝わるように話してください。
文末を急がず、文と文の間に短い間を置いてください。
過度に大げさな演技は避けてください。

原文を選択して手動でコピーすることもできます。

2つの原文は連結して貼り付けず、用途を分けて扱います。入力先を区別できない場合は、使っているモデルの案内を確認してから進めてください。

読み間違いと話し方を修正する

聞き直して読みが違った箇所は台本の表記を、間や話し方が違った箇所は演出指示を見直すことを勧めます。一度に両方を大きく変えず、変更した条件を記録して同じ区間を聞き比べると、次の修正先を決めやすくなります。これは筆者の確認手順で、品質や処理時間を保証するものではありません。

音声ファイルと声の設定はどう保存する?

Gemini 3.8 TTSで生成した音声ファイルと再生成に使う声の設定は別の保存対象なので、APIの声IDの期限を、手元に保存した音声ファイルの期限と混同しないことが必要です。次回に音声を再生したいのか、新しい台本で作り直したいのかで、残す情報が変わります。

完成音声・声の設定・台本を分ける

再生用には完成音声、作り直すためには台本・演出指示・声の識別情報を残します。後者は筆者の保管方針で、Studioがそれらを同じ場所へ自動保存するという意味ではありません。

保存したいものと用途の対応
API仕様は2026年9月26日確認。Studioの現行保存ボタン名・全出力形式・台本自動保存期間は未確認です。

表は横にスクロールできます。

残す対象何に使うか確認する条件
完成音声ファイル編集ソフトで使う、再生する手元に保存できたか・形式・再生を確認。声IDとは別物
声の識別情報次の台本で同じ声を指定する既成音声の名前、設計声・複製声のvoice_idなど。APIの保存期限を確認
台本・話し方・モデル名修正条件を再現しやすくする筆者は手元保管を推奨。Studioの自動保存だけを前提にしない

出典:TTSの出力仕様/設計声の保存/複製声の保存

APIの非ストリーミング出力は、既定でWAV(24kHz・モノラル・16bit PCM)です。ストリーミングの既定はヘッダーなしのPCMで、これは音声をデータとして扱う形式です。Studioでも同じ保存メニューや形式が選べるという保証には読み替えません(2026年9月26日確認)。APIの音声出力形式

画面上の保存手段を使った後は、保存先でファイルを開いて再生できるか確認してください。保存操作を見つけられない場合は、画面の音声再生だけで「手元への保存も完了した」と判断しないことが大切です。

保存期限と削除の対象を確認する

APIで保存する声には期限と件数上限があり、完成音声ファイルの保管とは別に管理します。設計声と複製声を合わせて1プロジェクト200件、有効期間は1年で、声の削除操作も用意されています。複製声を保存しない方式のキーは7日です(2026年9月26日確認)。保存声の上限と期限・複製声の保存方式

voice_idとは、APIで保存した声を指定する識別子です。継続制作では作成日と利用プロジェクトも一緒に残すと、期限や再利用先を確認しやすくなります。声を削除したことから、手元の完成音声やサービス側のすべてのログまで消えるとは判断できません。

商用利用・公開の前に何を確認する?

Google AI Studioへ台本や声を入力する前にはデータの利用条件と入力する権利を確認し、声を複製する場合は本人の参照音声と同意音声も必要です。利用できる機能であっても、公開してよい素材かは別に判断します(2026年9月26日確認)。Gemini API追加利用規約・声の複製条件

入力データの扱いを確認する

データの改善利用は、料金の支払い有無だけでなく、規約上のUnpaid Services/Paid Servicesの条件で確認します。日本のUnpaid Servicesでは入力・出力が製品改善などに利用され、人による確認もあり得ます。Paid Servicesでは製品改善に使用しない一方、不正利用対策などの限定的なログ処理は残ります(2026年9月26日確認)。無料・有料サービスのデータ条件

無料のStudio操作でも、有効なCloud BillingプロジェクトへアクセスできるアカウントやWorkspace enterpriseアカウントは、規約上Paid Servicesの扱いになります。EEA・英国・スイスには無料利用のデータ条件に別の扱いがあります。「Google AI Proへ課金したから、それだけで入力が改善利用されない」とは判断しないでください(2026年9月26日確認)。Paid Servicesの適用条件と地域の例外

  • 社外秘・顧客情報が含まれる:適用されるデータ条件と組織の許可を確認できるまで入力を保留する。
  • 他人の声・権利不明の素材を使う:利用権と必要な同意を確認できるまで生成・公開を進めない。
  • 一般公開できる自作台本で試す:利用枠とアカウント条件を確認し、小さな範囲から始める。

業務や商用利用を考える場合も、生成物を使う責任は利用者にあります。Googleは生成物の所有権を主張しないとしていますが、それは第三者の権利を侵害しないという保証ではありません(2026年9月26日確認)。生成物と利用者の責任に関する規約

声の複製と本人の同意を確認する

声の複製には、同じ成人本人の参照録音と同意録音が必要です。録音を入手できたことだけを利用許可とせず、本人の同意と公開範囲を確認する、というのが本記事の開始条件です(2026年9月26日確認)。Voice replication公式ガイド

音声複製には個別の地域制限もあります。GoogleのStudio向け発表では、米国イリノイ州・テキサス州、EEA、英国、スイス、インドが対象外として挙げられています。日本がStudioの対象地域であることから、全アカウントで同じ複製機能を使えるとは判断できません(2026年9月26日確認)。声の複製機能の公式発表

長文と複数話者の制約を確認する

長文や掛け合いは、モデルの能力説明よりも、利用するAPIや画面の提供上限を先に確認します。Gemini APIでの両3.8 TTSモデルの上限は入力8,192トークン、出力16,384トークンです。モデルカードの出力64Kという記載を、APIの単発出力上限やStudioの生成可能分数へ置き換えないでください(2026年9月26日確認)。Flash TTSのAPI提供上限・Flash-Lite TTSのAPI提供上限・Gemini 3.8 Audioモデルカード

APIの単一リクエストによる複数話者は既成音声で最大2人です。設計声・複製声を使う場合は、話者のターンごとに合成するよう案内されています。Studio側で同じ制約になるかは未確認です(2026年9月26日確認)。複数話者の公式説明

旧モデル・スマホ利用のよくある疑問

Google AI StudioのWeb提供と端末別の操作保証、旧TTSモデルの終了日未発表と継続保証はそれぞれ別なので、利用時点で確認できた提供条件と未確認事項を区別します。古い解説のモデル名や保存操作が、現在の自分の画面に一致するかを確かめてください。

旧TTSモデルの終了日は決まっている?

Gemini 3.1 Flash TTS Previewと2.5 Flash Preview TTSは、公式の終了予定一覧で終了日未発表とされています。一方、2.5 Pro Preview TTSは、終了日欄の「未発表」と、終了済みを示す灰色の行表示が併存していました(2026年9月26日確認)。そのため、2.5 Proも現在利用できるとは本記事では断定しません。終了日未発表のモデルも継続利用が保証されるわけではなく、既存の制作を継続する前に、Geminiモデルの終了予定一覧と、利用するモデルの入力仕様を確認してください。

スマートフォンでも同じ保存操作ができる?

Google AI Studioはブラウザで利用するサービスですが、TTSの保存操作がスマートフォンとPCで同じであることは、今回確認した公式資料では確認できません。端末別のメニュー名や全OSへの対応を一括で保証せず、自分の画面で音声の保存と再生まで確かめてください。Google AI StudioでのTTS提供案内・音声生成の公式入口(2026年9月26日確認)。

まとめ|条件を確認して音声を作る

Google AI Studioでの最初の音声制作は、利用条件を確認できれば短い台本から始め、確認できなければ入力を保留して該当条件を解消する、という進め方を本記事では勧めます。次に行うのは、公開可能な自分の台本を1つ用意し、選んだモデルと声で試すことです。

判断表で候補を決めても、同意・データ条件・利用枠のどれかが不明なら、先にその条件を確かめます。完成音声を使う段階では、聞き直した結果と保存先を確認してください。

料金の適用期間が切り替わる2027年1月1日以降にAPIを使う前、声IDを再利用する前、モデル・プロジェクト・課金設定を変えるときは、この判断表と公式資料を再確認してください。料金の切替予定は2026年9月26日の確認内容です。API料金と適用期間

引用元・確認範囲

以下は2026年9月26日に確認した公式一次資料です。製品の実機操作・日本語音質・生成時間の実測は行っていません。ログイン後の画面で未確認の項目は本文に明記しています。

ブログをメールで購読

学べるブログの更新・重要アップデート(Grok/Gemini など)を、メールで受け取れます。無料。いつでも解除できます。更新時(週1〜2回目安)

Google / Gemini

コメント

学べるブログをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む

学べるブログをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む