官方來源· Google DeepMind News· AI· 發布於 2026年9月29日

Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS

Google 於 9 月 23 日公布兩款文字轉語音模型:Flash TTS 著重自訂聲線與細緻表演指導,Flash-Lite TTS 則面向大量音訊生成。兩者開始透過 Gemini API 和 Google AI Studio 推出,並分別進入 Gemini Notebook 與 Google Vids。

完整報導

Google 於 2026 年 9 月 23 日宣布 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,將 Gemini 3.8 系列擴展至文字轉語音。Flash TTS 主打創作導向的聲線設計與角色表演,可用自然語言設定聲音特徵,並逐句調整語速、口音與情緒;Flash-Lite TTS 則針對大量、具成本效率的配音、音訊製作與語音代理工作負載設計。

Flash TTS 可透過提示詞設計涵蓋 100 多種語言與方言的聲線,Google 也表示提供超過 2,000 種可供製作使用的聲音。兩款模型支援逐句表演指示;Flash TTS 亦支援雙人對話場景及長篇音訊生成,面向有聲書、Podcast、遊戲及互動媒體等用途。

Google 表示,聲音複製可使用 30 秒的聲音樣本,但須提供聲音所有者的口頭同意錄音;生成音訊則會加入 SynthID 浮水印。兩款模型已開始透過 Gemini API 和 Google AI Studio 向開發者推出;Flash TTS 也正推出至 Gemini Notebook,Flash-Lite TTS 則推出至 Google Vids。Gemini Enterprise 的 API 存取被列為即將推出。

這次更新延續 Gemini 3.8 系列的擴展:Google 於 9 月 2 日先公布 Gemini 3.8 Flash 與 Flash Cyber,當時將 Flash 定位於程式開發、代理工作與多步驟推理。新增的 TTS 型號把這個系列帶入語音製作,並以創作控制和大量生成兩種不同工作需求區分產品定位。

為什麼值得注意

兩款模型把聲音設計、逐句表演控制和大量配音等不同工作方式納入 Gemini 3.8 音訊產品線。對創作者與開發者而言,實際可用性取決於各產品的推出管道;Google 對聲音複製設定同意驗證,並表示生成音訊帶有 SynthID,則為使用他人聲音與辨識 AI 生成內容提供了具體保障措施。

來源證據

先看主要證據,再查看佐證來源與來源脈絡。

1 則

主要證據

1
  • 官方Google DeepMind News文件原始來源

    Gemini 3.8 text-to-speech says hello

推薦消息

根據品牌、主題與近期相關消息推薦

目前沒有更多推薦消息

官方原始聲明

查看官方原始來源