登录

谷歌推出Gemini 3.8 Flash/Flash-Lite文本转语音模型,每一行台词都能精确控制


速读:凭借对100多种语言的支持,这些模型能够帮助创作者、开发者和企业在全球范围内打造高质量的多语言语音体验。 谷歌推出Gemini3.8Flash/Flash-Lite文本转语音模型,每一行台词都能精确控制2026年09月23日23:31IT之家IT之家9月23日消息,谷歌今日宣布,Gemini家族新增两款全新文本转语音模型,将语音生成从静态预设转变为动态创意工作室,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为GeminiNotebook和GoogleVids等产品改进用户体验。 性能方面,Gemini3.8FlashTTS在HumeAI的语音设计基准测试中(71.4分)位居总体第一,在口音建模方面(60.8分)也处于领先地位。
2026年09月23日 23:3

IT之家 9 月 23 日消息,谷歌今日宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成 从静态预设转变为动态创意工作室 ,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为 Gemini Notebook 和 Google Vids 等产品改进用户体验。

两款新模型分别为 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS ,定位各有不同:

据IT之家了解,用户可以 从原有 30 种原始语音扩展到无限语音库 。该模型的具体功能包括:

选好声音后,两款 TTS 模型都能让 用户精确控制每一行台词的演绎方式 :

性能方面, Gemini 3.8 Flash TTS 在 Hume AI 的语音设计基准测试中(71.4 分)位居总体第一,在口音建模方面(60.8 分)也处于领先地位。

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 能够在不牺牲可靠性的情况下实现真正富有表现力的性能 ,在 Hume AI 的整体质量指数中分别占据第一和第二的位置,与 Gemini 3.1 Flash TTS 相比,在长格式内容和双扬声器剧本控制等广泛用例中都有重大改进。

在 Voice Arena 的盲法人类偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在全球主要语言(日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语)竞争对手中占据领先地位。凭借对 100 多种语言的支持,这些模型能够帮助创作者、开发者和企业在全球范围内打造高质量的多语言语音体验。

谷歌在语音创建和复制功能中内置了严格的保护措施,以帮助保护语音人才、尊重身份并确保内容透明度。对于语音复制,系统会利用同意验证: 用户必须提供来自语音所有者的口头同意记录,与参考说话者匹配后才能创建语音 。

Gemini Audio 模型生成的每个音频片段 都带有 SynthID 水印 且难以察觉,并被直接编织到音频输出中,确保可以检测到 AI 生成的语音,帮助防止错误信息。

即日起,开发者就可以在 Google AI Studio 中体验这些新的语音生成功能。用户可以通过提示从头开始创建全新的声音身份,或者复制自己的声音,然后将它们直接带入双扬声器剧本编辑器,逐行指导交付。

两款模型均已向开发者推送,可在 Gemini API 和 Google AI Studio 中使用;面向企业用户,很快将通过 Gemini Enterprise 中的 API 推出;面向所有用户,Gemini 3.8 Flash TTS 可在 Gemini Notebook 中使用,Gemini 3.8 Flash-Lite TTS 可在 Google Vids 中使用。

需要注意的是,通过 AI Studio 进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。

主题:用户|Gemini3.8Flash|开发者|Gemini3.8FlashTTS和Gemini3.8Flash-LiteTTS|语音复制