Gemini 3.8 Flash TTS 与 Flash‑Lite TTS 是 Google 最新的语音生成模型,支持 100 多种语言和方言,提供 2000+ 预制声音。Flash TTS 侧重创意角色设计,可通过自然语言提示从零创建声音,并实现逐行控制,包括情感、语速、口音、背部响应等。Flash‑Lite TTS 侧重高并发、低成本,适用于大规模配音和语音代理。
主要特性
- 自定义声音:使用自然语言描述角色、口音、情感等,系统在 30 秒音频样本或空白提示下生成对应声音。支持 30+ 原始声音扩展至无限库。
- 声音复制:通过 30 秒样本并进行同意验证,生成带有 SynthID 水印和 C2PA 凭证的复制声音,防止滥用。
- 逐行脚本控制:在 Google AI Studio、Gemini API、Gemini Notebook、Google Vids 中,可为每句台词写入指令(如
<laughs>、|mhm|),实现真实对话节奏和背部响应。 - 长文本生成:保持音质和角色音色,适合数小时的有声书或播客,避免说话人漂移。
- 双说话人场景:单脚本即可实现两位角色的自然轮换对话。
- 安全机制:所有生成音频默认嵌入 SynthID 隐形水印;声音复制需声主口头同意;模型卡提供详细安全说明。
性能表现:在 Hume AI Voice Design Benchmark 中,Flash TTS 获得 71.4 的总体分数和 60.8 的口音建模分数,分别位列第一;Flash‑Lite TTS 紧随其后。Voice Arena 人类偏好评测中,两模型在日语、巴西葡萄牙语、越南语、阿拉伯语、墨西哥西班牙语和印地语等语言上均居前。
使用方式
- 开发者:通过 Gemini API 或 Google AI Studio 调用
gemini.tts.flash/gemini.tts.flash_lite。 - 企业:即将通过 Gemini Enterprise API 提供。
- 普通用户:在 Gemini Notebook 与 Google Vids 中可直接体验。
合作伙伴包括 Figma、HeyGen、Linguana、Wondercraft 等,已用于全球配音、本地化和对话式语音代理。
点评