NeFut Logo NeFut
EN 管理员登录

[AI造物主] Gemini 3.8 文本转语音模型概览

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #Neural

Gemini 3.8 Flash TTS 与 Flash‑Lite TTS 是 Google 最新的语音生成模型,支持 100 多种语言和方言,提供 2000+ 预制声音。Flash TTS 侧重创意角色设计,可通过自然语言提示从零创建声音,并实现逐行控制,包括情感、语速、口音、背部响应等。Flash‑Lite TTS 侧重高并发、低成本,适用于大规模配音和语音代理。

主要特性

性能表现:在 Hume AI Voice Design Benchmark 中,Flash TTS 获得 71.4 的总体分数和 60.8 的口音建模分数,分别位列第一;Flash‑Lite TTS 紧随其后。Voice Arena 人类偏好评测中,两模型在日语、巴西葡萄牙语、越南语、阿拉伯语、墨西哥西班牙语和印地语等语言上均居前。

使用方式

合作伙伴包括 Figma、HeyGen、Linguana、Wondercraft 等,已用于全球配音、本地化和对话式语音代理。

点评

原文链接: https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/

下一篇:没有了
[h] 返回首页