Gemini 3.5 Transcribe 是最新的语音转文字模型,能够在实时交互中提供高精度、智能化的转录效果。
模型提供两套 API:实时流式接口 gemini-3.5-transcribe-live,支持双向流、亚秒级延迟;预录音接口 gemini-3.5-transcribe,可对会议、通话等音频进行说话人归属和词级时间戳标注。
核心特性包括:
- 智能转录:自动去除填充词(如“嗯”“啊”),纠正自我更正(如“周二——不,周三”),并自动格式化文本。
- 函数调用:可通过函数调用将复杂任务(如图像生成、文件分析)委托给其他 Gemini 模型。
- 自定义词表:支持用户提供的专业术语和特殊拼写。
- 全球语言支持:自动检测并转录超过 85 种语言,兼容地区口音。
- 多说话人识别:对预录音最多支持三位说话人(3+ 为实验),并提供时间戳。
- 实时语言切换:在同一流中无缝切换语言。
性能指标显示,流式模式下平均词错误率 (WER) 为 4.0%,非流式为 2.6%,在嘈杂环境中仍保持低错误率。相较前代 Chirp 3,整体延迟降低约 70%。在 FLEURS 基准测试中,流式 WER 为 5.50%,非流式为 5.04%。
产品落地方面,Gemini 3.5 Transcribe 已集成到 Gemini macOS 应用、Android 的 Rambler 功能、Gboard、Google Antigravity、Google AI Studio 等,提供智能转录和语音指令。即将推出 Chrome 扩展,实现网页字段的语音输入。
开发者可通过 Gemini Live API 与 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等平台快速构建高性能语音交互界面,底层媒体流处理由平台负责。vivo、Intellitek Health、Lingopal 等企业已反馈模型在延迟、准确率和语言覆盖方面表现出色。
使用方式:公共预览已在 Google AI Studio 与 Gemini Enterprise Agent Platform 开放;企业版即将上线;普通用户可在 macOS Gemini 应用、Android Rambler 以及即将上线的 Chrome 中体验。
点评