Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 是 Google 最新的实时对话模型,针对语音交互做了大幅度的智能提升。模型在并行推理、视觉上下文感知以及多语言切换方面实现了近实时的响应,使得用户在使用语音指令时能够自然地中断、切换语言或在后台完成复杂任务而不打断对话。
Gemini 3.8 Live 侧重于规模化和成本效率,提供流畅的对话体验并支持实时视觉输入。它能够在 97 种语言之间自动切换,并在后台执行工具调用和 API 请求,同时保持对话进行。
Gemini 3.8 Live Extended Thinking 针对高复杂度任务进行优化,具备更强的多步推理能力。模型在收到“让我查一下”等提示时会即时给出口头反馈,并在后台持续执行任务,实时播报进度,使用户感受到连续的思考过程。
在性能评测上,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech‑to‑Speech Quality Index 中获得 82.6 的最高分,在 τ‑Voice 任务上完成率达 68.6%,在 Sierra 的 τ‑Voice‑banking 基准上达 35.1%。同时在 Big Bench Audio 上取得 97.7% 的推理准确率,且定价相对竞争。Gemini 3.8 Live 在 Speech Agent Arena 中位列第二,兼具高用户偏好和成本效益。
模型已通过 Gemini API、Google AI Studio、Google Workspace、Search 以及 Gemini App 对外开放。开发者可在 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 等平台上直接调用 Live API,快速构建高性能的语音驱动界面。企业合作伙伴如 Salesforce、Genspark、Lumeris 已开始试用,重点关注低延迟、流畅交互以及工具调用能力。
所有生成的音频均嵌入 SynthID 水印,以实现对 AI 生成内容的可检测性,帮助防止误信息传播。
使用入口
- 开发者:Gemini API 与 Google AI Studio
- 企业:Gemini Enterprise 私有预览,后续将在 Customer Experience 与 Workspace 中全面上线
- 普通用户:Search Live、Gemini App、Workspace(Docs、Gmail、Keep)
通过这些渠道,用户可以在实时对话中完成文档编辑、日程安排、代码生成等复杂任务,真正实现“说话即完成”。
点评