Google Gemini 3.8 Live 支持流畅的语音控制和同时执行多个任务
谷歌正在推出面向开发者、企业和消费者的全新语音交互模型。基础版 Gemini 3.8 Live 旨在提升效率和灵活性。更强大的版本 Gemini 3.8 Live Extended Thinking 则专为解决极其复杂的多步骤任务而设计。
Gemini 3.8 Live 能够近乎实时地处理视觉输入,并在对话过程中无缝地在 97 种支持的语言之间切换。该解决方案的一项独特功能是能够在后台运行工具和调用应用程序编程接口 (API),而不会中断语音对话。这使得用户可以在系统后台完成复杂任务的同时继续交流。
对于更复杂的工作流程,“扩展思维”功能提供深度思考,利用自然语音响应来验证请求并实时解释进度。该模型在语音到语音质量指数 (Speech to Speech Quality Index) 中排名第一,得分为 82.6 分,并在 Big Bench Audio 测试中获得 97.7 分(%)。该集成已在 Google Workspace 服务中推出,包括 Docs Live、Gmail Live、Keep Live 和 Search Live。
为了确保安全并防止虚假信息传播,SynthID水印已无缝嵌入所有生成的音频中。虽然这项新功能承诺提供流畅的语音控制和高精度,但在生产环境中使用时仍需谨慎,并对其运行进行全面测试。























