informática, telefonía
17.09.2026 11:32

Compartir con otros:

Compartir

Google Gemini 3.8 Live permite un control por voz fluido y la ejecución simultánea de tareas.

Foto: Google
Foto: Google

Google presenta nuevos modelos de interacción por voz dirigidos a desarrolladores, empresas y consumidores. La versión básica, Gemini 3.8 Live, busca la eficiencia y la flexibilidad. La versión más potente, Gemini 3.8 Live Extended Thinking, está diseñada para resolver tareas complejas de varios pasos.

Gemini 3.8 Live permite el procesamiento casi en tiempo real de la entrada visual, adaptándose y alternando sin problemas entre 97 idiomas compatibles durante una conversación. Una característica única de la solución es la capacidad de ejecutar herramientas y llamar a interfaces de programación de aplicaciones (API) en segundo plano sin interrumpir la conversación de voz. Esto permite al usuario seguir comunicándose mientras el sistema realiza tareas complejas en segundo plano.

Para flujos de trabajo más complejos, Extended Thinking ofrece un análisis profundo, utilizando respuestas de voz natural para validar solicitudes y explicar el progreso en tiempo real. Este modelo ocupa el primer lugar en el Índice de Calidad de Voz a Voz con una puntuación de 82,6 y obtiene 97,7 en la prueba % de Big Bench Audio. La integración ya está disponible en los servicios de Google Workspace, incluidos Docs Live, Gmail Live y Keep Live, así como en Search Live.

Para garantizar la seguridad y evitar la desinformación, se integra una marca de agua SynthID de forma imperceptible en todo el audio generado. Si bien esta nueva función promete un control por voz fluido y una alta precisión, conviene ser cauteloso al usarla en entornos de producción y probar su funcionamiento exhaustivamente.


¿Interesado en más sobre este tema?
Google


¿Qué están leyendo los demás?