Google Gemini 3.8 Live consente un controllo vocale fluido e l'esecuzione simultanea di diverse attività.
Google sta introducendo nuovi modelli di interazione vocale rivolti a sviluppatori, aziende e consumatori. La versione base, Gemini 3.8 Live, punta all'efficienza e alla flessibilità. La versione più potente, Gemini 3.8 Live Extended Thinking, è pensata per risolvere attività complesse e articolate in più fasi.
Gemini 3.8 Live consente l'elaborazione quasi in tempo reale dell'input visivo, adattandosi e passando senza soluzione di continuità tra le 97 lingue supportate durante una conversazione. Una caratteristica unica della soluzione è la possibilità di eseguire strumenti e richiamare interfacce di programmazione delle applicazioni (API) in background senza interrompere la conversazione vocale. Ciò consente all'utente di continuare a comunicare mentre il sistema completa attività complesse in background.
Per flussi di lavoro più complessi, Extended Thinking offre un pensiero approfondito, utilizzando risposte vocali naturali per convalidare le richieste e spiegare i progressi in tempo reale. Questo modello si posiziona al primo posto nell'indice di qualità Speech to Speech con un punteggio di 82,6 e ottiene un punteggio di 97,7 % nel test Big Bench Audio. L'integrazione è già disponibile nei servizi Google Workspace, tra cui Docs Live, Gmail Live e Keep Live, nonché Search Live.
Per garantire la sicurezza e prevenire la diffusione di informazioni errate, un watermark SynthID viene incorporato in modo trasparente in tutti i file audio generati. Sebbene la nuova funzionalità prometta un controllo vocale fluido e un'elevata precisione, è consigliabile prestare attenzione quando la si utilizza in ambienti di produzione e testarne accuratamente il funzionamento.























