Google Gemini 3.8 Live ermöglicht reibungslose Sprachsteuerung und gleichzeitige Aufgabenausführung
Google stellt neue Sprachinteraktionsmodelle für Entwickler, Unternehmen und Endverbraucher vor. Die Basisversion, Gemini 3.8 Live, ist auf Effizienz und Flexibilität ausgelegt. Die leistungsstärkere Version, Gemini 3.8 Live Extended Thinking, ist speziell für die Lösung extrem komplexer, mehrstufiger Aufgaben konzipiert.
Gemini 3.8 Live ermöglicht die nahezu Echtzeitverarbeitung visueller Eingaben und passt sich während eines Gesprächs nahtlos an 97 unterstützte Sprachen an und wechselt zwischen ihnen. Ein besonderes Merkmal der Lösung ist die Möglichkeit, Tools auszuführen und Programmierschnittstellen (APIs) im Hintergrund aufzurufen, ohne die Sprachkonversation zu unterbrechen. So kann der Benutzer die Kommunikation fortsetzen, während das System komplexe Aufgaben im Hintergrund erledigt.
Für komplexere Arbeitsabläufe bietet Extended Thinking tiefgreifendes Denken durch natürliche Sprachausgabe, um Anfragen zu validieren und den Fortschritt in Echtzeit zu erläutern. Dieses Modell belegt im Speech-to-Speech Quality Index mit 82,6 Punkten den ersten Platz und erzielt im Big Bench Audio-Test 97,7 Punkte (%). Die Integration ist bereits in Google Workspace-Diensten wie Docs Live, Gmail Live, Keep Live und Search Live verfügbar.
Um die Sicherheit zu gewährleisten und Fehlinformationen vorzubeugen, wird ein SynthID-Wasserzeichen nahtlos in alle generierten Audiodateien eingebettet. Obwohl die neue Funktion eine reibungslose Sprachsteuerung und hohe Genauigkeit verspricht, ist bei der Verwendung in Produktionsumgebungen etwas Vorsicht geboten und die Funktion gründlich zu testen.























