Kurz gesagt: Google bringt mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei neue Sprachmodelle für Echtzeit-Audiodialoge und Voice Agents. Neben multimodaler Verarbeitung und automatischem Sprachwechsel rückt vor allem paralleles Reasoning während laufender Gespräche in den Fokus. Erste Benchmarks zeigen dabei sowohl Stärken als auch Nachteile gegenüber früheren Modellen.
Sprachbasierte KI-Agenten sollen künftig nicht nur flüssig antworten, sondern während eines Gesprächs gleichzeitig planen, Werkzeuge einsetzen und komplexere Aufgaben bearbeiten. Genau darauf zielen Googles neue Modelle Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Doch welche Fortschritte bringen sie im praktischen Einsatz?
Gemini 3.8 Live ist als kosteneffizientes Basismodell für skalierbare Voice Agents konzipiert. Es verarbeitet Text-, Bild-, Audio- und Videoeingaben und verfügt über ein Kontextfenster von rund 128.000 Token. Nach Angaben von Google unterstützt das Modell 97 Sprachen einschließlich Deutsch und kann innerhalb eines laufenden Gesprächs automatisch zwischen Sprachen wechseln.
Die Extended-Thinking-Variante richtet sich an komplexere Aufgaben mit mehrstufigem Reasoning. Sie soll während des Sprechens parallel weiterdenken, Zwischenergebnisse verbal erläutern und mehrere Funktionsaufrufe gleichzeitig bearbeiten können. Damit versucht Google, Sprachinteraktion und agentisches Arbeiten enger miteinander zu verbinden.
Werkzeuge arbeiten parallel zum Gespräch
Ein technischer Baustein der neuen Live-Modelle sind asynchrone Funktionsaufrufe. Während die Unterhaltung weiterläuft, können im Hintergrund Tools angesprochen werden. Über die Modi SILENT, WHEN_IDLE und INTERRUPTED lässt sich steuern, wann und wie deren Ergebnisse wieder in den Dialog einfließen.
Bei den Leistungswerten ergibt sich allerdings kein einheitliches Bild. Gemini 3.8 Live Extended Thinking erreicht laut Artificial Analysis mit 82,6 Punkten den ersten Platz im Speech-to-Speech Quality Index, vor OpenAIs GPT-Live-1 Astra mit 81,5 Punkten und Grok Voice Think Fast 2.0 High mit 81,3 Punkten. Bei der Agentic Performance liegt Googles Modell ebenfalls vorn.
Beim Reasoning muss sich Extended Thinking dagegen zwei Qwen-Modellen sowie StepAudio 3 Realtime von StepFun geschlagen geben. Auch menschliche Blindtests fallen zurückhaltender aus: In der Speech Agent Arena liegt Extended Thinking sieben Plätze hinter Gemini 3.8 Live. Beide neuen Modelle rangieren dort wiederum hinter dem Vorgänger Gemini 3.1 Flash Live Minimal. Auch bei der Zeit bis zur ersten Audioausgabe schneiden sie in diesem Vergleich schlechter ab.
Google bringt die Modelle in Suche und Workspace
Gemini 3.8 Live steht Entwicklern über die Gemini API und Google AI Studio zur Verfügung. Unternehmen erhalten zunächst eine Preview über Gemini Enterprise, während Endnutzer das Modell in der Live Google-Suche verwenden können.
Gemini 3.8 Live Extended Thinking soll zusätzlich in Gemini Live sowie für Google-AI-Abonnenten in Anwendungen wie Gmail, Keep und Docs verfügbar werden, wobei Docs auf Pro- und Ultra-Abonnenten beschränkt ist. Unternehmen erhalten die Funktion zunächst in einer privaten Vorschau. Entwickler können auch diese Variante über die API und Google AI Studio einsetzen.
Von Googles KI-Produkten erzeugte Audioinhalte werden mit SynthID-Wasserzeichen versehen. Diese nicht wahrnehmbaren Markierungen sollen maschinenlesbar nachweisbar bleiben und sind auch im Zusammenhang mit den seit dem 2. August 2026 geltenden Transparenzpflichten des EU AI Act nach Artikel 50 relevant.
Für Entwickler und Unternehmen werden damit vor allem solche Voice Agents interessanter, die während eines laufenden Gesprächs externe Werkzeuge nutzen und komplexe Abläufe koordinieren müssen. Die unterschiedlichen Benchmark-Ergebnisse zeigen zugleich, dass höhere Agenten- und Reasoning-Fähigkeiten nicht automatisch in jeder Nutzungssituation zu einer besseren oder schnelleren Sprachinteraktion führen.
Der Newsletter „Beratung-KI“ informiert regelmäßig über neue KI-Modelle, Agenten-Technologien und deren praktische Bedeutung für Unternehmen und Anwender.
Effizienz durch Innovation: Teile der textlichen und visuellen Ausgestaltung dieser Seite wurden durch generative KI-Systeme unterstützt.
