Zum Inhalt springen
✓ Lesezeichen gespeichert
claw:// NEWS

Google startet Gemini 3.1 Flash Live: Audio-KI versteht Sprache nativ

Stephan Skrobisch 2. April 2026 3 Min.

Google veröffentlicht Gemini 3.1 Flash Live, ein Audio-Modell, das Sprache nativ verarbeitet statt sie erst in Text umzuwandeln. Es erkennt Tonfall, Tempo und Unterbrechungen. Ab sofort ist Gemini Live und Search Live in über 200 Ländern verfügbar.

Was macht Gemini 3.1 Flash Live anders als bisherige Sprachmodelle?

Klassische Sprach-KI arbeitet in drei Schritten. Erst wandelt ein System Sprache in Text um. Dann verarbeitet ein Sprachmodell den Text. Zuletzt konvertiert ein drittes System die Antwort wieder in Sprache. Diese Kette erzeugt Wartezeiten.

Gemini 3.1 Flash Live fasst die genannten Schritte in einen nativen Audio-zu-Audio-Prozess zusammen. Das Modell verarbeitet Sprache direkt, ohne Umweg über Text. Es nutzt WebSocket-Verbindungen für gleichzeitiges Senden und Empfangen von Audio, Video und Text. WebSocket ist eine Technik für dauerhaften Echtzeit-Datenaustausch zwischen Client und Server. Nutzer können das Modell jederzeit unterbrechen, ohne dass die Konversation abbricht.

AnzeigeAnzeige

Welche technischen Verbesserungen bringt das Modell?

Google bezeichnet Gemini 3.1 Flash Live als sein bislang leistungsfähigstes Audio-Modell. Es basiert auf Gemini 3 Pro und unterstützt ein Kontextfenster von bis zu 128.000 Token. Token sind die Texteinheiten, die das Modell gleichzeitig verarbeitet. Das Kontextfenster bestimmt, wie viel Information das Modell während einer Konversation gleichzeitig im Blick behalten kann. Gegenüber dem Vorgänger 2.5 Flash Native Audio liefert es kürzere Antwortzeiten und bessere Erkennung akustischer Nuancen wie Tonhöhe und Sprechtempo.

Auf dem Benchmark ComplexFuncBench Audio erreicht das Modell 90,8 %. Dieser Test misst die Fähigkeit, mehrstufige Funktionsaufrufe korrekt auszuführen. Auf der Audio MultiChallenge erreicht es 36,1 % mit aktiviertem Reasoning. Dieser Benchmark prüft, ob ein Modell Anweisungen auch bei Hintergrundgeräuschen, Stottern und Unterbrechungen korrekt befolgt.

Das Modell unterstützt über 90 Sprachen für Echtzeit-Konversationen. Alle generierten Audioinhalte werden mit SynthID als KI-generiert gekennzeichnet.

Wo ist Gemini 3.1 Flash Live verfügbar?

Entwicklern steht die Gemini Live API im Google AI Studio zur Verfügung. Unternehmen nutzen das Modell in Gemini Enterprise for Customer Experience. Endnutzer greifen auf Gemini Live und Search Live zurück. Gemini Live liefert jetzt schnellere Antworten und kann Konversationen doppelt so lang im Kontext halten wie der Vorgänger.

Verizon und The Home Depot setzen das Modell bereits im Kundenkontakt ein. Entwickler wie Stitch nutzen es für Voice-Design-Workflows. Das Startup Ato baut bereits einen KI-Begleiter für ältere Menschen.

Gemini 3.1 Flash Live tritt gegen OpenAI Voice, Voxtral TTS von Mistral und ElevenLabs an. Der Wettlauf um natürliche Sprach-KI nimmt Fahrt auf.

❤️
Hat dir der Artikel gefallen?

Server, KI-Modelle und Recherche kosten Geld. ClawNews ist unabhängig — hilf mit, dass das so bleibt.

Unterstützen
Diskutiere mit uns
Fragen, Meinungen, Feedback? Ab in den Discord.
Zum Discord →
ClawHub
claw://News für deinen Agenten
Briefings, Alerts & Recherche — direkt in OpenClaw.
Skill installieren →