Zum Inhalt springen
✓ Lesezeichen gespeichert
claw:// NEWS

Mistral veröffentlicht Voxtral TTS: Open-Weight Text-to-Speech in 9 Sprachen

Stephan Skrobisch 3. April 2026 3 Min.

Voxtral TTS ist ein Open-Weight-Sprachmodell von Mistral, das Stimmen in neun Sprachen clonen kann. Die Besonderheit ist, dass lediglich drei Sekunden Referenzmaterial benötigt werden. Die erzeugte Sprachausgabe ist dabei emotional ausdrucksstark. Mit 4 Milliarden Parametern läuft das Modell auf Smartphones und Laptops.

Was kann Voxtral TTS?

Voxtral TTS ist ein Open-Weight-Modell für die Sprachgenerierung. Entwickler können Voxtral TTS von Hugging Face herunterladen und auf eigener Hardware betreiben. Die Lizenz CC BY NC 4.0 erlaubt allerdings nur nichtkommerzielle Nutzung. Für kommerzielle Anwendungen steht die API bereit.

Voxtral TTS unterstützt insgesamt neun Sprachen. Neben Englisch, Französisch und Deutsch stehen Spanisch, Niederländisch sowie Portugiesisch zur Auswahl. Hinzu kommen Italienisch, Hindi und Arabisch. Das Modell erkennt Dialekte und kann eine Stimme sprachübergreifend beibehalten. Ein englischer Text lässt sich mit einer französischen Referenzstimme generieren, obwohl das Sprachmodell nicht explizit dafür trainiert wurde. Voxtral TTS erfasst dabei nicht nur die Stimme, sondern auch Sprechpausen, Rhythmus, Intonation und natürliche Füllwörter. Laut Mistral liegt die Modell-Latenz bei 70 Millisekunden.

AnzeigeAnzeige

Wie schlägt sich Voxtral TTS gegen die Konkurrenz?

Mistral hat Voxtral TTS in einem Blindtest mit menschlichen Testern gegen ElevenLabs antreten lassen. Voxtral TTS erreicht laut diesen Tests bei vergleichbarer Latenz eine höhere Natürlichkeit als das Flash-v2.5-Modell des Konkurrenten. Gegenüber der größeren v3-Variante meldet Mistral einen Gleichstand bei der Qualität.

Laut Pierre Stock, VP of Science Operations bei Mistral, passt Voxtral TTS auf eine Smartwatch, ein Smartphone oder einen Laptop. Die Kosten liegen bei einem Bruchteil der Alternativen. Über die API zahlen Entwickler 0,016 US-Dollar pro 1.000 Zeichen.

Wo ordnet sich Voxtral TTS ein?

Voxtral TTS ergänzt die Sprachprodukte von Mistral. Zusammen mit Voxtral Transcribe 2 für Spracherkennung entsteht eine durchgehende Sprachverarbeitungskette. Forge ermöglicht die Anpassung der Modelle, Mistral Studio liefert die Produktionsinfrastruktur.

Für europäische Entwickler ist Voxtral TTS besonders relevant. Mistral ist ein französisches Unternehmen und positioniert sich als europäische Alternative zu proprietären Anbietern. Die Software ist über die API, in Mistral Studio und als Open-Weight-Version auf Hugging Face verfügbar.

Der Markt für Sprach-KI wird zunehmend umkämpft. OpenAI Voice, Gemini 3.1 Flash Live von Google und ElevenLabs konkurrieren um denselben Einsatzbereich. Parallel erweitern LLM-Anbieter wie Anthropic mit Claude Opus 4.6 ihre Plattformen um multimodale Funktionen. Voxtral TTS setzt dabei auf Offenheit und den Betrieb direkt auf dem eigenen Endgerät als Differenzierungsmerkmal.

❤️
Hat dir der Artikel gefallen?

Server, KI-Modelle und Recherche kosten Geld. ClawNews ist unabhängig — hilf mit, dass das so bleibt.

Unterstützen
Diskutiere mit uns
Fragen, Meinungen, Feedback? Ab in den Discord.
Zum Discord →
ClawHub
claw://News für deinen Agenten
Briefings, Alerts & Recherche — direkt in OpenClaw.
Skill installieren →