VoxCPM2: OpenBMB veröffentlicht Open-Source-TTS mit 2 Milliarden Parametern
KI-generiert mit Sora
Die OpenBMB-Community hat zusammen mit der Firma ModelBest und der Tsinghua-Universität VoxCPM2 veröffentlicht. Das Modell ist ein Text-to-Speech-System mit 2 Milliarden Parametern und steht unter der Apache-2.0-Lizenz. Damit ist die kommerzielle Nutzung erlaubt. Version 2.0.2 ist seit dem 8. April 2026 auf GitHub erhältlich.
Was kann VoxCPM2?
Laut Model Card auf Hugging Face unterstützt VoxCPM2 dreißig Sprachen inklusive Deutsch. Sprach-Tags sind nicht nötig. Der Nutzer gibt Text in der Zielsprache ein, das Modell synthetisiert diese direkt. Die Ausgabe läuft mit 48 kHz in Studio-Qualität. Das GitHub-Repository gibt den VRAM-Bedarf mit rund 8 GB an.
Zwei Funktionen stehen im Zentrum. Das Voice Design erzeugt eine neue Stimme mit Hilfe eines Prompts. Der Nutzer beschreibt Geschlecht, Alter, Tonlage und Sprechtempo, das Modell generiert daraus die passende Stimme. Eine Referenzaufnahme wird nicht benötigt.
Controllable Cloning klont eine Stimme auf Basis eines kurzen Audio-Clips. Laut AI Primer reichen rund drei Sekunden Referenzmaterial. Stilparameter wie das Tempo können angepasst werden.
Welche Trainingsdaten wurden genutzt?
Für das Training von VoxCPM2 nutzte das Team mehr als 2 Millionen Stunden an Sprachaufzeichnungen. Die Architektur basiert auf einem MiniCPM-4-Backbone und arbeitet ohne Tokenizer. Statt diskreter Audio-Tokens erzeugt das Modell kontinuierliche Sprachrepräsentationen. Dadurch werden Tonfall, Rhythmus und Betonung genauer abgebildet.
Die Real-Time-Factor-Angaben stammen aus dem Repository. Auf einer NVIDIA RTX 4090 erreicht VoxCPM2 einen RTF von etwa 0,30. Mit der Beschleunigungsbibliothek Nano-vLLM sinkt der Wert auf rund 0,13. Die Model Card listet Streaming-Unterstützung und LoRA-Finetuning mit fünf bis zehn Minuten Audio. Integrationen gibt es für ComfyUI und die C++-Runtime.
Open Source gegen ElevenLabs?
Wir haben diese Woche über die ElevenLabs-AGB beim Stimmenklon berichtet. Der kommerzielle TTS-Anbieter ElevenLabs gilt als einer der Marktführer für synthetische Stimmen. VoxCPM2 tritt mit einem lokal laufenden Open-Source-Ansatz gegen diese Dienste an. Wer VoxCPM2 nutzt, behält die Audiodaten auf der eigenen Hardware. Nutzungsabhängige API-Gebühren entfallen.
Die Konkurrenz ist aber nicht nur kommerziell. Mistral hatte bereits Anfang April mit Voxtral TTS ein Open-Weight-Sprachmodell vorgestellt. Voxtral deckt neun Sprachen ab. VoxCPM2 bietet mehr Sprachbreite, ein größeres Modell und diverse Möglichkeiten bei der Integration.
Die Benchmark-Ergebnisse stammen allerdings von OpenBMB selbst. Eine unabhängige Validierung steht noch aus.
Der Release reiht sich in eine Welle quelloffener KI-Modelle aus China ein. Erst vor wenigen Tagen erschien Google Gemma 4 ebenfalls unter Apache 2.0. Wer eine lokale TTS-Lösung mit Voice Cloning sucht, bekommt mit VoxCPM2 eine kostenfreie Option mit Deutsch-Unterstützung.
Server, KI-Modelle und Recherche kosten Geld. ClawNews ist unabhängig — hilf mit, dass das so bleibt.

