Sechs Stimmenmodelle, eine App
Voice Creator Pro führt sechs Text-to-Speech-Modelle aus. Jedes ist bei einer anderen Aufgabe am stärksten, sodass Sie das passende Modell für die jeweilige Arbeit auswählen, anstatt ein einziges Modell zu allem zu zwingen.
Die Modelle
Worin jedes am besten ist
Jedes Modell hier beherrscht Text-to-Speech. Was sie unterscheidet, ist der Bereich, in dem jedes vorne liegt, und genau das sollte in der Regel entscheiden, zu welchem Sie greifen.
OmniVoice
Über 600 SprachenEines der schnellsten Modelle für Voice-Cloning und mit Abstand das breiteste: Es spricht über 600 Sprachen. Es klont eine Stimme aus wenigen Sekunden Audio und behält den Akzent dieses Sprechers bei, selbst wenn dieser die Sprache wechselt. Es beherrscht außerdem Voice-Design aus festen Attributen statt aus einer Beschreibung.
Am besten für: Lokalisierung, mehrsprachiges Cloning, Akzentarbeit und Generierung in großen Mengen
Qwen3-TTS
13 Emotionen, 5 IntensitätenWeisen Sie Ihrem Text eine von 13 Emotionen zu und wählen Sie, wie stark sie wirkt, sodass dieselbe Stimme eine Zeile auf Wunsch fröhlich, wütend oder ängstlich liest. Voice-Design ist frei: Beschreiben Sie den gewünschten Charakter in eigenen Worten, und Qwen3 baut ihn auf.
Am besten für: Hörbücher, Erklärvideos und jedes Skript, bei dem das Gefühl genau stimmen muss
VoxCPM2
48-kHz-AudioDas einzige Modell hier, das Audio in Studioqualität mit 48 kHz direkt ausgibt, ohne Upsampler. Voice-Design funktioniert in Schichten, erst Identität, dann Textur, dann Vortrag, so wie Sie Casting-Notizen schreiben würden, und die Benennung des Settings steuert die gesamte Darbietung.
Am besten für: Erzählung, Dokumentation, Trailer und alles, bei dem die Audioqualität im Vordergrund steht
DramaBox
Prompt-gesteuertes SchauspielSie schreiben die Stimme und ihre Darbietung zusammen. Text in Anführungszeichen wird gesprochen, Text ohne Anführungszeichen ist Regieanweisung, sodass eine einzige Aufnahme durch Langeweile, Sarkasmus und Verzweiflung führen kann. Sie können ihm auch eine Stimme übergeben und diese Stimme dann klonen und lenken.
Am besten für: Spieldialoge, Animation, Hörspiel und Charakterarbeit
Ebenfalls in der App
Diese laufen in der Cloud und auf dem Desktop neben den Modellen oben, jedes mit seiner eigenen Stärke.
Gepard 1.0
Läuft mit 2 GB VRAMEin leichtgewichtiges Cloning-Modell, das für den Betrieb auf schwacher Hardware gebaut ist und nur etwa 2 GB VRAM benötigt, sodass Sie eine Stimme auf einem Desktop-Rechner ohne leistungsstarke GPU klonen können. Es unterstützt Streaming und deckt vier Sprachen ab.
Kokoro
Läuft auf der CPUEin Modell mit 82 Millionen Parametern, das schneller generiert als alles andere in der Aufstellung und auch ohne dedizierte GPU einwandfrei läuft. Es verwendet 28 voreingestellte Stimmen, statt eine zu klonen oder zu gestalten, was es einfach und schnell hält.
Anwendungsfälle
Welches Modell für das, was Sie erstellen
Beginnen Sie bei der Arbeit statt beim Modellnamen. Hier ist das Modell, zu dem Sie je nach Aufgabe zuerst greifen sollten, mit einem Satz dazu, warum es passt.
Hörbücher und lange Erzählungen
Greifen Sie zu Qwen3-TTS
Legen Sie die Emotion und ihre Intensität Passage für Passage fest, damit eine lange Lesung ihr Gefühl behält, statt über die Kapitel hinweg zu verflachen.
Synchronisation und Lokalisierung
Greifen Sie zu OmniVoice
Klonen Sie eine Stimme einmal und behalten Sie ihren Akzent bei, während die Stimme die Sprache wechselt, damit eine Synchronisation in jedem Markt nach derselben Person klingt.
Voiceover, Trailer und Dokumentation
Greifen Sie zu VoxCPM2
Studioqualität mit 48 kHz direkt aus dem Modell, für Arbeiten, bei denen der Klang selbst auf guten Lautsprechern überzeugen muss.
Spiele, Animation und Hörspiel
Greifen Sie zu DramaBox
Steuern Sie die Darbietung Zeile für Zeile und führen Sie eine Stimme durch verschiedene Emotionen innerhalb einer einzigen Aufnahme.
Voice-Cloning ohne High-End-GPU
Greifen Sie zu Gepard 1.0
Klonen Sie eine Stimme auf einem Desktop mit nur einer bescheidenen GPU, die etwa 2 GB VRAM benötigt, mit Streaming-Unterstützung für längere Durchläufe.
Entwürfe, Scratch-Tracks und hohe Stückzahlen
Greifen Sie zu Kokoro
Schnelle Generierung, die ohne dedizierte GPU läuft, für vorläufige Voiceover und Batch-Durchläufe, bei denen eine eigene Stimme nicht der Punkt ist.
Die meisten Aufgaben haben auch eine zweite und dritte gute Wahl. Bestes TTS-Modell für jeden Anwendungsfall geht die Alternativen für jede durch.
Direkter Vergleich
Wie sich die Modelle vergleichen
Die technischen Daten, die tatsächlich beeinflussen, welches Modell Sie wählen sollten. Eine Durchsicht nach Anwendungsfall statt nach technischen Daten finden Sie in den Leitfäden weiter unten.
| Modell | Sprachen | Emotionssteuerung† | Voice-Cloning | Voice-Design | Am besten für |
|---|---|---|---|---|---|
| OmniVoice | Über 600 | Nicht explizit, aus dem Text abgeleitet | Zero-Shot | Strukturierte Attribute, zehn englische Akzente | Lokalisierung, mehrsprachiges Cloning, Akzentarbeit und Generierung in großen Mengen |
| Qwen3-TTS | 10 | 13 Emotionen, 5 Intensitäten | Zero-Shot | Freie Beschreibung | Hörbücher, Erklärvideos und jedes Skript, bei dem das Gefühl genau stimmen muss |
| VoxCPM2 | 30, plus neun chinesische Dialekte | Nicht explizit, aus dem Text abgeleitet | Zero-Shot | Freie Beschreibung | Erzählung, Dokumentation, Trailer und alles, bei dem die Audioqualität im Vordergrund steht |
| DramaBox | Nur Englisch | Inline gesteuert, direkt im Prompt | Nur als Teil des Voice-Designs | Aus einem Prompt oder über eine von Ihnen bereitgestellte Stimme | Spieldialoge, Animation, Hörspiel und Charakterarbeit |
| Gepard 1.0 | 4 | Nicht unterstützt | Zero-Shot | Nicht unterstützt | Voice-Cloning auf Desktops ohne High-End-GPU und Streaming |
| Kokoro | Englisch, mit 28 voreingestellten Stimmen | Nicht unterstützt | Nicht unterstützt | Nicht unterstützt | Schnelle, unkomplizierte Erzählung, bei der Sie keine eigene Stimme brauchen |
† Emotionssteuerung bedeutet, ausdrücklich festzulegen oder zu lenken, welche Emotion die Stimme ausdrückt, statt des Tons, den ein Modell von selbst aus Ihrem Text aufnimmt.
Zwei Zugangswege
Cloud oder Desktop, dieselben Modelle
Sie erhalten in beiden Fällen dieselben Modelle. Der Unterschied liegt darin, wo sie laufen und wie Sie dafür bezahlen.
Voice Creator Pro Cloud
Jedes Modell in Ihrem Browser ausführen
- Nichts zu installieren, funktioniert von jedem Laptop oder Telefon aus
- Keine GPU nötig, Server-GPUs führen die Modelle für Sie aus
- Kostenlose Stufe, die sich monatlich erneuert, bezahlte Tarife ab 5 $ pro Monat
- Jedes Modell in jedem Tarif, auch im kostenlosen
Desktop-App
Lokal und offline ausführen
- Führt jedes Modell auf Ihrem eigenen Rechner aus, vollständig offline
- Unbegrenzte Generierungen, einmaliger Kauf ab 54,99 $
- Ihr Text und Audio verlassen niemals Ihr Gerät
- Lokale REST-API für Ihre eigenen Pipelines
Lieber gar nicht anmelden?
Für schnelle, zwanglose Text-to-Speech hosten wir außerdem eine Reihe deutlich leichterer Open-Source-Modelle, die kostenlos auf Ihrem eigenen Gerät laufen, ohne Konto und ohne Limits. Sie sind einfacher und merklich weniger leistungsfähig als die führenden Modelle oben, ohne über 600 Sprachen, Emotionssteuerung oder 48-kHz-Ausgabe, sodass sie sich für den schnellen Alltagsgebrauch eignen statt für professionelle oder kommerzielle Arbeit. Chatterbox Turbo, Supertonic und Kokoro sind alle dabei, und Kokoro erscheint auch in der Aufstellung oben.
Kostenlos testen, ohne AnmeldungTiefer einsteigen
Leitfäden und Vergleiche
Schriftliche Durchgänge, die die Modelle gegeneinander vergleichen und die Techniken abdecken, die gelten, für welches Sie sich auch entscheiden.
KI-Voice-Design-Leitfaden: 4 Wege, eine Stimme von Grund auf zu erstellen
Alle vier Modelle nebeneinander dabei, wie Sie eine Stimme gestalten, mit abspielbaren Beispielen jedes Ansatzes.
Bestes TTS-Modell für jeden Anwendungsfall
Zu welchem Modell Sie je nach Aufgabe greifen, von schneller Erzählung bis zu ausdrucksstarker, emotionsgesteuerter Sprache.
Qwen3-TTS vs. OmniVoice vs. Chatterbox: Voice-Cloning im Vergleich
Ein direkter Vergleich von Cloning-Qualität, Geschwindigkeit und wie gut jedes Modell einen Akzent hält.
Beste Offline-Voice-Cloning-Tools
Wie diese Modelle abschneiden, wenn Sie eine Stimme auf Ihrem eigenen Rechner klonen möchten.
Techniken, die für jedes Modell gelten
FAQ
Häufige Fragen
Sechs: OmniVoice, Qwen3-TTS, VoxCPM2, DramaBox, Gepard 1.0 und Kokoro. Jedes ist bei einer anderen Aufgabe am stärksten, von der Sprachenvielfalt über die Emotionssteuerung bis zur Ausgabe in Studioqualität, und alle sechs laufen sowohl in Voice Creator Pro Cloud als auch in der Desktop-App.
Ja. Sie wählen das Modell pro Generierung, sodass Sie eine Basisstimme mit einem Modell gestalten und zu einem anderen wechseln können, wenn Sie eine andere Stärke brauchen. Nichts ist an einen Tarif gebunden: Jede Stufe, auch die kostenlose Cloud-Stufe, hat Zugriff auf jedes Modell.
OmniVoice, mit großem Abstand. Es deckt über 600 Sprachen ab und behält den Akzent einer geklonten Stimme bei, selbst wenn diese Stimme die Sprache wechselt, was es zur Wahl für die Lokalisierung macht. VoxCPM2 deckt 30 Sprachen plus neun chinesische Dialekte ab, und Qwen3-TTS deckt 10 ab.
VoxCPM2. Es gibt Audio in Studioqualität mit 48 kHz direkt aus, ohne Upsampler, während die anderen Modelle mit einer niedrigeren Abtastrate ausgeben. Das macht es zum Modell der Wahl, wenn es auf die Audioqualität ankommt, etwa bei Erzählung, Dokumentation und Trailern.
Jedes Modell außer Kokoro kann ohne Trainingsschritt aus einem kurzen Referenzclip eine Stimme klonen. OmniVoice ist die Wahl, wenn die geklonte Stimme eine andere Sprache sprechen und ihren Akzent behalten soll, VoxCPM2, wenn Sie die höchste Sprecherähnlichkeit und Audioqualität wollen, Qwen3-TTS, wenn Sie der geklonten Stimme Emotionen zuweisen möchten, und Gepard 1.0, wenn Sie auf einer Maschine ohne High-End-GPU klonen. DramaBox klont ebenfalls eine Stimme, jedoch nur zusammen mit Voice-Design, sodass Sie die Stimme in einem Schritt klonen und steuern statt in zwei getrennten Aktionen.
Sie können jedes Modell in der kostenlosen Stufe von Voice Creator Pro Cloud nutzen, die sich monatlich erneuert und keine Karte erfordert. Bezahlte Cloud-Tarife beginnen bei 5 $ pro Monat, und die Desktop-App ist ein einmaliger Kauf ab 54,99 $ mit unbegrenzten Generierungen.
Ja, mit der Desktop-App von Voice Creator Pro. Sie führt jedes Modell auf Ihrem eigenen Rechner aus, ohne Verbindung, mit unbegrenzten Generierungen, und Ihr Text und Audio bleiben auf Ihrem Gerät. Voice Creator Pro Cloud ist serverbasiert und benötigt eine Verbindung.
Ja. Audio, das Sie mit einem dieser Modelle generieren, gehört Ihnen, in der Cloud und auf dem Desktop und einschließlich der kostenlosen Stufe, mit vollen kommerziellen Rechten, ohne Lizenzgebühren und ohne erforderliche Namensnennung.
Testen Sie jedes Modell, kostenlos
Jedes Modell ist in der kostenlosen Stufe von Voice Creator Pro Cloud verfügbar, mit vollen kommerziellen Rechten und ohne erforderliche Karte. Oder holen Sie sich die Desktop-App und führen Sie sie offline ohne Generierungslimits aus.