Neu: Song Creator Pro: Musik mit KI erstellen, lokal auf Ihrem Gerät. Jetzt testen →

Sechs Stimmenmodelle, eine App

Voice Creator Pro führt sechs Text-to-Speech-Modelle aus. Jedes ist bei einer anderen Aufgabe am stärksten, sodass Sie das passende Modell für die jeweilige Arbeit auswählen, anstatt ein einziges Modell zu allem zu zwingen.

Jedes Modell in jedem Tarif
Browser oder Offline-Desktop
Volle kommerzielle Rechte

Die Modelle

Worin jedes am besten ist

Jedes Modell hier beherrscht Text-to-Speech. Was sie unterscheidet, ist der Bereich, in dem jedes vorne liegt, und genau das sollte in der Regel entscheiden, zu welchem Sie greifen.

OmniVoice

Über 600 Sprachen
Voice-CloningVoice-Design

Eines der schnellsten Modelle für Voice-Cloning und mit Abstand das breiteste: Es spricht über 600 Sprachen. Es klont eine Stimme aus wenigen Sekunden Audio und behält den Akzent dieses Sprechers bei, selbst wenn dieser die Sprache wechselt. Es beherrscht außerdem Voice-Design aus festen Attributen statt aus einer Beschreibung.

Am besten für: Lokalisierung, mehrsprachiges Cloning, Akzentarbeit und Generierung in großen Mengen

Qwen3-TTS

13 Emotionen, 5 Intensitäten
Voice-CloningVoice-Design

Weisen Sie Ihrem Text eine von 13 Emotionen zu und wählen Sie, wie stark sie wirkt, sodass dieselbe Stimme eine Zeile auf Wunsch fröhlich, wütend oder ängstlich liest. Voice-Design ist frei: Beschreiben Sie den gewünschten Charakter in eigenen Worten, und Qwen3 baut ihn auf.

Am besten für: Hörbücher, Erklärvideos und jedes Skript, bei dem das Gefühl genau stimmen muss

VoxCPM2

48-kHz-Audio
Voice-CloningVoice-Design

Das einzige Modell hier, das Audio in Studioqualität mit 48 kHz direkt ausgibt, ohne Upsampler. Voice-Design funktioniert in Schichten, erst Identität, dann Textur, dann Vortrag, so wie Sie Casting-Notizen schreiben würden, und die Benennung des Settings steuert die gesamte Darbietung.

Am besten für: Erzählung, Dokumentation, Trailer und alles, bei dem die Audioqualität im Vordergrund steht

DramaBox

Prompt-gesteuertes Schauspiel
Voice-CloningVoice-Design

Sie schreiben die Stimme und ihre Darbietung zusammen. Text in Anführungszeichen wird gesprochen, Text ohne Anführungszeichen ist Regieanweisung, sodass eine einzige Aufnahme durch Langeweile, Sarkasmus und Verzweiflung führen kann. Sie können ihm auch eine Stimme übergeben und diese Stimme dann klonen und lenken.

Am besten für: Spieldialoge, Animation, Hörspiel und Charakterarbeit

Ebenfalls in der App

Diese laufen in der Cloud und auf dem Desktop neben den Modellen oben, jedes mit seiner eigenen Stärke.

Gepard 1.0

Läuft mit 2 GB VRAM

Ein leichtgewichtiges Cloning-Modell, das für den Betrieb auf schwacher Hardware gebaut ist und nur etwa 2 GB VRAM benötigt, sodass Sie eine Stimme auf einem Desktop-Rechner ohne leistungsstarke GPU klonen können. Es unterstützt Streaming und deckt vier Sprachen ab.

Kokoro

Läuft auf der CPU

Ein Modell mit 82 Millionen Parametern, das schneller generiert als alles andere in der Aufstellung und auch ohne dedizierte GPU einwandfrei läuft. Es verwendet 28 voreingestellte Stimmen, statt eine zu klonen oder zu gestalten, was es einfach und schnell hält.

Anwendungsfälle

Welches Modell für das, was Sie erstellen

Beginnen Sie bei der Arbeit statt beim Modellnamen. Hier ist das Modell, zu dem Sie je nach Aufgabe zuerst greifen sollten, mit einem Satz dazu, warum es passt.

Die meisten Aufgaben haben auch eine zweite und dritte gute Wahl. Bestes TTS-Modell für jeden Anwendungsfall geht die Alternativen für jede durch.

Direkter Vergleich

Wie sich die Modelle vergleichen

Die technischen Daten, die tatsächlich beeinflussen, welches Modell Sie wählen sollten. Eine Durchsicht nach Anwendungsfall statt nach technischen Daten finden Sie in den Leitfäden weiter unten.

ModellSprachenEmotionssteuerungVoice-CloningVoice-DesignAm besten für
OmniVoiceÜber 600Nicht explizit, aus dem Text abgeleitetZero-ShotStrukturierte Attribute, zehn englische AkzenteLokalisierung, mehrsprachiges Cloning, Akzentarbeit und Generierung in großen Mengen
Qwen3-TTS1013 Emotionen, 5 IntensitätenZero-ShotFreie BeschreibungHörbücher, Erklärvideos und jedes Skript, bei dem das Gefühl genau stimmen muss
VoxCPM230, plus neun chinesische DialekteNicht explizit, aus dem Text abgeleitetZero-ShotFreie BeschreibungErzählung, Dokumentation, Trailer und alles, bei dem die Audioqualität im Vordergrund steht
DramaBoxNur EnglischInline gesteuert, direkt im PromptNur als Teil des Voice-DesignsAus einem Prompt oder über eine von Ihnen bereitgestellte StimmeSpieldialoge, Animation, Hörspiel und Charakterarbeit
Gepard 1.04Nicht unterstütztZero-ShotNicht unterstütztVoice-Cloning auf Desktops ohne High-End-GPU und Streaming
KokoroEnglisch, mit 28 voreingestellten StimmenNicht unterstütztNicht unterstütztNicht unterstütztSchnelle, unkomplizierte Erzählung, bei der Sie keine eigene Stimme brauchen

Emotionssteuerung bedeutet, ausdrücklich festzulegen oder zu lenken, welche Emotion die Stimme ausdrückt, statt des Tons, den ein Modell von selbst aus Ihrem Text aufnimmt.

Zwei Zugangswege

Cloud oder Desktop, dieselben Modelle

Sie erhalten in beiden Fällen dieselben Modelle. Der Unterschied liegt darin, wo sie laufen und wie Sie dafür bezahlen.

Voice Creator Pro Cloud

Jedes Modell in Ihrem Browser ausführen

  • Nichts zu installieren, funktioniert von jedem Laptop oder Telefon aus
  • Keine GPU nötig, Server-GPUs führen die Modelle für Sie aus
  • Kostenlose Stufe, die sich monatlich erneuert, bezahlte Tarife ab 5 $ pro Monat
  • Jedes Modell in jedem Tarif, auch im kostenlosen
Kostenlos testen

Desktop-App

Lokal und offline ausführen

  • Führt jedes Modell auf Ihrem eigenen Rechner aus, vollständig offline
  • Unbegrenzte Generierungen, einmaliger Kauf ab 54,99 $
  • Ihr Text und Audio verlassen niemals Ihr Gerät
  • Lokale REST-API für Ihre eigenen Pipelines
Desktop-App holen

Lieber gar nicht anmelden?

Für schnelle, zwanglose Text-to-Speech hosten wir außerdem eine Reihe deutlich leichterer Open-Source-Modelle, die kostenlos auf Ihrem eigenen Gerät laufen, ohne Konto und ohne Limits. Sie sind einfacher und merklich weniger leistungsfähig als die führenden Modelle oben, ohne über 600 Sprachen, Emotionssteuerung oder 48-kHz-Ausgabe, sodass sie sich für den schnellen Alltagsgebrauch eignen statt für professionelle oder kommerzielle Arbeit. Chatterbox Turbo, Supertonic und Kokoro sind alle dabei, und Kokoro erscheint auch in der Aufstellung oben.

Kostenlos testen, ohne Anmeldung

FAQ

Häufige Fragen

Sechs: OmniVoice, Qwen3-TTS, VoxCPM2, DramaBox, Gepard 1.0 und Kokoro. Jedes ist bei einer anderen Aufgabe am stärksten, von der Sprachenvielfalt über die Emotionssteuerung bis zur Ausgabe in Studioqualität, und alle sechs laufen sowohl in Voice Creator Pro Cloud als auch in der Desktop-App.

Ja. Sie wählen das Modell pro Generierung, sodass Sie eine Basisstimme mit einem Modell gestalten und zu einem anderen wechseln können, wenn Sie eine andere Stärke brauchen. Nichts ist an einen Tarif gebunden: Jede Stufe, auch die kostenlose Cloud-Stufe, hat Zugriff auf jedes Modell.

OmniVoice, mit großem Abstand. Es deckt über 600 Sprachen ab und behält den Akzent einer geklonten Stimme bei, selbst wenn diese Stimme die Sprache wechselt, was es zur Wahl für die Lokalisierung macht. VoxCPM2 deckt 30 Sprachen plus neun chinesische Dialekte ab, und Qwen3-TTS deckt 10 ab.

VoxCPM2. Es gibt Audio in Studioqualität mit 48 kHz direkt aus, ohne Upsampler, während die anderen Modelle mit einer niedrigeren Abtastrate ausgeben. Das macht es zum Modell der Wahl, wenn es auf die Audioqualität ankommt, etwa bei Erzählung, Dokumentation und Trailern.

Jedes Modell außer Kokoro kann ohne Trainingsschritt aus einem kurzen Referenzclip eine Stimme klonen. OmniVoice ist die Wahl, wenn die geklonte Stimme eine andere Sprache sprechen und ihren Akzent behalten soll, VoxCPM2, wenn Sie die höchste Sprecherähnlichkeit und Audioqualität wollen, Qwen3-TTS, wenn Sie der geklonten Stimme Emotionen zuweisen möchten, und Gepard 1.0, wenn Sie auf einer Maschine ohne High-End-GPU klonen. DramaBox klont ebenfalls eine Stimme, jedoch nur zusammen mit Voice-Design, sodass Sie die Stimme in einem Schritt klonen und steuern statt in zwei getrennten Aktionen.

Sie können jedes Modell in der kostenlosen Stufe von Voice Creator Pro Cloud nutzen, die sich monatlich erneuert und keine Karte erfordert. Bezahlte Cloud-Tarife beginnen bei 5 $ pro Monat, und die Desktop-App ist ein einmaliger Kauf ab 54,99 $ mit unbegrenzten Generierungen.

Ja, mit der Desktop-App von Voice Creator Pro. Sie führt jedes Modell auf Ihrem eigenen Rechner aus, ohne Verbindung, mit unbegrenzten Generierungen, und Ihr Text und Audio bleiben auf Ihrem Gerät. Voice Creator Pro Cloud ist serverbasiert und benötigt eine Verbindung.

Ja. Audio, das Sie mit einem dieser Modelle generieren, gehört Ihnen, in der Cloud und auf dem Desktop und einschließlich der kostenlosen Stufe, mit vollen kommerziellen Rechten, ohne Lizenzgebühren und ohne erforderliche Namensnennung.

Testen Sie jedes Modell, kostenlos

Jedes Modell ist in der kostenlosen Stufe von Voice Creator Pro Cloud verfügbar, mit vollen kommerziellen Rechten und ohne erforderliche Karte. Oder holen Sie sich die Desktop-App und führen Sie sie offline ohne Generierungslimits aus.