Supertonic 3 TTS, kostenloses Online-Text-to-Speech
Mehrsprachiges Text-to-Speech in 31 Sprachen mit 10 voreingestellten Stimmen. Läuft vollständig in Ihrem Browser. Keine Anmeldung, keine Installation, völlig kostenlos.
Supertonic kostenlos testenWarum Supertonic
Warum Supertonic für Text-to-Speech nutzen
Supertonic 3 ist ein MIT-lizenziertes mehrsprachiges Text-to-Speech-System von Supertone. Es nutzt eine vierstufige ONNX-Pipeline (Text-Encoder, Dauer-Prädiktor, Vektor-Schätzer, Vocoder) und läuft vollständig lokal auf dem Gerät über ONNX Runtime Web.
Mit etwa 99 Millionen Parametern ist es ein Bruchteil der Größe der meisten offenen TTS-Systeme und unterstützt dennoch 31 Sprachen und erzeugt natürliche, ausdrucksstarke Sprache.
31 Sprachen
Decken Sie jede wichtige europäische Sprache sowie Koreanisch, Japanisch, Arabisch, Hindi, Vietnamesisch, Indonesisch und mehr mit einem einzigen Modell ab.
10 voreingestellte Stimmen
Fünf männliche und fünf weibliche Stimmstile (M1 bis M5 und F1 bis F5), die in jeder unterstützten Sprache funktionieren.
WebGPU + WASM
Nutzt WebGPU für schnelle Inferenz auf dem Gerät, sofern verfügbar, mit automatischem WebAssembly-Fallback für Firefox und Safari.
Qualitätsanpassung
Erweiterte Einstellungen erlauben es Ihnen, Geschwindigkeit und Qualität abzuwägen, indem Sie die Anzahl der Entrauschungsschritte von 1 bis 32 anpassen.
Erste Schritte
So funktioniert es
Öffnen Sie das kostenlose Tool
Gehen Sie in Ihrem Browser zum Supertonic-TTS-Tool. Beim ersten Start wird das Modell heruntergeladen und lokal für das nächste Mal zwischengespeichert.
Wählen Sie eine Stimme und Sprache
Wählen Sie eine der 10 voreingestellten Stimmen und die Zielsprache. Jede Stimme kann jede der 31 unterstützten Sprachen sprechen.
Geben Sie Ihren Text ein und erzeugen Sie ihn
Geben Sie Ihren Text ein, passen Sie bei Bedarf Geschwindigkeit oder Qualitätsschritte in den erweiterten Einstellungen an und erzeugen Sie dann. Das Audio ist in Sekunden fertig.
Anwendungsfälle
Für wen ist Supertonic?
Mehrsprachige Kreative
Erzeugen Sie Voiceovers in 31 Sprachen mit einem einzigen Modell. Nützlich für internationale Podcasts, synchronisierte Videoinhalte und lokalisierte Social-Media-Beiträge.
Sprachlernende
Erzeugen Sie Aussprachebeispiele und Hörübungen in europäischen, asiatischen und nahöstlichen Sprachen, ohne mehrere TTS-Anbieter jonglieren zu müssen.
Entwickler
Erstellen Sie Prototypen für Sprachfunktionen, die in vielen Sprachen funktionieren müssen. Die MIT-Lizenz bedeutet, dass Sie Supertonic in Ihren eigenen Produkten einsetzen können, auch in kommerziellen.
Barrierefreiheit
Wandeln Sie Artikel, Dokumentationen oder Lernmaterial in Sprache um, für Zielgruppen in Dutzenden Sprachen aus einem einheitlichen Stimmkatalog.
Das Beste aus Supertonic herausholen
Tipps für beste Ergebnisse
Passen Sie die Sprache an Ihren Text an
Supertonic nutzt die ausgewählte Sprache, um die Aussprache zu steuern. Auf die richtige Sprache umzuschalten liefert deutlich bessere Ergebnisse, als sie bei nicht-englischem Text auf Englisch zu belassen.
Stimmen Sie die Qualität über Entrauschungsschritte ab
Niedrigere Schrittzahlen (4 bis 6) sind schneller und gut für Vorschauen. Höhere Zahlen (12 bis 32) liefern das sauberste Audio. Der Standardwert von 8 ist ein sinnvoller Kompromiss.
Nutzen Sie WebGPU, wo verfügbar
Chrome und Edge nutzen Ihre GPU für die Inferenz, was viel schneller ist als WebAssembly. Wenn Sie Firefox oder Safari verwenden und die Erzeugung langsam wirkt, probieren Sie einen Chromium-Browser.
Voice Creator Pro
Mehr nötig? Gehen Sie mit Voice Creator Pro weiter.
Voice Creator Pro bietet Ihnen Modelle mit höherer Qualität, Voice Cloning in über 600 Sprachen, emotionale Sprache und eine Lizenz für die kommerzielle Nutzung. Testen Sie es kostenlos in Ihrem Browser oder laden Sie die Desktop-App herunter.
Voice Cloning
Klonen Sie jede Stimme aus einer kurzen Audioprobe. Zero-Shot-Klonen ohne erforderliches Training
Über 600 Sprachen
Kombinieren Sie mehrere Open-Source-Modelle für TTS in über 600 Sprachen
GPU-beschleunigte Verarbeitung
Schnellere Erzeugung mit Unterstützung für NVIDIA, Apple Silicon, AMD und Intel GPUs
Voice Design aus Text
Beschreiben Sie eine Stimme in einfachem Text und die KI erstellt sie. Keine Audioproben nötig
Lokale REST-API
Automatisieren Sie die Stimmerzeugung in Ihren eigenen Apps und Workflows
Kommerzielle Lizenz
Volle Rechte zur Nutzung erzeugter Audiodateien in kommerziellen Projekten
FAQ
Häufige Fragen
Supertonic ist ein mehrsprachiges Text-to-Speech-System von Supertone, das auf dem Gerät läuft. Supertonic 3 hat 99 Millionen Parameter und unterstützt 31 Sprachen mit 10 voreingestellten Stimmen. Obwohl es nur einen Bruchteil der Größe größerer offener TTS-Systeme hat, erzeugt es natürliche Sprache in hoher Qualität und läuft vollständig auf dem Gerät ohne Cloud-Abhängigkeit.
Supertonic wird von Supertone entwickelt, einem Unternehmen für Sprach-KI. Der Open-Weight-ONNX-Checkpoint wird auf Hugging Face unter der MIT-Lizenz veröffentlicht, sodass Sie ihn frei in privaten oder kommerziellen Projekten verwenden können.
Supertonic 3 unterstützt 31 Sprachen: Englisch, Koreanisch, Japanisch, Arabisch, Bulgarisch, Tschechisch, Dänisch, Deutsch, Griechisch, Spanisch, Estnisch, Finnisch, Französisch, Hindi, Kroatisch, Ungarisch, Indonesisch, Italienisch, Litauisch, Lettisch, Niederländisch, Polnisch, Portugiesisch, Rumänisch, Russisch, Slowakisch, Slowenisch, Schwedisch, Türkisch, Ukrainisch und Vietnamesisch, sowie einen sprachunabhängigen Modus.
Supertonic wird mit 10 voreingestellten Stimmstilen geliefert: fünf männliche (M1 bis M5) und fünf weibliche (F1 bis F5). Jede Stimme kann jede der unterstützten Sprachen sprechen.
Ja. Supertonic 3 wird unter der MIT-Lizenz veröffentlicht, einer der freizügigsten Open-Source-Lizenzen. Auf dieser Website läuft es direkt in Ihrem Browser, ohne Konto, ohne Anmeldung und ohne Nutzungsobergrenzen.
Mit etwa 99 Millionen Parametern ist Supertonic 3 ein Bruchteil der Größe offener TTS-Systeme mit 0,7 bis 2 Milliarden Parametern und bleibt dabei bei Qualitäts-Benchmarks konkurrenzfähig. Die kleinere Modellgröße bedeutet schnellere Kaltstarts, kleinere Downloads und geringeren Speicherbedarf, was die Inferenz im Browser praktikabel macht. Für Voice Cloning, Voice Design und über 600 Sprachen ist Voice Creator Pro das Desktop-Gegenstück.
Supertonic 3 wiegt beim ersten Download etwa 400 MB und wird danach lokal zwischengespeichert. Es läuft am besten in Browsern mit WebGPU-Unterstützung (Chrome, Edge), wo es Ihre GPU für die Inferenz nutzen kann. WebAssembly wird automatisch als Fallback verwendet. Jeder aktuelle Laptop oder Desktop-Rechner kann es ausführen, aber der erste Download dauert länger als bei kleineren Modellen.
Chrome und Edge funktionieren am besten, da sie WebGPU-Beschleunigung unterstützen. Firefox und Safari funktionieren ebenfalls, greifen aber auf WebAssembly zurück, was langsamer ist. Beim ersten Start wird das Modell heruntergeladen und zwischengespeichert; nachfolgende Starts sind deutlich schneller.