Neu: Song Creator Pro: Musik mit KI erstellen, lokal auf Ihrem Gerät. Jetzt testen →

Supertonic 3 TTS, kostenloses Online-Text-to-Speech

Mehrsprachiges Text-to-Speech in 31 Sprachen mit 10 voreingestellten Stimmen. Läuft vollständig in Ihrem Browser. Keine Anmeldung, keine Installation, völlig kostenlos.

Supertonic kostenlos testen
31 Sprachen
WebGPU-beschleunigt
100% Privat

Warum Supertonic

Warum Supertonic für Text-to-Speech nutzen

Supertonic 3 ist ein MIT-lizenziertes mehrsprachiges Text-to-Speech-System von Supertone. Es nutzt eine vierstufige ONNX-Pipeline (Text-Encoder, Dauer-Prädiktor, Vektor-Schätzer, Vocoder) und läuft vollständig lokal auf dem Gerät über ONNX Runtime Web.

Mit etwa 99 Millionen Parametern ist es ein Bruchteil der Größe der meisten offenen TTS-Systeme und unterstützt dennoch 31 Sprachen und erzeugt natürliche, ausdrucksstarke Sprache.

31 Sprachen

Decken Sie jede wichtige europäische Sprache sowie Koreanisch, Japanisch, Arabisch, Hindi, Vietnamesisch, Indonesisch und mehr mit einem einzigen Modell ab.

10 voreingestellte Stimmen

Fünf männliche und fünf weibliche Stimmstile (M1 bis M5 und F1 bis F5), die in jeder unterstützten Sprache funktionieren.

WebGPU + WASM

Nutzt WebGPU für schnelle Inferenz auf dem Gerät, sofern verfügbar, mit automatischem WebAssembly-Fallback für Firefox und Safari.

Qualitätsanpassung

Erweiterte Einstellungen erlauben es Ihnen, Geschwindigkeit und Qualität abzuwägen, indem Sie die Anzahl der Entrauschungsschritte von 1 bis 32 anpassen.

Erste Schritte

So funktioniert es

1

Öffnen Sie das kostenlose Tool

Gehen Sie in Ihrem Browser zum Supertonic-TTS-Tool. Beim ersten Start wird das Modell heruntergeladen und lokal für das nächste Mal zwischengespeichert.

2

Wählen Sie eine Stimme und Sprache

Wählen Sie eine der 10 voreingestellten Stimmen und die Zielsprache. Jede Stimme kann jede der 31 unterstützten Sprachen sprechen.

3

Geben Sie Ihren Text ein und erzeugen Sie ihn

Geben Sie Ihren Text ein, passen Sie bei Bedarf Geschwindigkeit oder Qualitätsschritte in den erweiterten Einstellungen an und erzeugen Sie dann. Das Audio ist in Sekunden fertig.

Anwendungsfälle

Für wen ist Supertonic?

Mehrsprachige Kreative

Erzeugen Sie Voiceovers in 31 Sprachen mit einem einzigen Modell. Nützlich für internationale Podcasts, synchronisierte Videoinhalte und lokalisierte Social-Media-Beiträge.

Sprachlernende

Erzeugen Sie Aussprachebeispiele und Hörübungen in europäischen, asiatischen und nahöstlichen Sprachen, ohne mehrere TTS-Anbieter jonglieren zu müssen.

Entwickler

Erstellen Sie Prototypen für Sprachfunktionen, die in vielen Sprachen funktionieren müssen. Die MIT-Lizenz bedeutet, dass Sie Supertonic in Ihren eigenen Produkten einsetzen können, auch in kommerziellen.

Barrierefreiheit

Wandeln Sie Artikel, Dokumentationen oder Lernmaterial in Sprache um, für Zielgruppen in Dutzenden Sprachen aus einem einheitlichen Stimmkatalog.

Das Beste aus Supertonic herausholen

Tipps für beste Ergebnisse

Passen Sie die Sprache an Ihren Text an

Supertonic nutzt die ausgewählte Sprache, um die Aussprache zu steuern. Auf die richtige Sprache umzuschalten liefert deutlich bessere Ergebnisse, als sie bei nicht-englischem Text auf Englisch zu belassen.

Stimmen Sie die Qualität über Entrauschungsschritte ab

Niedrigere Schrittzahlen (4 bis 6) sind schneller und gut für Vorschauen. Höhere Zahlen (12 bis 32) liefern das sauberste Audio. Der Standardwert von 8 ist ein sinnvoller Kompromiss.

Nutzen Sie WebGPU, wo verfügbar

Chrome und Edge nutzen Ihre GPU für die Inferenz, was viel schneller ist als WebAssembly. Wenn Sie Firefox oder Safari verwenden und die Erzeugung langsam wirkt, probieren Sie einen Chromium-Browser.

Voice Creator Pro

Mehr nötig? Gehen Sie mit Voice Creator Pro weiter.

Voice Creator Pro bietet Ihnen Modelle mit höherer Qualität, Voice Cloning in über 600 Sprachen, emotionale Sprache und eine Lizenz für die kommerzielle Nutzung. Testen Sie es kostenlos in Ihrem Browser oder laden Sie die Desktop-App herunter.

Voice Cloning

Klonen Sie jede Stimme aus einer kurzen Audioprobe. Zero-Shot-Klonen ohne erforderliches Training

Über 600 Sprachen

Kombinieren Sie mehrere Open-Source-Modelle für TTS in über 600 Sprachen

GPU-beschleunigte Verarbeitung

Schnellere Erzeugung mit Unterstützung für NVIDIA, Apple Silicon, AMD und Intel GPUs

Voice Design aus Text

Beschreiben Sie eine Stimme in einfachem Text und die KI erstellt sie. Keine Audioproben nötig

Lokale REST-API

Automatisieren Sie die Stimmerzeugung in Ihren eigenen Apps und Workflows

Kommerzielle Lizenz

Volle Rechte zur Nutzung erzeugter Audiodateien in kommerziellen Projekten

FAQ

Häufige Fragen

Supertonic ist ein mehrsprachiges Text-to-Speech-System von Supertone, das auf dem Gerät läuft. Supertonic 3 hat 99 Millionen Parameter und unterstützt 31 Sprachen mit 10 voreingestellten Stimmen. Obwohl es nur einen Bruchteil der Größe größerer offener TTS-Systeme hat, erzeugt es natürliche Sprache in hoher Qualität und läuft vollständig auf dem Gerät ohne Cloud-Abhängigkeit.

Supertonic wird von Supertone entwickelt, einem Unternehmen für Sprach-KI. Der Open-Weight-ONNX-Checkpoint wird auf Hugging Face unter der MIT-Lizenz veröffentlicht, sodass Sie ihn frei in privaten oder kommerziellen Projekten verwenden können.

Supertonic 3 unterstützt 31 Sprachen: Englisch, Koreanisch, Japanisch, Arabisch, Bulgarisch, Tschechisch, Dänisch, Deutsch, Griechisch, Spanisch, Estnisch, Finnisch, Französisch, Hindi, Kroatisch, Ungarisch, Indonesisch, Italienisch, Litauisch, Lettisch, Niederländisch, Polnisch, Portugiesisch, Rumänisch, Russisch, Slowakisch, Slowenisch, Schwedisch, Türkisch, Ukrainisch und Vietnamesisch, sowie einen sprachunabhängigen Modus.

Supertonic wird mit 10 voreingestellten Stimmstilen geliefert: fünf männliche (M1 bis M5) und fünf weibliche (F1 bis F5). Jede Stimme kann jede der unterstützten Sprachen sprechen.

Ja. Supertonic 3 wird unter der MIT-Lizenz veröffentlicht, einer der freizügigsten Open-Source-Lizenzen. Auf dieser Website läuft es direkt in Ihrem Browser, ohne Konto, ohne Anmeldung und ohne Nutzungsobergrenzen.

Mit etwa 99 Millionen Parametern ist Supertonic 3 ein Bruchteil der Größe offener TTS-Systeme mit 0,7 bis 2 Milliarden Parametern und bleibt dabei bei Qualitäts-Benchmarks konkurrenzfähig. Die kleinere Modellgröße bedeutet schnellere Kaltstarts, kleinere Downloads und geringeren Speicherbedarf, was die Inferenz im Browser praktikabel macht. Für Voice Cloning, Voice Design und über 600 Sprachen ist Voice Creator Pro das Desktop-Gegenstück.

Supertonic 3 wiegt beim ersten Download etwa 400 MB und wird danach lokal zwischengespeichert. Es läuft am besten in Browsern mit WebGPU-Unterstützung (Chrome, Edge), wo es Ihre GPU für die Inferenz nutzen kann. WebAssembly wird automatisch als Fallback verwendet. Jeder aktuelle Laptop oder Desktop-Rechner kann es ausführen, aber der erste Download dauert länger als bei kleineren Modellen.

Chrome und Edge funktionieren am besten, da sie WebGPU-Beschleunigung unterstützen. Firefox und Safari funktionieren ebenfalls, greifen aber auf WebAssembly zurück, was langsamer ist. Beim ersten Start wird das Modell heruntergeladen und zwischengespeichert; nachfolgende Starts sind deutlich schneller.