Pocket TTS online kostenlos testen
Leichtgewichtiges Voice Cloning und Text-to-Speech, die auf fast jedem Gerät läuft. Kein GPU nötig, keine Anmeldung, vollständig privat.
Pocket TTS kostenlos testenWarum Pocket TTS
Warum Pocket TTS verwenden
Pocket TTS ist ein quelloffenes, MIT-lizenziertes Text-to-Speech-Modell von Kyutai Labs. Mit rund 100 Millionen Parametern und einer Continuous Audio Language Model (CALM) Architektur wurde es von Grund auf dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen.
Es unterstützt sowohl integrierte Voreinstellungsstimmen als auch Voice Cloning aus kurzen Audioclips, alles in einem Paket, das als INT8-quantisiertes ONNX-Modell nur 148 MB wiegt.
CPU-optimiert
Dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen. Kein GPU erforderlich, was es auf praktisch jedem Gerät zugänglich macht.
Voice Cloning
Klonen Sie eine Stimme aus einem kurzen Audioclip. Laden Sie eine Referenzprobe hoch und erzeugen Sie sofort Sprache in dieser Stimme.
Integrierte Stimmen
Voreingestellte Stimmen für schnelles Text-to-Speech, ohne dass Sie eine Referenz-Audioprobe bereitstellen müssen.
Leichtgewichtig
Nur 148 MB als INT8-quantisiertes ONNX-Modell. Lädt schnell und läuft effizient in Ihrem Browser.
Loslegen
So funktioniert es
Für Text-to-Speech: Wählen Sie eine integrierte Stimme, geben Sie Ihren Text ein und generieren Sie. Für Voice Cloning laden Sie stattdessen einen kurzen Audioclip hoch.
Öffnen Sie das kostenlose Tool
Rufen Sie das Pocket TTS Tool in Ihrem Browser auf. Wählen Sie eine integrierte Stimme für schnelles TTS oder laden Sie einen kurzen Audioclip hoch, um eine Stimme zu klonen.
Geben Sie Ihren Text ein
Geben Sie den Text ein, der gesprochen werden soll. Pocket TTS unterstützt englische Texteingabe.
Generieren und herunterladen
Klicken Sie auf Generieren und Ihr Audio ist in Sekunden fertig. Passen Sie die LSD-Schritte an, wenn Sie die Balance zwischen Qualität und Geschwindigkeit feinjustieren möchten.
Anwendungsfälle
Für wen ist Pocket TTS?
Entwickler
Bauen Sie Sprachfunktionen für Edge- und Embedded-Anwendungen. Pocket TTS ist klein genug, um auf ressourcenbeschränkten Geräten eingesetzt zu werden, und schnell genug, um in Echtzeit auf der CPU zu laufen.
Content-Ersteller
Erzeugen Sie Voiceover für Videos, Podcasts oder Social-Media-Inhalte. Nutzen Sie integrierte Stimmen für schnelle Erzählungen oder klonen Sie Ihre eigene Stimme aus einer kurzen Probe.
Datenschutzbewusste Nutzer
Alles läuft lokal in Ihrem Browser. Es wird kein Audio auf einen Server hochgeladen, kein Konto ist erforderlich und keine Daten verlassen Ihr Gerät.
Hobbyisten und Bastler
Experimentieren Sie mit Text-to-Speech und Voice Cloning in einem leichtgewichtigen, MIT-lizenzierten Modell. Perfekt für persönliche Projekte, zum Lernen und für Prototypen.
Das Beste aus Pocket TTS herausholen
Tipps für beste Ergebnisse
Verwenden Sie sauberes Referenzaudio zum Klonen
Hintergrundgeräusche, Musik oder Raumhall beeinträchtigen die Qualität der geklonten Stimme. Verwenden Sie einen Clip mit klarer, isolierter Sprache und minimalen Störungen.
Passen Sie die LSD-Schritte an Ihre Bedürfnisse an
Höhere LSD-Schritte erzeugen Audio in besserer Qualität, brauchen aber länger zum Generieren. Weniger Schritte sind schneller, können aber die Wiedergabetreue verringern. Beginnen Sie bei etwa 5 und passen Sie von dort aus an.
Integrierte Stimmen eignen sich hervorragend für schnelles TTS
Wenn Sie nur schnelles Text-to-Speech ohne Voice Cloning benötigen, liefern die integrierten Voreinstellungsstimmen einheitliche Ergebnisse ganz ohne Einrichtung.
Voice Creator Pro
Brauchen Sie mehr Leistung? Testen Sie Voice Creator Pro.
Voice Creator Pro bietet Ihnen hochwertigere Modelle, Voice Cloning in über 600 Sprachen, emotionale Sprache und eine kommerzielle Nutzungslizenz. Testen Sie es kostenlos in Ihrem Browser oder laden Sie die Desktop-App herunter.
GPU-beschleunigte Verarbeitung
Schnellere Generierung mit Unterstützung für NVIDIA, Apple Silicon, AMD und Intel GPUs
Voice Cloning in über 600 Sprachen
Kombinieren Sie mehrere quelloffene Modelle für TTS und Voice Cloning in über 600 Sprachen
Voice Design aus Text
Beschreiben Sie eine Stimme in einfachem Text und die KI erstellt sie. Keine Audioproben nötig
Lokale REST-API
Automatisieren Sie die Stimmerzeugung in Ihren eigenen Apps und Workflows
Kommerzielle Lizenz
Volle Rechte zur Nutzung des erzeugten Audios in kommerziellen Projekten
Mehrere Modelle in einer App
Greifen Sie aus einer einzigen Desktop-Anwendung auf Pocket TTS, Chatterbox, Kokoro und mehr zu
FAQ
Häufige Fragen
Pocket TTS ist ein leichtgewichtiges Text-to-Speech-Modell von Kyutai Labs. Es verwendet eine Continuous Audio Language Model (CALM) Architektur mit rund 100 Millionen Parametern und ist damit klein genug, um auf der CPU schneller als in Echtzeit zu laufen. Es unterstützt sowohl integrierte Voreinstellungsstimmen als auch Voice Cloning aus kurzen Audioproben.
Pocket TTS wurde von Kyutai Labs entwickelt, einer Forschungsorganisation, die sich auf KI-Kommunikation in Echtzeit konzentriert. Sie haben es unter der MIT-Lizenz veröffentlicht, einer der freizügigsten verfügbaren Open-Source-Lizenzen, sodass jeder es nutzen, prüfen und darauf aufbauen kann.
Ja. Pocket TTS kann eine Stimme aus einem kurzen Audioclip klonen. Laden Sie einfach eine Referenz-Audioprobe hoch und das Modell erzeugt Sprache in dieser Stimme. Es bietet außerdem integrierte Voreinstellungsstimmen, falls Sie das Klonen überspringen und sofort Sprache erzeugen möchten.
CALM steht für Continuous Audio Language Model. Es ist die Architektur, die Pocket TTS zur Spracherzeugung verwendet. Anders als Ansätze mit diskreten Tokens arbeitet CALM mit kontinuierlichen Audiodarstellungen, wodurch das Modell extrem kompakt bleiben und dennoch natürlich klingende Sprache erzeugen kann.
Ja. Pocket TTS ist quelloffene Software, die unter der MIT-Lizenz veröffentlicht wurde. Auf dieser Website läuft es direkt in Ihrem Browser, ohne Konto, ohne Anmeldung und ohne Nutzungslimits. Alles bleibt auf Ihrem Gerät.
LSD-Schritte steuern die Qualität des erzeugten Audios. Eine höhere Anzahl an Schritten erzeugt eine bessere Ausgabequalität, dauert aber länger. Eine niedrigere Anzahl ist schneller, kann aber etwas Audiotreue kosten. Sie können dies mit einem Regler von 1 bis 10 anpassen, um die richtige Balance für Ihre Bedürfnisse zu finden.
Nein. Pocket TTS wurde speziell dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen. Das INT8-quantisierte ONNX-Modell ist nur etwa 148 MB groß, sodass es schnell lädt und auf praktisch jedem modernen Gerät effizient läuft, einschließlich Laptops, Tablets und Smartphones.
Chrome, Edge und andere Chromium-basierte Browser funktionieren am besten. Firefox und Safari haben eingeschränkte Unterstützung für einige der Webfunktionen, die zur Beschleunigung verwendet werden.