Neu: Song Creator Pro: Musik mit KI erstellen, lokal auf Ihrem Gerät. Jetzt testen →

Pocket TTS online kostenlos testen

Leichtgewichtiges Text-to-Speech, das auf fast jedem Gerät läuft. Keine GPU nötig, keine Anmeldung, komplett privat.

Pocket TTS kostenlos testen
100% privat
Keine Installation nötig
Kostenlos und unbegrenzt

Warum Pocket TTS

Warum Pocket TTS verwenden

Pocket TTS ist ein quelloffenes, MIT-lizenziertes Text-to-Speech-Modell von Kyutai Labs. Mit rund 100 Millionen Parametern und einer Continuous Audio Language Model (CALM) Architektur wurde es von Grund auf dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen.

Es bringt integrierte Standardstimmen mit, in einem Paket von nur 148 MB als INT8-quantisiertes ONNX-Modell.

CPU-optimiert

Dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen. Kein GPU erforderlich, was es auf praktisch jedem Gerät zugänglich macht.

Voice Cloning in der Cloud

Sie möchten eine Stimme klonen? Voice Cloning ist Teil von Voice Creator Pro Cloud, mit einem kostenlosen Plan von 5.000 Tokens pro Monat.

Integrierte Stimmen

Voreingestellte Stimmen für schnelles Text-to-Speech, ohne dass Sie eine Referenz-Audioprobe bereitstellen müssen.

Leichtgewichtig

Nur 148 MB als INT8-quantisiertes ONNX-Modell. Lädt schnell und läuft effizient in Ihrem Browser.

Loslegen

So funktioniert es

Für Text-to-Speech: Wählen Sie eine integrierte Stimme, geben Sie Ihren Text ein und generieren Sie.

1

Öffnen Sie das kostenlose Tool

Rufen Sie das Pocket TTS Tool in Ihrem Browser auf und wählen Sie eine integrierte Stimme. Kein Download und keine Anmeldung erforderlich.

2

Geben Sie Ihren Text ein

Geben Sie den Text ein, der gesprochen werden soll. Pocket TTS unterstützt englische Texteingabe.

3

Generieren und herunterladen

Klicken Sie auf Generieren und Ihr Audio ist in Sekunden fertig. Passen Sie die LSD-Schritte an, wenn Sie die Balance zwischen Qualität und Geschwindigkeit feinjustieren möchten.

Anwendungsfälle

Für wen ist Pocket TTS?

Entwickler

Bauen Sie Sprachfunktionen für Edge- und Embedded-Anwendungen. Pocket TTS ist klein genug, um auf ressourcenbeschränkten Geräten eingesetzt zu werden, und schnell genug, um in Echtzeit auf der CPU zu laufen.

Content-Ersteller

Erstellen Sie Voiceover für Videos, Podcasts oder Social-Media-Inhalte. Integrierte Stimmen liefern schnelle, konsistente Sprachausgabe.

Datenschutzbewusste Nutzer

Alles läuft lokal in Ihrem Browser. Es wird kein Audio auf einen Server hochgeladen, kein Konto ist erforderlich und keine Daten verlassen Ihr Gerät.

Hobbyisten und Bastler

Experimentieren Sie mit Text-to-Speech in einem leichtgewichtigen, MIT-lizenzierten Modell. Perfekt für persönliche Projekte, Lernen und Prototyping.

Das Beste aus Pocket TTS herausholen

Tipps für beste Ergebnisse

Kurze Sätze klingen am natürlichsten

Pocket TTS verarbeitet gesprächsnahe Texte in Satzlänge am besten. Teilen Sie sehr lange Passagen in Absätze für ein natürlicheres Sprechtempo.

Passen Sie die LSD-Schritte an Ihre Bedürfnisse an

Höhere LSD-Schritte erzeugen Audio in besserer Qualität, brauchen aber länger zum Generieren. Weniger Schritte sind schneller, können aber die Wiedergabetreue verringern. Beginnen Sie bei etwa 5 und passen Sie von dort aus an.

Integrierte Stimmen eignen sich hervorragend für schnelles TTS

Wenn Sie nur schnelles Text-to-Speech ohne Voice Cloning benötigen, liefern die integrierten Voreinstellungsstimmen einheitliche Ergebnisse ganz ohne Einrichtung.

Voice Creator Pro

Brauchen Sie mehr Leistung? Testen Sie Voice Creator Pro.

Voice Creator Pro bietet höherwertige Modelle, Voice Cloning in über 600 Sprachen, emotionale Sprache und eine Lizenz für die kommerzielle Nutzung. Der kostenlose Cloud-Plan enthält pro Monat 1 Stunde 45 Minuten Text-to-Speech mit Basis-Stimmen oder 10 Minuten Voice Cloning, ohne Kreditkarte.

Keine GPU nötig

Die Generierung läuft auf unserer Hardware und funktioniert auf jedem Laptop, Tablet oder Smartphone

Voice Cloning in über 600 Sprachen

Kombinieren Sie mehrere quelloffene Modelle für TTS und Voice Cloning in über 600 Sprachen

Voice Design aus Text

Beschreiben Sie eine Stimme in einfachem Text und die KI erstellt sie. Keine Audioproben nötig

Emotionale Sprache

13 Emotionen in 5 Intensitäten mit Qwen3-TTS

Kommerzielle Lizenz

Volle Rechte zur Nutzung des erzeugten Audios in kommerziellen Projekten

Mehrere Modelle an einem Ort

Wechseln Sie zwischen OmniVoice, Qwen3-TTS, VoxCPM2, Kokoro und mehr, ohne das Werkzeug zu wechseln

FAQ

Häufige Fragen

Pocket TTS ist ein leichtgewichtiges Text-to-Speech-Modell von Kyutai Labs. Es verwendet eine Continuous Audio Language Model (CALM) Architektur mit rund 100 Millionen Parametern und ist damit klein genug, um auf der CPU schneller als in Echtzeit zu laufen. Es unterstützt sowohl integrierte Voreinstellungsstimmen als auch Voice Cloning aus kurzen Audioproben.

Pocket TTS wurde von Kyutai Labs entwickelt, einer Forschungsorganisation, die sich auf KI-Kommunikation in Echtzeit konzentriert. Sie haben es unter der MIT-Lizenz veröffentlicht, einer der freizügigsten verfügbaren Open-Source-Lizenzen, sodass jeder es nutzen, prüfen und darauf aufbauen kann.

Das Pocket-TTS-Modell unterstützt Voice Cloning, aber das kostenlose Browser-Tool konzentriert sich auf Text-to-Speech mit den integrierten Stimmen. Die Cloud-Version von Voice Creator Pro bietet Voice Cloning mit einem kostenlosen Plan von 5.000 Tokens pro Monat, bis zu 10 Minuten Voice Cloning.

CALM steht für Continuous Audio Language Model. Es ist die Architektur, die Pocket TTS zur Spracherzeugung verwendet. Anders als Ansätze mit diskreten Tokens arbeitet CALM mit kontinuierlichen Audiodarstellungen, wodurch das Modell extrem kompakt bleiben und dennoch natürlich klingende Sprache erzeugen kann.

Ja. Pocket TTS ist quelloffene Software unter der MIT-Lizenz. Auf dieser Seite läuft Text-to-Speech mit den integrierten Stimmen direkt in Ihrem Browser, ohne Konto, ohne Anmeldung und ohne Nutzungslimits.

LSD-Schritte steuern die Qualität des erzeugten Audios. Eine höhere Anzahl an Schritten erzeugt eine bessere Ausgabequalität, dauert aber länger. Eine niedrigere Anzahl ist schneller, kann aber etwas Audiotreue kosten. Sie können dies mit einem Regler von 1 bis 10 anpassen, um die richtige Balance für Ihre Bedürfnisse zu finden.

Nein. Pocket TTS wurde speziell dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen. Das INT8-quantisierte ONNX-Modell ist nur etwa 148 MB groß, sodass es schnell lädt und auf praktisch jedem modernen Gerät effizient läuft, einschließlich Laptops, Tablets und Smartphones.

Chrome, Edge und andere Chromium-basierte Browser funktionieren am besten. Firefox und Safari haben eingeschränkte Unterstützung für einige der Webfunktionen, die zur Beschleunigung verwendet werden.