Neu: Song Creator Pro: Musik mit KI erstellen, lokal auf Ihrem Gerät. Jetzt testen →

Pocket TTS online kostenlos testen

Leichtgewichtiges Voice Cloning und Text-to-Speech, die auf fast jedem Gerät läuft. Kein GPU nötig, keine Anmeldung, vollständig privat.

Pocket TTS kostenlos testen
100% privat
Keine Installation nötig
Kostenlos und unbegrenzt

Warum Pocket TTS

Warum Pocket TTS verwenden

Pocket TTS ist ein quelloffenes, MIT-lizenziertes Text-to-Speech-Modell von Kyutai Labs. Mit rund 100 Millionen Parametern und einer Continuous Audio Language Model (CALM) Architektur wurde es von Grund auf dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen.

Es unterstützt sowohl integrierte Voreinstellungsstimmen als auch Voice Cloning aus kurzen Audioclips, alles in einem Paket, das als INT8-quantisiertes ONNX-Modell nur 148 MB wiegt.

CPU-optimiert

Dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen. Kein GPU erforderlich, was es auf praktisch jedem Gerät zugänglich macht.

Voice Cloning

Klonen Sie eine Stimme aus einem kurzen Audioclip. Laden Sie eine Referenzprobe hoch und erzeugen Sie sofort Sprache in dieser Stimme.

Integrierte Stimmen

Voreingestellte Stimmen für schnelles Text-to-Speech, ohne dass Sie eine Referenz-Audioprobe bereitstellen müssen.

Leichtgewichtig

Nur 148 MB als INT8-quantisiertes ONNX-Modell. Lädt schnell und läuft effizient in Ihrem Browser.

Loslegen

So funktioniert es

Für Text-to-Speech: Wählen Sie eine integrierte Stimme, geben Sie Ihren Text ein und generieren Sie. Für Voice Cloning laden Sie stattdessen einen kurzen Audioclip hoch.

1

Öffnen Sie das kostenlose Tool

Rufen Sie das Pocket TTS Tool in Ihrem Browser auf. Wählen Sie eine integrierte Stimme für schnelles TTS oder laden Sie einen kurzen Audioclip hoch, um eine Stimme zu klonen.

2

Geben Sie Ihren Text ein

Geben Sie den Text ein, der gesprochen werden soll. Pocket TTS unterstützt englische Texteingabe.

3

Generieren und herunterladen

Klicken Sie auf Generieren und Ihr Audio ist in Sekunden fertig. Passen Sie die LSD-Schritte an, wenn Sie die Balance zwischen Qualität und Geschwindigkeit feinjustieren möchten.

Anwendungsfälle

Für wen ist Pocket TTS?

Entwickler

Bauen Sie Sprachfunktionen für Edge- und Embedded-Anwendungen. Pocket TTS ist klein genug, um auf ressourcenbeschränkten Geräten eingesetzt zu werden, und schnell genug, um in Echtzeit auf der CPU zu laufen.

Content-Ersteller

Erzeugen Sie Voiceover für Videos, Podcasts oder Social-Media-Inhalte. Nutzen Sie integrierte Stimmen für schnelle Erzählungen oder klonen Sie Ihre eigene Stimme aus einer kurzen Probe.

Datenschutzbewusste Nutzer

Alles läuft lokal in Ihrem Browser. Es wird kein Audio auf einen Server hochgeladen, kein Konto ist erforderlich und keine Daten verlassen Ihr Gerät.

Hobbyisten und Bastler

Experimentieren Sie mit Text-to-Speech und Voice Cloning in einem leichtgewichtigen, MIT-lizenzierten Modell. Perfekt für persönliche Projekte, zum Lernen und für Prototypen.

Das Beste aus Pocket TTS herausholen

Tipps für beste Ergebnisse

Verwenden Sie sauberes Referenzaudio zum Klonen

Hintergrundgeräusche, Musik oder Raumhall beeinträchtigen die Qualität der geklonten Stimme. Verwenden Sie einen Clip mit klarer, isolierter Sprache und minimalen Störungen.

Passen Sie die LSD-Schritte an Ihre Bedürfnisse an

Höhere LSD-Schritte erzeugen Audio in besserer Qualität, brauchen aber länger zum Generieren. Weniger Schritte sind schneller, können aber die Wiedergabetreue verringern. Beginnen Sie bei etwa 5 und passen Sie von dort aus an.

Integrierte Stimmen eignen sich hervorragend für schnelles TTS

Wenn Sie nur schnelles Text-to-Speech ohne Voice Cloning benötigen, liefern die integrierten Voreinstellungsstimmen einheitliche Ergebnisse ganz ohne Einrichtung.

Voice Creator Pro

Brauchen Sie mehr Leistung? Testen Sie Voice Creator Pro.

Voice Creator Pro bietet Ihnen hochwertigere Modelle, Voice Cloning in über 600 Sprachen, emotionale Sprache und eine kommerzielle Nutzungslizenz. Testen Sie es kostenlos in Ihrem Browser oder laden Sie die Desktop-App herunter.

GPU-beschleunigte Verarbeitung

Schnellere Generierung mit Unterstützung für NVIDIA, Apple Silicon, AMD und Intel GPUs

Voice Cloning in über 600 Sprachen

Kombinieren Sie mehrere quelloffene Modelle für TTS und Voice Cloning in über 600 Sprachen

Voice Design aus Text

Beschreiben Sie eine Stimme in einfachem Text und die KI erstellt sie. Keine Audioproben nötig

Lokale REST-API

Automatisieren Sie die Stimmerzeugung in Ihren eigenen Apps und Workflows

Kommerzielle Lizenz

Volle Rechte zur Nutzung des erzeugten Audios in kommerziellen Projekten

Mehrere Modelle in einer App

Greifen Sie aus einer einzigen Desktop-Anwendung auf Pocket TTS, Chatterbox, Kokoro und mehr zu

FAQ

Häufige Fragen

Pocket TTS ist ein leichtgewichtiges Text-to-Speech-Modell von Kyutai Labs. Es verwendet eine Continuous Audio Language Model (CALM) Architektur mit rund 100 Millionen Parametern und ist damit klein genug, um auf der CPU schneller als in Echtzeit zu laufen. Es unterstützt sowohl integrierte Voreinstellungsstimmen als auch Voice Cloning aus kurzen Audioproben.

Pocket TTS wurde von Kyutai Labs entwickelt, einer Forschungsorganisation, die sich auf KI-Kommunikation in Echtzeit konzentriert. Sie haben es unter der MIT-Lizenz veröffentlicht, einer der freizügigsten verfügbaren Open-Source-Lizenzen, sodass jeder es nutzen, prüfen und darauf aufbauen kann.

Ja. Pocket TTS kann eine Stimme aus einem kurzen Audioclip klonen. Laden Sie einfach eine Referenz-Audioprobe hoch und das Modell erzeugt Sprache in dieser Stimme. Es bietet außerdem integrierte Voreinstellungsstimmen, falls Sie das Klonen überspringen und sofort Sprache erzeugen möchten.

CALM steht für Continuous Audio Language Model. Es ist die Architektur, die Pocket TTS zur Spracherzeugung verwendet. Anders als Ansätze mit diskreten Tokens arbeitet CALM mit kontinuierlichen Audiodarstellungen, wodurch das Modell extrem kompakt bleiben und dennoch natürlich klingende Sprache erzeugen kann.

Ja. Pocket TTS ist quelloffene Software, die unter der MIT-Lizenz veröffentlicht wurde. Auf dieser Website läuft es direkt in Ihrem Browser, ohne Konto, ohne Anmeldung und ohne Nutzungslimits. Alles bleibt auf Ihrem Gerät.

LSD-Schritte steuern die Qualität des erzeugten Audios. Eine höhere Anzahl an Schritten erzeugt eine bessere Ausgabequalität, dauert aber länger. Eine niedrigere Anzahl ist schneller, kann aber etwas Audiotreue kosten. Sie können dies mit einem Regler von 1 bis 10 anpassen, um die richtige Balance für Ihre Bedürfnisse zu finden.

Nein. Pocket TTS wurde speziell dafür entwickelt, auf der CPU schneller als in Echtzeit zu laufen. Das INT8-quantisierte ONNX-Modell ist nur etwa 148 MB groß, sodass es schnell lädt und auf praktisch jedem modernen Gerät effizient läuft, einschließlich Laptops, Tablets und Smartphones.

Chrome, Edge und andere Chromium-basierte Browser funktionieren am besten. Firefox und Safari haben eingeschränkte Unterstützung für einige der Webfunktionen, die zur Beschleunigung verwendet werden.