Neu: Song Creator Pro: Musik mit KI erstellen, lokal auf Ihrem Gerät. Jetzt testen →

Audio kostenlos in Text umwandeln

Verwandeln Sie jede Aufnahme in Text mit wortgenauen Zeitstempeln, in welcher der 30 Sprachen sie auch gesprochen wurde. Alles läuft in Ihrem Browser-Tab, Ihr Audio verlässt Ihr Gerät also nie. Keine Anmeldung, keine Installation, völlig kostenlos.

MillionenvonMenschensindaufUntertitelangewiesen,umInhaltezukonsumieren.PräziseTranskriptionmitZeitstempelnaufWortebenebedeutet,dasseureVideos,KurseundPodcastsvomerstenTaganzugänglichsindundnichterstimNachhinein.
35 words15.4s
Audio kostenlos umwandeln
Audio verlässt Ihr Gerät nie
Versteht 30 Sprachen
Kostenlos und unbegrenzt

Funktionen

Was das kostenlose Tool kann

EnglishEspañolFrançaisDeutschItalianoPortuguêsPolskiРусский中文粤語日本語한국어हिन्दीالعربيةไทย+15 weitere

30 Sprachen

Sprache in einer von 30 Sprachen wird in genau dieser Sprache transkribiert. Lassen Sie die automatische Erkennung laufen, dann findet das Modell heraus, welche es hört.

jedes
0,0s
Wort
0,3s
hat
0,6s
seine
0,9s
eigene
1,2s
Start-
1,5s
und
1,9s
Endzeit
2,1s

Wortgenaue Zeitstempel

Klicken Sie im Transkript auf ein Wort, um im Player direkt an diese Stelle zu springen, oder exportieren Sie die Zeiten als SRT-Datei für Untertitel.

SRT- und JSON-Export

Speichern Sie das Transkript als SRT-Untertiteldatei für Ihren Videoschnitt oder als JSON mit allen Zeitdaten für Ihre eigenen Skripte.

Datei wählen oder aufnehmen

Bringen Sie eine vorhandene Audiodatei mit oder nehmen Sie direkt im Tool über Ihr Mikrofon auf. Beide Wege führen zur selben Transkriptansicht.

Loslegen

So funktioniert es

1

Kostenloses Tool öffnen

Öffnen Sie das Audio-zu-Text-Tool in Ihrem Browser. Es startet direkt im Transkriptions-Tab, ohne Download und ohne Anmeldung.

2

Audio hinzufügen

Wählen Sie eine Audiodatei oder nehmen Sie über Ihr Mikrofon auf. Geben Sie an, in welcher Sprache das Audio ist, oder lassen Sie die automatische Erkennung die Arbeit machen.

3

Transkribieren und exportieren

Starten Sie die Transkription. Das Modell wird beim ersten Mal geladen und läuft danach lokal. Wenn es fertig ist, kopieren Sie den Text, exportieren eine SRT-Untertiteldatei oder JSON mit wortgenauen Zeiten.

Anwendungsfälle

Wofür es genutzt wird

Untertitel und Captions

Machen Sie aus der Tonspur eines Videos eine SRT-Datei mit präzisen Wortzeiten und laden Sie sie in Ihr Schnittprogramm oder direkt zum Video hoch.

Interviews und Meetings

Erhalten Sie ein schriftliches Protokoll eines Gesprächs, das Sie durchsuchen, zitieren und teilen können, ohne die Aufnahme an einen fremden Dienst zu geben.

Podcasts und Videos

Erstellen Sie Shownotes, Blog-Fassungen und durchsuchbare Archive aus bereits veröffentlichten Folgen.

Notizen und Sprachmemos

Sprechen Sie einen Gedanken direkt ins Tool und erhalten Sie sauberen Text zurück. Praktisch zum Entwerfen unterwegs.

Das Beste herausholen

Tipps für bessere Transkripte

Sprache festlegen, wenn Sie sie kennen

Die automatische Erkennung ist bequem, aber die Sprache des Audios ausdrücklich anzugeben verhindert gelegentliche Fehlgriffe bei kurzen Clips oder bei Aufnahmen, die mit Musik oder Stille beginnen.

Sauberes Audio schlägt jede Nachbearbeitung

Hintergrundgeräusche, Durcheinanderreden und starker Raumhall kosten mehr Genauigkeit als alles andere. Ein nahes Mikrofon und ein ruhiger Raum bringen mehr als jede Einstellung im Tool.

Sehr lange Aufnahmen aufteilen

Das Tool kommt mit langen Dateien zurecht, hält aber alles im Speicher Ihres Browsers. Bei stundenlangen Aufnahmen halten kürzere Abschnitte das Tempo hoch und entlasten schwächere Rechner.

Chrome oder Edge für mehr Tempo

Chromium-Browser unterstützen WebGPU, was das Modell spürbar schneller macht. Firefox und Safari funktionieren ebenfalls, nutzen aber den langsameren WebAssembly-Pfad.

Voice Creator Pro

Mehr gebraucht? Gehen Sie weiter mit Voice Creator Pro.

Voice Creator Pro transkribiert in über 600 Sprachen, macht aus Transkripten gestaltete Untertitel zum Einbrennen ins Video und bietet zusätzlich Voice Cloning, Voice Design und eine kommerzielle Lizenz. Kostenlos im Browser testen oder die Desktop-App herunterladen.

600+ Sprachen

Transkription und Sprachausgabe in einem deutlich größeren Sprachumfang als das Browser-Modell

Lange Aufnahmen

Stundenlange Dateien verarbeiten, ohne alles im Speicher eines Browser-Tabs zu halten

Lokale REST-API

Die Desktop-App stellt eine lokale API bereit, die JSON mit Zeitstempeln für Ihre eigenen Tools zurückgibt

Offline auf dem Desktop

Die Desktop-App transkribiert ganz ohne Internetverbindung auf Ihrer eigenen Hardware

Gestaltete Untertitel

Ein Transkript direkt in Untertitel-Gestaltung, Positionierung und Einbrennen übernehmen, statt eine SRT von Hand zu bearbeiten

Kommerzielle Lizenz

Volle Rechte zur Nutzung von Transkripten und erzeugtem Audio in kommerziellen Projekten

FAQ

Häufige Fragen

Ja. Es gibt kein Konto, keine Kreditkarte und kein Limit für die Anzahl der Dateien. Das Spracherkennungsmodell läuft auf Ihrem eigenen Gerät, es entstehen also keine Serverkosten, die weitergegeben werden müssten.

Nein. Die Transkription findet in Ihrem Browser-Tab statt. Ihre Audiodatei wird lokal dekodiert und verarbeitet und weder an uns noch an sonst jemanden gesendet. Heruntergeladen wird nur das Modell selbst, einmalig bei der ersten Nutzung.

Jedes Audioformat, das Ihr Browser dekodieren kann, also MP3, WAV, M4A, FLAC, OGG und WEBM. Sie können statt einer Datei auch direkt über Ihr Mikrofon aufnehmen.

30 Sprachen für das gesprochene Audio, darunter Englisch, Spanisch, Französisch, Deutsch, Portugiesisch, Italienisch, Niederländisch, Polnisch, Russisch, Chinesisch, Kantonesisch, Japanisch, Koreanisch, Hindi, Arabisch, Türkisch, Vietnamesisch, Thailändisch und Indonesisch. Zusätzlich gibt es eine automatische Spracherkennung. Das Transkript kommt immer in der Sprache zurück, die gesprochen wurde.

Nein. Dieses Tool transkribiert Sprache in der Sprache, in der sie gesprochen wurde, deutsches Audio ergibt also deutschen Text. Es erkennt 30 Sprachen, übersetzt aber nicht zwischen ihnen. Wenn Sie die Worte in einer anderen Sprache brauchen, übersetzt das Video-Dubbing von Voice Creator Pro die Sprache und erzeugt sie in der Zielsprache neu, verfügbar im kostenpflichtigen Cloud-Tarif oder in der Desktop-App.

Ja. Jedes Transkript enthält wortgenaue Zeitstempel und lässt sich als SRT-Untertiteldatei exportieren, die sich direkt in Videoeditoren und Upload-Formulare laden lässt. Der JSON-Export liefert die reinen Zeitdaten, falls Sie etwas Eigenes bauen. Wenn Sie Untertitel gestaltet und fest ins Video eingebrannt haben möchten statt als separate Datei, macht der Untertitel-Generator von Voice Creator Pro genau dort weiter.

Die Genauigkeit hängt vor allem von Ihrem Audio ab. Klare Sprache nah am Mikrofon in einem ruhigen Raum wird sehr gut transkribiert, während starke Hintergrundgeräusche, sich überlagernde Sprecher oder deutlicher Raumhall Genauigkeit kosten. Das Browser-Tool nutzt Whisper base, ein kleineres Modell, damit es auf jedem Laptop läuft. Für schwierigeres Audio setzt Voice Creator Pro größere Transkriptionsmodelle in über 600 Sprachen ein.

Es gibt keine erzwungene Grenze, die praktische Obergrenze ist der Speicher Ihres Browsers. Aufnahmen bis etwa 10 Minuten sind auf einem üblichen Laptop bequem machbar. Darüber hinaus braucht schon das Dekodieren spürbar Speicher und die Transkriptionszeit wächst mit der Länge, eine Vorlesung oder eine ganze Podcast-Folge ist deshalb in der Desktop-App von Voice Creator Pro besser aufgehoben, die sie lokal mit GPU-Beschleunigung verarbeitet.

Nein. Das Modell ist rund 75 MB groß und läuft auf gewöhnlichen Laptops ohne dedizierte Grafikkarte. Chrome und Edge nutzen, wo verfügbar, WebGPU-Beschleunigung und sind dadurch schneller, Firefox und Safari greifen auf WebAssembly zurück.