Audio in Text umwandeln: kostenlos, privat, direkt im Browser
Zieh eine Audio- oder Videodatei hierher und erhalte ein Transkript. Das Whisper-Sprachmodell läuft in deinem Browser, deine Aufnahme verlässt dein Gerät nie.
- Kein Upload
- Keine Anmeldung
- 90+ Sprachen
Audio- oder Videodatei hier ablegen
oder klicken, um eine Datei auszuwählen
- MP3
- WAV
- M4A
- AAC
- OGG
- FLAC
- MP4
- MOV
- WEBM
Alles läuft lokal: Deine Datei wird in deinem Browser verarbeitet und nie hochgeladen. Nur das Sprachmodell (etwa 77 MB) wird einmalig von Hugging Face geladen.
Lieber gleich diktieren, direkt in jede App?
Ownvox schreibt, was du sagst, an deinem Cursor auf Mac und Windows: ein Hotkey, jede App, und genauso privat wie dieses Tool.
So funktioniert es
- 01
Datei auswählen
Zieh eine MP3-, WAV-, M4A-, OGG- oder Videodatei auf die Seite. Es wird nichts hochgeladen, die Datei bleibt im Speicher deines Browsers.
- 02
Whisper lädt einmal
Das Whisper-Modell von OpenAI (etwa 77 MB) wird ein einziges Mal geladen und zwischengespeichert. Danach startet es sofort, auch offline.
- 03
Kopieren oder herunterladen
Sieh zu, wie der Text entsteht, und kopiere ihn oder lade ihn als .txt oder als .srt-Untertitel mit Zeitstempeln herunter.
Warum lokal transkribieren?
Die meisten kostenlosen Online-Konverter laden deine Aufnahme auf einen Server, behalten sie eine Weile und trainieren oft damit. Dieses Tool tut das nicht, weil es das gar nicht kann: Das Modell läuft auf deinem Rechner.
Kein Upload
Interviews, Meetings, Sprachnotizen und Vorlesungen enthalten meist auch die Worte anderer. Sie auf dem eigenen Gerät zu lassen ist der einfachste Weg, DSGVO-konform zu bleiben.
Keine Anmeldung, kein Limit
Kein Konto, keine Minuten kaufen, kein Wasserzeichen. Auch lange Dateien funktionieren; eine moderne GPU transkribiert um ein Vielfaches schneller als Echtzeit.
Funktioniert offline
Sobald das Modell im Cache liegt, braucht die Transkription keine Verbindung mehr. Schalte das WLAN aus und überzeug dich selbst.
Formate, Sprachen und Grenzen
Formate
- MP3
- WAV
- M4A
- AAC
- OGG
- FLAC
- MP4
- MOV
- WEBM
Das Tool nimmt jede Datei, die dein Browser dekodieren kann: MP3, WAV, M4A/AAC, OGG und FLAC als Audio sowie die Tonspur von MP4-, MOV- und WEBM-Videos. Eine feste Längengrenze gibt es nicht, aber sehr lange Aufnahmen brauchen viel Browser-Speicher und ohne GPU Geduld: Auf der CPU rechne etwa mit Echtzeit oder etwas schneller.
Sprachen
Whisper versteht über 90 Sprachen. Wähle vor dem Start die gesprochene Sprache aus; sie sagt dem Modell, womit es rechnen soll, was vor allem bei kurzen Clips und starken Akzenten zählt. Das Modell transkribiert, es übersetzt nicht.
Genauigkeit
Diese Seite nutzt Whisper „base“, das für klare Sprache in ruhiger Umgebung gut geeignet ist. Starke Akzente, Hintergrundgeräusche, mehrere Sprecher gleichzeitig und Fachvokabular drücken die Qualität. Sprecher werden nicht unterschieden; Zeitstempel gibt es im .srt-Export.
Häufige Fragen
Du bist nicht langsam.Deine Tastatur ist es.
Ein Hotkey, eine Stimme, ein Cursor. Der Text landet, wo du gerade arbeitest, sofort.
7 Tage gratis, dann ab 9,99 €/Monat · jederzeit zum Periodenende kündbar