Gratis-Tool

Audio in Text umwandeln: kostenlos, privat, direkt im Browser

Zieh eine Audio- oder Videodatei hierher und erhalte ein Transkript. Das Whisper-Sprachmodell läuft in deinem Browser, deine Aufnahme verlässt dein Gerät nie.

  • Kein Upload
  • Keine Anmeldung
  • 90+ Sprachen

Audio- oder Videodatei hier ablegen

oder klicken, um eine Datei auszuwählen

  • MP3
  • WAV
  • M4A
  • AAC
  • OGG
  • FLAC
  • MP4
  • MOV
  • WEBM

Alles läuft lokal: Deine Datei wird in deinem Browser verarbeitet und nie hochgeladen. Nur das Sprachmodell (etwa 77 MB) wird einmalig von Hugging Face geladen.

Lieber gleich diktieren, direkt in jede App?

Ownvox schreibt, was du sagst, an deinem Cursor auf Mac und Windows: ein Hotkey, jede App, und genauso privat wie dieses Tool.

Ownvox entdecken
3 Schritte

So funktioniert es

  1. 01

    Datei auswählen

    Zieh eine MP3-, WAV-, M4A-, OGG- oder Videodatei auf die Seite. Es wird nichts hochgeladen, die Datei bleibt im Speicher deines Browsers.

  2. 02

    Whisper lädt einmal

    Das Whisper-Modell von OpenAI (etwa 77 MB) wird ein einziges Mal geladen und zwischengespeichert. Danach startet es sofort, auch offline.

  3. 03

    Kopieren oder herunterladen

    Sieh zu, wie der Text entsteht, und kopiere ihn oder lade ihn als .txt oder als .srt-Untertitel mit Zeitstempeln herunter.

Datenschutz

Warum lokal transkribieren?

Die meisten kostenlosen Online-Konverter laden deine Aufnahme auf einen Server, behalten sie eine Weile und trainieren oft damit. Dieses Tool tut das nicht, weil es das gar nicht kann: Das Modell läuft auf deinem Rechner.

Kein Upload

Interviews, Meetings, Sprachnotizen und Vorlesungen enthalten meist auch die Worte anderer. Sie auf dem eigenen Gerät zu lassen ist der einfachste Weg, DSGVO-konform zu bleiben.

Keine Anmeldung, kein Limit

Kein Konto, keine Minuten kaufen, kein Wasserzeichen. Auch lange Dateien funktionieren; eine moderne GPU transkribiert um ein Vielfaches schneller als Echtzeit.

Funktioniert offline

Sobald das Modell im Cache liegt, braucht die Transkription keine Verbindung mehr. Schalte das WLAN aus und überzeug dich selbst.

Gut zu wissen

Formate, Sprachen und Grenzen

Formate

  • MP3
  • WAV
  • M4A
  • AAC
  • OGG
  • FLAC
  • MP4
  • MOV
  • WEBM

Das Tool nimmt jede Datei, die dein Browser dekodieren kann: MP3, WAV, M4A/AAC, OGG und FLAC als Audio sowie die Tonspur von MP4-, MOV- und WEBM-Videos. Eine feste Längengrenze gibt es nicht, aber sehr lange Aufnahmen brauchen viel Browser-Speicher und ohne GPU Geduld: Auf der CPU rechne etwa mit Echtzeit oder etwas schneller.

Sprachen

Whisper versteht über 90 Sprachen. Wähle vor dem Start die gesprochene Sprache aus; sie sagt dem Modell, womit es rechnen soll, was vor allem bei kurzen Clips und starken Akzenten zählt. Das Modell transkribiert, es übersetzt nicht.

Genauigkeit

Diese Seite nutzt Whisper „base“, das für klare Sprache in ruhiger Umgebung gut geeignet ist. Starke Akzente, Hintergrundgeräusche, mehrere Sprecher gleichzeitig und Fachvokabular drücken die Qualität. Sprecher werden nicht unterschieden; Zeitstempel gibt es im .srt-Export.

FAQ

Häufige Fragen

Letzter Schritt

Du bist nicht langsam.Deine Tastatur ist es.

Ein Hotkey, eine Stimme, ein Cursor. Der Text landet, wo du gerade arbeitest, sofort.

Gratis testen

7 Tage gratis, dann ab 9,99 €/Monat · jederzeit zum Periodenende kündbar