Audio in Text · Aufnahmen und Videos
Lade Audio oder Video hoch, die Sprache wird automatisch erkannt. Danach den Text kopieren, als TXT laden oder als SRT-Untertitel exportieren. Eine Datei bis 2 Stunden oder 50 MB.
Noch keine Transkripte
Deine letzten Audio-zu-Text-Projekte erscheinen hier.
Zieh eine Audio- oder Videodatei hinein: AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA und WMV sind möglich, bis zu 2 Stunden oder 50 MB. Format, Größe und Länge werden geprüft, bevor der Upload startet.
Optional, aber die paar Sekunden wert bei allem, was ein allgemeines Modell noch nie gehört hat: Personennamen, Marken, Abkürzungen, internes Fachvokabular. Bis zu 50 Einträge, auf diesem Gerät für den nächsten Upload gespeichert.
Die Transkription läuft auf unseren Servern, du kannst den Tab also schließen und später zurückkommen. Die fertige Seite zeigt Länge und Wortzahl über dem vollständigen Text — bereit zum Kopieren, als UTF-8-TXT zum Download oder als SRT-Untertitel zum Export.
Hol dir ein zitierfähiges Protokoll des aufgezeichneten Interviews und such nach dem Satz, an den du dich nur halb erinnerst, statt durch die Audiospur zu spulen.
Mach aus der Aufnahme einer Besprechung ein durchgehendes Transkript für die Projektunterlagen — und für alle, die nicht dabei waren.
Lies eine Vorlesung oder einen Vortrag in deinem Tempo nach und behalte die fachbegriffslastigen Passagen als Text, den du kommentieren kannst.
Exportiere eine SRT-Datei aus den Satz-Timings und lade sie direkt in deinen Schnitt, statt Untertitel von Hand zu tippen.
Die Spracherkennung hört eine Aufnahme durch und schreibt auf, was gesagt wurde. Sie ersetzt das Abtippen von Hand: Aus einer Stunde Audio wird in einem Bruchteil der Zeit ein lesbares, durchsuchbares Dokument.
Siebzehn Audio- und Videoformate: AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA und WMV. Videos gehen direkt rein — die Tonspur muss vorher nicht extrahiert werden.
Eine Datei auf einmal, bis zu 2 Stunden und 50 MB. Beide Grenzen werden zuerst im Browser geprüft, eine zu große Datei fällt also sofort auf und nicht erst nach einem langen Upload.
Nein. Die gesprochene Sprache wird aus der Aufnahme selbst erkannt — die Datei muss also nicht zur Sprache der Oberfläche passen.
Ja. Jeder Satz wird mit Anfangs- und Endzeit gespeichert, deshalb lässt sich dasselbe Ergebnis neben dem UTF-8-TXT auch als SRT-Untertiteldatei exportieren. Liefert eine Aufnahme keine brauchbaren Satz-Timings, wird der SRT-Export deaktiviert statt geraten.
Ein Credit pro angefangener Minute der Originalaufnahme — eine Datei von 90 Sekunden kostet also 2 Credits. Die Schätzung steht vor dem Start auf der Schaltfläche, und bei einer fehlgeschlagenen Transkription wird nichts berechnet.
Das hängt von der Aufnahme ab. Deutliche Aussprache, nur eine sprechende Person und wenig Hintergrundgeräusch liefern die besten Ergebnisse. Die übliche Schwachstelle sind Namen, Marken und Fachbegriffe — genau dafür gibt es das Referenzvokabular.