Start
Audio6
Video9
Bild2
Alle Tools
Ressourcen
Stimmbibliothek
Entwickler-Doku
Blog
Deutsch
Preise
Anmelden
App laden
AudioAudio zu Text
KI-PodcastText-to-SpeechAudio zu TextStimmklonenKI-StimmeMehrere Sprecher

Audio in Text · Aufnahmen und Videos

Audio-in-Text-Konverter

Aus einer Aufnahme wird ein Transkript

Lade Audio oder Video hoch, die Sprache wird automatisch erkannt. Danach den Text kopieren, als TXT laden oder als SRT-Untertitel exportieren. Eine Datei bis 2 Stunden oder 50 MB.

  • Automatische Spracherkennung
  • 17 Audio- und Videoformate
  • Referenzvokabular für Namen und Fachbegriffe
  • Export als TXT oder SRT-Untertitel

Noch keine Transkripte

Deine letzten Audio-zu-Text-Projekte erscheinen hier.

So wird Audio zu Text

  1. 1

    Eine Aufnahme hochladen

    Zieh eine Audio- oder Videodatei hinein: AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA und WMV sind möglich, bis zu 2 Stunden oder 50 MB. Format, Größe und Länge werden geprüft, bevor der Upload startet.

  2. 2

    Referenzvokabular ergänzen

    Optional, aber die paar Sekunden wert bei allem, was ein allgemeines Modell noch nie gehört hat: Personennamen, Marken, Abkürzungen, internes Fachvokabular. Bis zu 50 Einträge, auf diesem Gerät für den nächsten Upload gespeichert.

  3. 3

    Kopieren, laden oder untertiteln

    Die Transkription läuft auf unseren Servern, du kannst den Tab also schließen und später zurückkommen. Die fertige Seite zeigt Länge und Wortzahl über dem vollständigen Text — bereit zum Kopieren, als UTF-8-TXT zum Download oder als SRT-Untertitel zum Export.

Wofür sich Audio-Transkription eignet

Interviews verschriftlichen

Hol dir ein zitierfähiges Protokoll des aufgezeichneten Interviews und such nach dem Satz, an den du dich nur halb erinnerst, statt durch die Audiospur zu spulen.

Besprechungsprotokolle

Mach aus der Aufnahme einer Besprechung ein durchgehendes Transkript für die Projektunterlagen — und für alle, die nicht dabei waren.

Vorlesungen und Lernnotizen

Lies eine Vorlesung oder einen Vortrag in deinem Tempo nach und behalte die fachbegriffslastigen Passagen als Text, den du kommentieren kannst.

Untertitel für Videos

Exportiere eine SRT-Datei aus den Satz-Timings und lade sie direkt in deinen Schnitt, statt Untertitel von Hand zu tippen.

Häufige Fragen zu Audio in Text

Was ist Audio-in-Text-Transkription?

Die Spracherkennung hört eine Aufnahme durch und schreibt auf, was gesagt wurde. Sie ersetzt das Abtippen von Hand: Aus einer Stunde Audio wird in einem Bruchteil der Zeit ein lesbares, durchsuchbares Dokument.

Welche Dateiformate werden unterstützt?

Siebzehn Audio- und Videoformate: AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA und WMV. Videos gehen direkt rein — die Tonspur muss vorher nicht extrahiert werden.

Wie lang und wie groß darf die Aufnahme sein?

Eine Datei auf einmal, bis zu 2 Stunden und 50 MB. Beide Grenzen werden zuerst im Browser geprüft, eine zu große Datei fällt also sofort auf und nicht erst nach einem langen Upload.

Muss ich eine Sprache auswählen?

Nein. Die gesprochene Sprache wird aus der Aufnahme selbst erkannt — die Datei muss also nicht zur Sprache der Oberfläche passen.

Bekomme ich neben dem Text auch Untertitel?

Ja. Jeder Satz wird mit Anfangs- und Endzeit gespeichert, deshalb lässt sich dasselbe Ergebnis neben dem UTF-8-TXT auch als SRT-Untertiteldatei exportieren. Liefert eine Aufnahme keine brauchbaren Satz-Timings, wird der SRT-Export deaktiviert statt geraten.

Wie werden Credits berechnet?

Ein Credit pro angefangener Minute der Originalaufnahme — eine Datei von 90 Sekunden kostet also 2 Credits. Die Schätzung steht vor dem Start auf der Schaltfläche, und bei einer fehlgeschlagenen Transkription wird nichts berechnet.

Wie genau ist das Transkript?

Das hängt von der Aufnahme ab. Deutliche Aussprache, nur eine sprechende Person und wenig Hintergrundgeräusch liefern die besten Ergebnisse. Die übliche Schwachstelle sind Namen, Marken und Fachbegriffe — genau dafür gibt es das Referenzvokabular.

Vielleicht suchst du eigentlich das hier

  • KI-Podcast-Generator

    Wenn zwei Hosts das Thema durchsprechen sollen, statt dass eine Stimme alles vorliest.

  • Text-to-Speech-Generator

    Wenn das Skript schon steht und nur noch gesprochen werden muss.