Stimmklonen · 12 Sprachen
Die Stimme, die du baust, erscheint in den anderen Tools — bereit, Podcasts zu erzählen, Texte vorzulesen und Folien und Erklärvideos zu vertonen.
Nimm dich im Browser beim Reden auf, oder lade eine Audiodatei hoch, die du selbst aufgenommen hast — was dir leichter fällt.
Rede natürlich, statt monoton vorzulesen, in einem stillen Raum ohne Hall. Der Upload nimmt wav, mp3 oder m4a bis 20 MB.
Wähle Deutsch, Englisch, Mandarin, Japanisch, Spanisch, Portugiesisch, Französisch, Türkisch, Koreanisch, Italienisch, Thailändisch oder Vietnamesisch, dann benenne die Stimme und setze ihr Geschlecht, damit du sie später leicht findest.
Hör dir die Vorschau vor dem Speichern an. Gespeichert taucht die Stimme in der Stimmenauswahl der anderen Tools auf.
Veröffentliche Folgen, die nach dir klingen, ohne jede einzeln einzusprechen.
Halte über einen ganzen Foliensatz oder eine Videoreihe eine Stimme durch, auch wenn du das Skript später änderst.
Schick einen Bericht durch Text-to-Speech und lass ihn dir in einer vertrauten Stimme vorlesen.
Nutze dieselbe Stimme für jedes Audio, das du veröffentlichst, statt jedes Mal eine andere Katalogstimme.
Stimmklonen baut aus einer kurzen Aufnahme eine synthetische Version einer bestimmten Stimme — danach kann diese Stimme jeden Text vorlesen, den du schreibst.
Etwa 25 bis 35 Sekunden. Sprich natürlich — freies Reden oder ein energischer Vortrag funktioniert besser als monotones Vorlesen — in einem stillen, hallarmen Raum.
Du kannst eine wav-, mp3- oder m4a-Datei bis 20 MB hochladen. Nimm Audio, das du selbst aufgenommen hast, keine heruntergeladenen oder fremden Dateien.
Das Klonen unterstützt Deutsch, Englisch, Mandarin, Japanisch, Spanisch, Portugiesisch, Französisch, Türkisch, Koreanisch, Italienisch, Thailändisch und Vietnamesisch.
Eine gespeicherte Stimme steht in der Stimmenauswahl von KI-Podcast, Text-to-Speech, Folien und Erklärvideo — ein Klon deckt alle vier ab.
Beides geht. Sprachchat nimmt dich im Browser auf, während du redest, und Datei hochladen übernimmt eine vorhandene Aufnahme — es entsteht dieselbe Art Stimme.