Start
Audio5
Video9
Bild2
Alle Tools
Ressourcen
Stimmbibliothek
Entwickler-Doku
Blog
Deutsch
Anmelden
App laden

KI-Tools · Audio · Video · Bild · Seedance 2.0 · Nano Banana

KI-Tools für Audio, Video und Bild

Tool nach Ausgabeformat auswählen

Als Ausgangspunkt dienen ein Thema, Dokument, Link, Bild, eigenes Filmmaterial oder ein fertiges Skript. Sprachwerkzeuge nutzen dieselbe ListenHub-Stimmbibliothek; Video-Seiten zeigen nur Modelle, die den jeweiligen Eingabetyp unterstützen.

  • Podcasts, Vertonung und geklonte Stimmen
  • Videos aus Text, Bild oder Referenzmaterial
  • Werbe- und Promoclips über die PixVerse-Agents
  • Bilder bereichsweise nachbessern
  • Vertonte Foliensätze und Erklärvideos
AudioVideoBild
Audio5
KI-Podcast

Aus einem Dokument eine Podcast-Folge machen — solo oder mehrstimmig.

Text-to-Speech

Text in Sprache umwandeln — viele Stimmen und Sprachen

Stimmklonen

Klone deine Stimme und nutze sie überall wieder

Szenarien

KI-Stimme

Jeder Sprecherrolle im selben Skript eine eigene Stimme geben.

Mehrere Sprecher

Dialogskript einfügen, jeder Sprecher bekommt seine eigene Stimme

Video9
KI-Video

Video aus Skript, Foto oder Referenzclip erzeugen.

ErklärvideoAudio

Szenen und Erzählstimme entstehen zusammen, aus einem Thema.

KI-Video · Nach Material

Text zu Video

Eine Zeile schreiben, ein Video bekommen

Bild zu Video

Seedance mit voller Leistung, Porträt-Startframes möglich

Referenz zu Video

Seedance 2.0 mit voller Leistung, Porträtreferenzen möglich

KI-Video · Weitere Einsätze

Werbevideo

Produktfotos rein, vertikaler Spot raus

Promo-Video

Deine Fotos und dein Footage, zu einem Promo geschnitten

Bewegungsübertragung

Deine Figur, die diese Bewegung macht

LippensynchronisationAudio

Gib der Person im Bild einen neuen Satz

Bild2
KI-Bild

Beschreibe ein Bild und ändere gezielt nur, was nicht passt

FolienVideo

Erstelle eine Präsentation, auf Wunsch mit Erklärung.

Vielleicht suchst du eigentlich das hier

  • KI Bild-zu-Video-Generator
  • KI-Video aus Referenzen
  • KI-Video-Generator

Welches Tool passt wozu

Etwas zum Hören

KI-Podcast macht aus einem Thema, einem Dokument oder einem Link eine fertige Folge, mit einer Stimme oder zwei Hosts im Gespräch. Steht der Text schon, liest Text-to-Speech ihn wörtlich vor oder erst umgeschrieben in gesprochene Sprache. Mehrere Sprecher zerlegt ein Dialogskript und gibt jeder Rolle eine eigene Stimme, und KI-Stimme ist die Seite, wenn Ton, Emotion und Tempo zählen. Alle exportieren eine Audiodatei mit SRT-Untertiteln, KI-Stimme nur Audio.

Etwas zum Ansehen

Im Zweifel beginnt man bei KI-Video: Skript, Standbild oder Referenzmaterial funktionieren als Ausgangspunkt, und die Modelle wechseln im selben Editor. Erklärvideo passt, wenn etwas erklärt werden soll, weil Szenen und Narration zusammen entstehen. Werbevideo, Promo-Video, Bewegungsübertragung und Lippensynchronisation erledigen je genau eine Aufgabe, mit fest eingestelltem Modell.

Ein Bild oder ein Foliensatz

KI-Bild erzeugt aus einer Beschreibung oder aus bis zu fünf Referenzbildern. Stimmt ein Ausschnitt nicht, markierst du ihn, beschreibst die Änderung, und nur dieser Bereich wird neu gezeichnet und als eigene Version gespeichert, ohne die alte zu überschreiben. Folien baut daraus einen Foliensatz, bei dem jede Seite Inhalt und Sprechtext hat, und exportiert PPTX und PDF, dazu Video, Audio und SRT, sobald die Narration an ist.

Mit der eigenen Stimme

Nimm in Stimmklonen eine Probe von 25 bis 35 Sekunden auf oder lade sie hoch, dann steht die Stimme in der Stimmauswahl von KI-Podcast, Text-to-Speech, Folien und Erklärvideo und lässt sich auch in KI-Stimme und Mehrere Sprecher wählen. Die Video-Tools arbeiten nicht mit geklonten Stimmen.

Häufige Fragen zu den Tools

Welche Tools gibt es auf ListenHub?

Die Tools sind nach Ausgabeformat gruppiert. Audio: KI-Podcast, Text-to-Speech, Stimmklonen, KI-Stimme und Mehrere Sprecher. Video: KI-Video, Erklärvideo, Text zu Video, Bild zu Video, Referenz zu Video, Werbevideo, Promo-Video, Bewegungsübertragung und Lippensynchronisation. Bild: KI-Bild und Folien.

Kann ich meine geklonte Stimme in mehreren Tools nutzen?

Eine in Stimmklonen erstellte Stimme erscheint in der Stimmauswahl von KI-Podcast, Text-to-Speech, Folien und Erklärvideo und lässt sich auch in KI-Stimme und Mehrere Sprecher auswählen. Die Video-Tools arbeiten nicht mit geklonten Stimmen. Die Stimmbibliothek teilen sich alle Tools, die sprechen, und jede Stimme darin lässt sich kostenlos anhören.

Welche Sprachen werden unterstützt?

Es gibt zwei Stufen. Text-to-Speech, Mehrere Sprecher, KI-Stimme und Stimmklonen decken 12 Sprachen ab: Englisch, Mandarin, Japanisch, Spanisch, Portugiesisch, Französisch, Deutsch, Türkisch, Koreanisch, Italienisch, Thai und Vietnamesisch. KI-Podcast, Folien und Erklärvideo erzeugen Englisch, Mandarin und Japanisch.

Mit welcher Video-Seite fange ich an, und wie lang darf ein Clip sein?

Das hängt vom Ausgangsmaterial ab. Text zu Video arbeitet allein mit der Beschreibung. Bild zu Video nimmt ein Standbild als ersten Frame, ein zweites Standbild als letzter Frame ergibt einen Übergang. Referenz zu Video ist richtig, wenn Referenzen Person, Produkt oder Stil festlegen sollen und der Prompt die Kamerabewegung bestimmt; Referenzen und Frames bleiben auf getrennten Seiten. Diese drei gehen bis 15 Sekunden. Werbevideo startet bei 30 Sekunden, Promo-Video bei 20 mit Optionen für 15 und 30, und Bewegungsübertragung und Lippensynchronisation übernehmen die Länge des hochgeladenen Clips.

Welche Modelle stecken hinter den Tools?

Bei Video lassen sich Seedance 2.0 Pro, Seedance 2.0 Fast, PixVerse und HappyHorse im selben Editor umschalten: Jede Seite listet nur die Modelle, die ihr Material annehmen, und jedes Modell bietet nur die Längen und Formate, die es unterstützt. Seedance 2.5 wird derzeit nicht im Modellmenü angezeigt. Werbevideo läuft über den PixVerse-Werbe-Agent, Promo-Video über den PixVerse-Promo-Agent, Bewegungsübertragung und Lippensynchronisation über PixVerse. Beim Bild: Nano Banana, GPT-Image-2 und Seedream 5.0 Pro in einem Editor, und KI-Stimme läuft auf seed-audio.

Was lässt sich exportieren, und was kostet eine Generierung?

Die Tools, die sprechen, exportieren eine Audiodatei mit SRT-Untertiteln, KI-Stimme nur Audio. Folien exportiert PPTX und PDF, dazu Video, Audio und SRT bei aktiver Narration. Die Video-Tools laden den fertigen Clip herunter, KI-Bild die Originaldatei. Bezahlt wird in Credits: Der Betrag hängt von Modell, Dauer und Qualität ab und steht neben dem Generieren-Button, bevor du bestätigst.