KI-Tools · Audio · Video · Bild · Seedance 2.0 · Nano Banana
Als Ausgangspunkt dienen ein Thema, Dokument, Link, Bild, eigenes Filmmaterial oder ein fertiges Skript. Sprachwerkzeuge nutzen dieselbe ListenHub-Stimmbibliothek; Video-Seiten zeigen nur Modelle, die den jeweiligen Eingabetyp unterstützen.
Video aus Skript, Foto oder Referenzclip erzeugen.
ErklärvideoAudioSzenen und Erzählstimme entstehen zusammen, aus einem Thema.
Beschreibe ein Bild und ändere gezielt nur, was nicht passt
FolienVideoErstelle eine Präsentation, auf Wunsch mit Erklärung.
KI-Podcast macht aus einem Thema, einem Dokument oder einem Link eine fertige Folge, mit einer Stimme oder zwei Hosts im Gespräch. Steht der Text schon, liest Text-to-Speech ihn wörtlich vor oder erst umgeschrieben in gesprochene Sprache. Mehrere Sprecher zerlegt ein Dialogskript und gibt jeder Rolle eine eigene Stimme, und KI-Stimme ist die Seite, wenn Ton, Emotion und Tempo zählen. Alle exportieren eine Audiodatei mit SRT-Untertiteln, KI-Stimme nur Audio.
Im Zweifel beginnt man bei KI-Video: Skript, Standbild oder Referenzmaterial funktionieren als Ausgangspunkt, und die Modelle wechseln im selben Editor. Erklärvideo passt, wenn etwas erklärt werden soll, weil Szenen und Narration zusammen entstehen. Werbevideo, Promo-Video, Bewegungsübertragung und Lippensynchronisation erledigen je genau eine Aufgabe, mit fest eingestelltem Modell.
KI-Bild erzeugt aus einer Beschreibung oder aus bis zu fünf Referenzbildern. Stimmt ein Ausschnitt nicht, markierst du ihn, beschreibst die Änderung, und nur dieser Bereich wird neu gezeichnet und als eigene Version gespeichert, ohne die alte zu überschreiben. Folien baut daraus einen Foliensatz, bei dem jede Seite Inhalt und Sprechtext hat, und exportiert PPTX und PDF, dazu Video, Audio und SRT, sobald die Narration an ist.
Nimm in Stimmklonen eine Probe von 25 bis 35 Sekunden auf oder lade sie hoch, dann steht die Stimme in der Stimmauswahl von KI-Podcast, Text-to-Speech, Folien und Erklärvideo und lässt sich auch in KI-Stimme und Mehrere Sprecher wählen. Die Video-Tools arbeiten nicht mit geklonten Stimmen.
Die Tools sind nach Ausgabeformat gruppiert. Audio: KI-Podcast, Text-to-Speech, Stimmklonen, KI-Stimme und Mehrere Sprecher. Video: KI-Video, Erklärvideo, Text zu Video, Bild zu Video, Referenz zu Video, Werbevideo, Promo-Video, Bewegungsübertragung und Lippensynchronisation. Bild: KI-Bild und Folien.
Eine in Stimmklonen erstellte Stimme erscheint in der Stimmauswahl von KI-Podcast, Text-to-Speech, Folien und Erklärvideo und lässt sich auch in KI-Stimme und Mehrere Sprecher auswählen. Die Video-Tools arbeiten nicht mit geklonten Stimmen. Die Stimmbibliothek teilen sich alle Tools, die sprechen, und jede Stimme darin lässt sich kostenlos anhören.
Es gibt zwei Stufen. Text-to-Speech, Mehrere Sprecher, KI-Stimme und Stimmklonen decken 12 Sprachen ab: Englisch, Mandarin, Japanisch, Spanisch, Portugiesisch, Französisch, Deutsch, Türkisch, Koreanisch, Italienisch, Thai und Vietnamesisch. KI-Podcast, Folien und Erklärvideo erzeugen Englisch, Mandarin und Japanisch.
Das hängt vom Ausgangsmaterial ab. Text zu Video arbeitet allein mit der Beschreibung. Bild zu Video nimmt ein Standbild als ersten Frame, ein zweites Standbild als letzter Frame ergibt einen Übergang. Referenz zu Video ist richtig, wenn Referenzen Person, Produkt oder Stil festlegen sollen und der Prompt die Kamerabewegung bestimmt; Referenzen und Frames bleiben auf getrennten Seiten. Diese drei gehen bis 15 Sekunden. Werbevideo startet bei 30 Sekunden, Promo-Video bei 20 mit Optionen für 15 und 30, und Bewegungsübertragung und Lippensynchronisation übernehmen die Länge des hochgeladenen Clips.
Bei Video lassen sich Seedance 2.0 Pro, Seedance 2.0 Fast, PixVerse und HappyHorse im selben Editor umschalten: Jede Seite listet nur die Modelle, die ihr Material annehmen, und jedes Modell bietet nur die Längen und Formate, die es unterstützt. Seedance 2.5 wird derzeit nicht im Modellmenü angezeigt. Werbevideo läuft über den PixVerse-Werbe-Agent, Promo-Video über den PixVerse-Promo-Agent, Bewegungsübertragung und Lippensynchronisation über PixVerse. Beim Bild: Nano Banana, GPT-Image-2 und Seedream 5.0 Pro in einem Editor, und KI-Stimme läuft auf seed-audio.
Die Tools, die sprechen, exportieren eine Audiodatei mit SRT-Untertiteln, KI-Stimme nur Audio. Folien exportiert PPTX und PDF, dazu Video, Audio und SRT bei aktiver Narration. Die Video-Tools laden den fertigen Clip herunter, KI-Bild die Originaldatei. Bezahlt wird in Credits: Der Betrag hängt von Modell, Dauer und Qualität ab und steht neben dem Generieren-Button, bevor du bestätigst.