Flux 3 – Bild und Ton in einem Durchgang

Text, ein Foto, ein Clip oder Keyframes rein – bei VideoAI kommt Video mit passendem Ton raus, bis zu 20 Sekunden pro Generierung.

Was deutschsprachige Teams damit bauen

Kanal-Intros, animierte Packshots, Erklärclips und Pitch-Sequenzen – aus einem der vier Startpunkte, mit gemeinsam erzeugtem Ton.

Neon-Horizont-Reveal

Markenpromo

Kirschkuchen-Teaser

Produktfilm

Cyber-City-Launch

Markenpromo

Begegnung im goldenen Feld

Cinematic Promo

Actionheldin-Reveal

Entertainment-Promo

Convenience-Store-Smash

Markenpromo

Helm-Nahaufnahme

Produktfilm

Sunset-Café-Promo

Lifestyle-Promo

Was der Flux 3 Videogenerator kann

Vier Fähigkeiten, die im Alltag zwischen Skriptzeile und fertigem Clip den Unterschied machen.

Vier Startpunkte

Kaum jemand fängt bei null an, deshalb akzeptiert das Modell in VideoAI vier Ausgangspunkte: eine getippte Szene, ein Foto, das animiert oder als Referenz dient, einen bereits gedrehten Clip, der in Bild und Ton weiterwächst, oder ein Start- und Endkeyframe, zwischen denen die Bewegung entsteht. Der Packshot aus dem Shop und das Restmaterial vom letzten Dreh werden damit wieder zu Ausgangsmaterial.

Lesbarer Text im Bild

Titel, Umlaute und lange Fachbegriffe bleiben im Bild lesbar, weil das Modell Text in mehreren Sprachen mit hoher Genauigkeit rendert. Für den stummgeschalteten Feed auf TikTok, in Reels und auf LinkedIn heißt das: Der Clip wird auch ohne Ton verstanden, und der Dialog ist das Plus obendrauf.

Dialog und Geräusche mit dem Bild

Dialog, Effektgeräusche und Raumatmo entstehen gemeinsam mit dem Bild und liegen auf den Ereignissen, die man sieht – der Deckel klickt, wenn der Deckel klickt. Mehrsprachige Dialoge sind möglich, also lässt sich neben der deutschen auch eine zweite Sprachfassung erzeugen. Der native Ton ist laut Anbieter optional und damit nicht zwingend Teil jeder Ausgabe.

Mehrschnitt-Sequenzen

Pro Generierung entstehen bis zu 20 Sekunden. Mehrere Einstellungen lassen sich anschließend zu einer längeren Mehrschnitt-Sequenz aneinanderreihen – genug für ein Intro, ein Sizzle oder eine Erklärstrecke mit mehreren Schnitten. Als erklärte Stärken nennt das Modell dabei Gesichtsausdrücke und die Zuordnung von Ton zu sichtbaren Ereignissen.

In drei Schritten zum fertigen Clip

Vom Startpunkt über den Prompt bis zur Sequenz, die in den Redaktionsplan geht.

SCHRITT 01

Startpunkt wählen und hochladen

Tippe deine Szene als Prompt oder lade das Material hoch, mit dem du arbeiten willst. Der gewählte Startpunkt bestimmt, was das Modell übernimmt: Beim Produktfoto wird der Bildinhalt animiert, beim vorhandenen Clip wird das Stück fortgesetzt, bei Start- und Endkeyframe stehen Anfang und Ende fest und der Weg dazwischen entsteht neu. Wer Flux 3 bild zu video nutzen möchte, braucht also nur eine einzige Datei.

SCHRITT 02

Szene, Ton und Bildtext beschreiben

Schreibe Kameraführung, Stimmung, die gewünschte Dialogzeile und den Wortlaut, der im Bild erscheinen soll, konkret auf Deutsch in den Prompt. Je genauer die sichtbaren Ereignisse benannt sind – wer spricht, was klickt, was raschelt –, desto sauberer lässt sich der Ton dem Bild zuordnen. Das gilt für Flux 3 text zu video genauso wie für ein animiertes Foto.

SCHRITT 03

Generieren, prüfen, aneinanderreihen

Sieh dir das Ergebnis an und beurteile am fertigen Clip, ob der deutsche Dialog sitzt und der Bildtitel lesbar ist. Bei Bedarf schärfst du den Prompt nach und generierst neu, statt hinterher zu flicken. Danach erzeugst du weitere Einstellungen, reihst sie zur Sequenz und lädst das Stück für YouTube, Reels, TikTok oder LinkedIn herunter.

Weitere Modelle entdecken

Entdecke weitere KI-Modelle für Bild- und Videoerstellung.

Ihren ersten 30-Sekunden-Clip erzeugen

Der erste Clip vor dem Drehtag

Nimm eine Zeile aus deinem Skript oder einen Packshot und sieh dir in VideoAI an, wie Bild und Ton zusammen entstehen.

Jetzt generieren

Fragen vor dem ersten Versuch

Was ist Flux 3 eigentlich?

Flux 3 ist ein multimodales Modell von Black Forest Labs, veröffentlicht am 23. Juli 2026. Bild, Video und Audio werden darin in einer gemeinsamen Architektur trainiert, die der Hersteller Self-Flow nennt. Auf dieser Seite geht es um die Videogenerierung, also darum, aus Text, Fotos, vorhandenen Clips oder Keyframes bewegte Aufnahmen mit Ton zu erzeugen.

Wie funktioniert Flux 3 im Alltag, wenn ich noch nie mit KI Videos gearbeitet habe?

Du wählst zuerst deinen Startpunkt, beschreibst dann die Szene im Prompt und generierst. Weil Bild und Ton im selben Durchgang entstehen, gibt es keinen zweiten Arbeitsschritt für die Tonspur; du beurteilst das Ergebnis direkt am fertigen Clip. Passt etwas nicht, schärfst du die Beschreibung nach – vor allem die sichtbaren Ereignisse – und erzeugst eine neue Fassung.

Kann ich Flux 3 kostenlos ausprobieren, und brauche ich dafür ein Konto?

Ja, für den Einstieg bekommst du bei VideoAI 10 Credits als Startguthaben, mit denen du direkt mit diesem Modell generieren kannst. Ein Konto ist dafür nötig – ohne Anmeldung läuft keine Generierung. Sind die Credits aufgebraucht, kannst du zwischen einem Credit-Paket zum Aufladen und einem Abo wählen.

Wie lang darf ein einzelnes Video werden?

Pro Generierung sind bis zu 20 Sekunden möglich – das ist die einzige Längenangabe, die der Hersteller nennt. Längere Stücke entstehen, indem du mehrere Einstellungen erzeugst und zu einer Mehrschnitt-Sequenz aneinanderreihst. Zur Gesamtlänge einer solchen Sequenz nennen wir bewusst keine Zahl, weil dazu keine Herstellerangabe vorliegt.

Entsteht der Ton wirklich zusammen mit dem Bild, oder muss ich nachvertonen?

Der Ton entsteht gemeinsam mit dem Bild und liegt auf den Ereignissen, die in der Aufnahme zu sehen sind. Ein separater Vertonungstermin entfällt damit. Der Hersteller beschreibt diesen nativen Ton allerdings als optional, er ist also nicht zwangsläufig Bestandteil jeder Ausgabe.

Beherrscht das Modell deutschsprachige Dialoge und deutsche Titel im Bild?

Mehrsprachige Dialoge werden unterstützt, deutschsprachige Sprechzeilen sind also möglich – ebenso eine zweite Sprachfassung für internationale Kanäle. Text im Bild wird laut Hersteller in mehreren Sprachen mit hoher Genauigkeit gerendert, was gerade bei Umlauten und langen Komposita zählt. Ob ein bestimmter Fachbegriff sauber steht, siehst du am erzeugten Clip.

Gibt es Angaben zu Auflösung und Seitenverhältnis der erzeugten Videos?

Dazu liegen auf Modellebene keine Herstellerangaben vor, die wir hier festschreiben würden – deshalb nennen wir bewusst keine Zahl. Wer für einen bestimmten Kanal produziert, beurteilt das Ergebnis am erzeugten Clip und entscheidet danach. Alles andere wäre geraten.

Hat mein fertiges Video ein Wasserzeichen, und darf ich es geschäftlich einsetzen?

Deine Ergebnisse kommen ohne Wasserzeichen und lassen sich direkt herunterladen – auch die, die du mit dem Startguthaben erzeugst. Die geschäftliche Nutzung ist erlaubt, du kannst die Clips also im Kundenprojekt, im eigenen Shop oder auf Unternehmenskanälen einsetzen. Der fertige Clip liegt nach dem Download bei dir und geht direkt in deinen Redaktionsplan.

Flux 3 – KI-Video mit Ton in einem Durchgang - VideoAI