Anleitung · Videogenerierung

Nachstellung des KI-Videos „Chinesisches Feenland“: MiniMax-H3 vs. SeeDance 2.0 vs. Kling

Die Frau im roten Hanfu auf einer Brücke über dem Wolkenmeer – das angesagteste KI-Video „Chinesisches Feenland“ des Jahres 2026. Wir haben es mit MiniMax-H3, SeeDance 2.0 und Kling und zwei Erstbild-Quellen getestet. Vier echte Clips im direkten Vergleich.

Nachstellung des KI-Videos „Chinesisches Feenland“: MiniMax-H3 vs. SeeDance 2.0 vs. Kling

Anfang August 2026 gingen KI-Videos mit dem „Chinesischen Feenland“ auf allen Social-Media-Plattformen viral – eine Frau im roten Hanfu, die auf einer steinernen Bogenbrücke steht, tosende Wolkenmeere und goldene Palastanlagen, die in der Ferne erscheinen. Der ursprüngliche Ersteller hat die Szene mit der MiniMax-H3-API nachgebildet und den vollständigen Workflow geteilt. Wir haben dieselbe Szene über das multimodale Gateway von Neta Studio mit MiniMax-H3, SeeDance 2.0 und Kling sowie zwei Referenzbild-Quellen (ein von Gemini erzeugtes Bild vs. ein Keyframe aus dem Originalvideo) im direkten Vergleich getestet.

Die Referenzbilder

Es wurden zwei Erstbild-Quellen verwendet. Das von Gemini erzeugte Bild (links) wurde rein aus einer Textaufforderung erstellt. Das Original-Keyframe (rechts) stammt aus dem viralen Video, wobei das Wasserzeichen unten entfernt wurde – so erhält das Modell exakt die Bildkomposition des Originals.

Vier Generierungsergebnisse – Videos ansehen

Alle vier Clips unten wurden aus den Textaufforderungen (bzw. Aufforderung + Erstbild-Referenz) generiert, mit 10 s / 768P / 16:9. Spielen Sie sie ab, um Bildkomposition, Bewegungsflüssigkeit und Detailtreue zu vergleichen.

MiniMax-H3 Text-zu-Video · ohne Bild · 10 s · 768P · 16:9 · 0,68 $
Erstbild: Text-zu-Video (ohne Referenzbild)
SeeDance 2.0 · Gemini-Bild Bild-zu-Video · Gemini-Bild · 10 s · 3,76 $
Erstbild: Von Gemini erzeugtes Referenzbild
Kling · Gemini-Bild Bild-zu-Video · Gemini-Bild · – · 1,26 $
Erstbild: Von Gemini erzeugtes Referenzbild
SeeDance 2.0 · Original-Keyframe Bild-zu-Video · Original-Keyframe · 10 s · 3,76 $
Erstbild: Keyframe aus dem Originalvideo (Wasserzeichen entfernt)

Die verwendeten Prompts

Hier sind die exakten Prompts, damit Sie sie nachstellen oder abwandeln können. Der Text-zu-Video-Prompt (MiniMax-H3) beschreibt die gesamte Szene; die Bild-zu-Video-Prompts beschreiben nur die Bewegung auf einem festen Erstbild.

MiniMax-H3 – Prompt
„Kinoaufnahme des chinesischen Feenlands, epischer Bildausschnitt: eine Frau im rot-weißen Hanfu, von hinten gesehen, regungslos auf einer verzierten weißen Steinbogenbrücke stehend, die mit Glückswolken und Fabelwesen geschnitzt ist; unter der Brücke tost ein Wolkenmeer; eine prächtige goldene chinesische Palastanlage erhebt sich auf den fernen Wolken, mehrstöckige geschwungene Dachtraufen, glasierte Ziegel glänzen in der untergehenden Sonne; warmes goldenes Abendlicht durchflutet das Wolkenmeer, Wolken strömen und wälzen sich langsam, ein Kranich gleitet über den Himmel“
SeeDance 2.0 · Gemini-Bild – Prompt
„Behalte die Bildkomposition des Erstbilds bei: Wolken unter der Brücke tosen und strömen, Nebel steigt auf und kräuselt sich; ein Kranich breitet die Flügel aus und gleitet langsam über den Himmel; die Ärmel und das Band der Frau in Rot flattern sanft im Wind; die glasierten Ziegel des fernen Palasts schimmern im warmen goldenen Sonnenuntergang; warmes goldenes Licht wandert sanft, ätherische Xianxia-Atmosphäre, cineastische Zeitlupe“
Kling · Gemini-Bild – Prompt
Gleicher Erstbild- und Bewegungsprompt wie bei SeeDance: Wolken strömen, der Kranich gleitet, Ärmel flattern, goldenes Licht wandert.
SeeDance 2.0 · Original-Keyframe – Prompt
„Behalte die Bildkomposition des Erstbilds bei: Nebel über dem Wolkenmeer tost und strömt, uralte Kiefernzweige wiegen sich; drei Gestalten in altertümlichen Gewändern auf einer steinernen Klippenplattform, Kleider und Haarspangen flattern; ein riesiges Steintor und eine Palastanlage erscheinen und verschwinden im Dunst; weiches morgendliches Nebellicht, ätherisch“

Kosten- und Statusvergleich

ModellErstbildKostenStatus
MiniMax-H3Nur Text0,68 $Erfolgreich
SeeDance 2.0Gemini-Bild3,76 $Erfolgreich
KlingGemini-Bild1,26 $Erfolgreich
SeeDance 2.0Original-Keyframe3,76 $Erfolgreich

Fazit: Welches Modell bildet das Chinesische Feenland am besten nach?

MiniMax-H3 (Text-zu-Video) bietet das beste Preis-Leistungs-Verhältnis: 0,68 $ für einen 10-Sekunden-Clip in 768P, wobei die Bildkomposition das Original getreu wiedergibt – Frau im roten Hanfu, Steinbogenbrücke, tosende Wolken und goldener Palast, alles vorhanden – und es benötigt kein Referenzbild, nur einen Prompt.

SeeDance 2.0 liefert die feinsten Details, kostet aber das 5-Fache (3,76 $), und die Erstbild-Quelle spielt eine große Rolle – mit dem Original-Keyframe kommen Bildkomposition und Stimmung dem Ausgangsvideo am nächsten.

Kling liegt dazwischen (1,26 $), mit natürlicher Bewegung und einer guten Balance zwischen Qualität und Preis.

Bonus: Die Szene „Feenland-Palast“ – schnell vs. verfeinert

Zusätzlich zur Brückenszene haben wir auch eine Variante mit Fokus auf den Palast erzeugt („中式仙境仙宫“): strömendes Wolkenmeer, eine goldene Palastanlage in der Ferne, ein göttlicher Kunpeng-Vogel, der im Mittelgrund aus den Wolken hervorstößt, und drei in Gewänder gehüllte Unsterbliche, die im Vordergrund unter einer gastfreundlichen Kiefer plaudern. Mit Seedance 2.0 wurden zwei Versionen erstellt – eine schnelle Stufe ohne Referenz und eine verfeinerte Stufe mit 2 Stil-Referenzbildern.

V1 · Seedance 2.0 Fast (ohne Referenz)

Aus reinem Text erzeugt – der Prompt verlangt nach strömenden Wolken, einem prächtigen Palast, einem Kunpeng, der aus dem Wolkenmeer hervorstößt, und drei Unsterblichen unter einer Kiefer. Es liefert alle Elemente zu geringen Kosten – ideal, um eine Idee schnell zu validieren.

Seedance 2.0 Fast · V1 480P · 6.04s · 24fps · 16:9
Schnelle Stufe · nur Text · ohne Referenzbild · 480P (864×496)

V2 · Seedance 2.0 mit 2 Stil-Referenzbildern

Derselbe Prompt plus 2 Stil-Referenz-Screenshots. Das Erstbild wurde manuell geprüft: drei in Gewänder gehüllte Unsterbliche (ein Mann, zwei Frauen) auf einer steinernen Klippenplattform unter einer gastfreundlichen Kiefer, den goldenen Palast im Nebel betrachtend; der Kunpeng im Mittelgrund. Gesamtstimmung und Farbpalette liegen deutlich näher am Referenzmaterial – die bessere Wahl für die finale Abgabe.

Seedance 2.0 · V2 480P · 6.04s · 24fps · 16:9
Standardstufe · 2 Stil-Referenzbilder · 480P (864×496)

V1 vs. V2: Was Referenzbilder verändern

Aspekt V1 · Fast V2 · Verfeinert
ModellSeedance 2.0 FastSeedance 2.0
Stil-ReferenzKeine (nur Text)2 Bilder (stilabgestimmt)
RolleSchneller Entwurf, IdeenvalidierungFinale Abgabe
Auflösung480P 864×496480P 864×496
ErgebnisAlle Elemente vorhanden ✓Alle Elemente + näher am Referenzbild ✓

Fazit: Wenn die Szene starke stilistische Anforderungen hat (Farbpalette, Atmosphäre, architektonische Details), spielen Stil-Referenzbilder eine große Rolle – der Inhalt ist identisch, aber V2 trifft den gewünschten Look deutlich besser. Für schnelle Experimente reicht die schnelle Stufe mit 480P völlig aus.

Der komplette Workflow (zum Selbstnachstellen)

1

Prompt schreiben

Beschreibe Motiv, Umgebung, Licht und Kamera. Beispiel: „Kinoaufnahme des chinesischen Feenlands: Frau im roten Hanfu von hinten auf einer weißen Steinbogenbrücke, darunter ein Wolkenmeer, goldene Palastanlage in der Ferne, warmes Abendlicht, ein Kranich gleitet.“

2

Ein Erstbild erzeugen (optional)

Nutze ein Bildmodell, um die Bildkomposition zu steuern. Ein Gemini-Bild kostet etwa 0,07 $.

3

Das Video erzeugen

Wähle MiniMax-H3 (Text-zu-Video) oder SeeDance 2.0 / Kling (Bild-zu-Video) und stelle 10 s / 768P / 16:9 ein.

4

Prüfen und verfeinern

Vergleiche die Treue; wenn du nicht zufrieden bist, passe den Prompt an oder tausche das Erstbild aus.

Warum mit Neta Studio?

Das multimodale Gateway von Neta Studio bündelt MiniMax-H3, SeeDance 2.0, Kling, Seedance und weitere Modelle hinter einem einzigen Befehl – kein Hantieren mit mehreren API-Schlüsseln. Erzeugte Ergebnisse werden automatisch ins CDN hochgeladen und sind bereit zum Einbetten oder Teilen.

Erzeuge dein eigenes KI-Video

Ein Prompt genügt – oder sag einfach „Mach mir ein Video vom Chinesischen Feenland“ – Neta Studio übernimmt den Rest. Kostenlos starten, ganz ohne Code.

Dieser Test verwendet reale generierte Ausgaben von MiniMax-H3, SeeDance 2.0 (Gemini-Bild + Original-Keyframe) und Kling. Erstellt am 05.08.2026.
×