中国風仙境 AI動画再現:MiniMax-H3 対 SeeDance 2.0 対 Kling
雲海の橋の上の紅衣の漢服の女性——2026年、最も話題となった「中国風仙境」AI動画。私たちは MiniMax-H3、SeeDance 2.0、Kling を二種類のファーストフレームで実行し、四本の実際の動画を正面から比較しました。
中国風仙境 AI動画再現:MiniMax-H3 対 SeeDance 2.0 対 Kling
2026年8月初め、「中国風仙境」AI動画が国内外のSNSで大流行しました——石造りのアーチ橋の上に立つ紅衣の漢服の女性、うねる雲海、遠くにかすかに見える黄金の宮殿群。原作者は MiniMax H3 のAPIでこの映像を再現し、完全なワークフローを公開しました。私たちは Neta Studio のマルチモーダルゲートウェイで、同じシーンを MiniMax-H3、SeeDance 2.0、Kling の三モデルに通し、二種類の参照フレーム(Gemini が生成したフレームと原動画のキーフレーム)を使って直接比較しました。
使用した参照フレーム
二種類のファーストフレームを使用しました。Gemini が生成したフレーム(左)はテキストプロンプトのみから作成したものです。原動画のキーフレーム(右)は話題の動画から切り出し、下部の透かしをトリミングで除去しました——これにより、モデルに原動画とまったく同じ構図を与えられます。



四つの生成結果——動画で直接チェック
以下の四本の動画はすべて、テキストプロンプト(またはプロンプト+ファーストフレーム参照画像)から生成され、パラメータは10秒/768P/16:9です。再生して、構図の再現度、動きの滑らかさ、ディテールの一貫性を比較してください。
使用したプロンプト
使用したプロンプトをそのまま公開します。再現にもアレンジにもお使いいただけます。テキストから動画生成(MiniMax-H3)のプロンプトはシーン全体を記述し、画像から動画生成のプロンプトは固定したファーストフレームの上での動きのみを記述しています。
コスト/ステータス比較
| モデル | ファーストフレーム | コスト | ステータス |
|---|---|---|---|
| MiniMax-H3 | テキストのみ | $0.68 | 成功 |
| SeeDance 2.0 | Gemini フレーム | $3.76 | 成功 |
| Kling | Gemini フレーム | $1.26 | 成功 |
| SeeDance 2.0 | 原動画のキーフレーム | $3.76 | 成功 |
結論:どのモデルが「中国風仙境」を最も忠実に再現できるか?
MiniMax-H3(テキストから動画生成)が最もコストパフォーマンスに優れています。10秒・768Pの動画が $0.68 で生成でき、構図は原動画を忠実に再現——紅衣の漢服の女性、石造りのアーチ橋、うねる雲海、黄金の宮殿がすべて揃い、参照フレームも不要でプロンプト一つで完結します。
SeeDance 2.0は最も精細な描写を生み出しますが、コストは5倍($3.76)かかり、ファーストフレームの出どころが結果に大きく影響します——原動画のキーフレームを使うと、構図と雰囲気が最も元の動画に近づきます。
Klingはその中間($1.26)に位置し、動きが自然で、品質と価格のバランスに優れています。
おまけ:「仙境の仙宮」シーン——高速版 対 高精細版
橋のシーンに加えて、宮殿に焦点を当てたバリエーション(「中国風仙境の仙宮」)も生成しました。流れる雲海、遠くに広がる黄金の宮殿群、中景では雲海を突き破って飛び出す鯤鵬の神鳥、前景では迎客松の下で語らう三人の古装の仙人。Seedance 2.0 で二つのバージョンを作成しました——参照なしの高速版と、スタイル参照フレーム2枚を使用する高精細版です。


V1 · Seedance 2.0 高速版(参照なし)
純粋なテキストから生成——プロンプトは、流れる雲、壮麗な宮殿、雲海から飛び出す鯤鵬、松の下の三人の仙人を要求しています。低コストで全要素を実現でき、アイデアを素早く検証するのに最適です。
V2 · Seedance 2.0(スタイル参照フレーム2枚)
同じプロンプトに、スタイル参照用のスクリーンショット2枚を追加しました。ファーストフレームは手作業で確認済みです。断崖の石の台座の上、迎客松の下に三人の古装の仙人(男性1人、女性2人)が立ち、霞のかなたの黄金の宮殿を見つめています。中景には鯤鵬。全体の雰囲気と色彩は参照素材にずっと近く——最終納品にはこちらが最適です。
V1 対 V2:参照フレームが変えるもの
| 項目 | V1 · 高速 | V2 · 高精細 |
|---|---|---|
| モデル | Seedance 2.0 高速版 | Seedance 2.0 |
| スタイル参照 | なし(テキストのみ) | 2枚(スタイル整合) |
| 用途 | クイック草案・アイデア検証 | 最終納品 |
| 解像度 | 480P 864×496 | 480P 864×496 |
| 結果 | 全要素を再現 | 全要素を再現+参照にさらに近似 |
まとめ:シーンに強いスタイル要件(色彩、雰囲気、建築のディテール)がある場合、スタイル参照フレームが重要になります——内容は同じでも、V2 は意図した見た目にはるかに近く仕上がります。素早い実験には、480P の高速版で十分です。
完全なワークフロー(自分で再現する)
プロンプトを書く
主題、環境、光、カメラワークを記述します。例:「中国風仙境の映画的なショット:白い石造りのアーチ橋の上で後ろ向きに立つ紅衣の漢服の女性、眼下には雲海、遠くに黄金の宮殿群、暖かな黄昏の光、滑空する鶴。」
ファーストフレームを生成する(任意)
画像モデルを使えば構図をコントロールできます。Gemini のフレームは約 $0.07 です。
動画を生成する
MiniMax-H3(テキストから動画生成)または SeeDance 2.0/Kling(画像から動画生成)を選び、10秒/768P/16:9 に設定します。
結果を確認して微調整する
再現度を比較し、満足できなければプロンプトを調整するか、ファーストフレームを差し替えます。
なぜ Neta Studio で作るのか?
Neta Studio のマルチモーダルゲートウェイは、MiniMax-H3、SeeDance 2.0、Kling、Seedance などのモデルを一つのコマンドでまとめて呼び出せ、複数のAPIキーを切り替える必要はありません。生成結果は自動的にCDNへアップロードされ、そのまま埋め込みや共有に使えます。
あなただけのAI動画を生成しよう
プロンプト一つ、あるいは「中国風仙境の動画を作って」の一言で——Neta Studio がすべて対応します。無料で始められ、コードは不要です。