指南 · 影片生成

中式仙境 AI 影片復刻:MiniMax-H3 對決 SeeDance 2.0 與 Kling

雲海石橋上的紅衣漢服女子——2026 年最火紅的「中式仙境」AI 影片。我們以兩種首幀來源,透過 MiniMax-H3、SeeDance 2.0 與 Kling 重現這支影片。四段真實影片,正面對決。

中式仙境 AI 影片復刻:MiniMax-H3 對決 SeeDance 2.0 與 Kling

2026 年 8 月初,「中式仙境」AI 影片在各大社群平台爆紅——一位身著紅衣漢服的女子佇立於石拱橋上,橋下雲海翻湧,遠方浮現金碧輝煌的宮殿群。原作者以 MiniMax H3 API 重現了這個場景,並分享了完整流程。我們透過 Neta Studio 的多模態閘道,以兩種參考幀來源(Gemini 生成的幀 vs 原始影片的關鍵幀),在 MiniMax-H3、SeeDance 2.0 與 Kling 上跑同一場景,進行正面對決比較。

參考幀

我們使用了兩種首幀來源。左圖為 Gemini 生成的幀,完全由文字提示詞產生;右圖為原始關鍵幀,取自爆紅影片,並裁掉下方浮水印——讓模型直接獲得原始影片的構圖。

四段生成結果——觀看影片

以下四段影片皆由文字提示詞(或提示詞+首幀參考)生成,規格為 10 秒/768P/16:9。播放影片即可比較構圖還原度、動作流暢度與細節一致性。

MiniMax-H3 文字生影片 · 無參考幀 · 10 秒 · 768P · 16:9 · $0.68
首幀:文字生影片(無參考幀)
SeeDance 2.0 · Gemini 參考幀 圖生影片 · Gemini 參考幀 · 10 秒 · $3.76
首幀:Gemini 生成的參考幀
Kling · Gemini 參考幀 圖生影片 · Gemini 參考幀 · - · $1.26
首幀:Gemini 生成的參考幀
SeeDance 2.0 · 原始關鍵幀 圖生影片 · 原始關鍵幀 · 10 秒 · $3.76
首幀:取自原始影片的關鍵幀(已去除浮水印)

我們使用的提示詞

以下是我們使用的完整提示詞,方便你自行復刻或改編。文字生影片提示詞(MiniMax-H3)描述完整場景;圖生影片提示詞則只在固定首幀的基礎上描述動態。

MiniMax-H3 — 提示詞
「中式仙境電影鏡頭,史詩級畫面:一位身穿紅白相間漢服的女子背影,靜立於雕刻著祥雲瑞獸的白色石拱橋上;橋下雲海翻湧;遠方雲端矗立著金碧輝煌的中式宮殿群,飛簷層疊,琉璃瓦在夕陽下閃爍金光;溫暖的金色暮光灑滿雲海,雲朵緩慢流動翻滾,一隻仙鶴划過天際」
SeeDance 2.0 · Gemini 參考幀 — 提示詞
「保持首幀構圖:橋下雲海翻湧流動,霧氣升騰繚繞;仙鶴展翅緩慢滑過天際;紅衣女子的衣袖與飄帶隨風輕拂;遠方宮殿的琉璃瓦在溫暖的金色夕陽下熠熠生輝;溫暖金光柔和流轉,空靈的仙俠氛圍,電影感慢動作」
Kling · Gemini 參考幀 — 提示詞
與 SeeDance 相同的首幀+動態提示詞:雲朵流動、仙鶴滑翔、衣袖飄動、金光流轉。
SeeDance 2.0 · 原始關鍵幀 — 提示詞
「保持首幀構圖:雲海上的霧氣翻湧流動,古松枝椏搖曳;懸崖石台上三位古裝人影,衣袂與髮帶飄動;巨大的石門與宮殿群在迷霧中若隱若現;柔和晨霧光線,空靈飄渺」

費用/狀態比較

模型首幀費用狀態
MiniMax-H3純文字$0.68✓ 成功
SeeDance 2.0Gemini 參考幀$3.76✓ 成功
KlingGemini 參考幀$1.26✓ 成功
SeeDance 2.0原始關鍵幀$3.76✓ 成功

結論:哪個模型最能復刻中式仙境?

MiniMax-H3(文字生影片)是性價比最高的選擇:10 秒 768P 片段僅需 $0.68,構圖忠實還原原作——紅衣漢服女子、石拱橋、翻湧雲海與金色宮殿全部到位——而且不需要參考幀,只需一段提示詞。

SeeDance 2.0能呈現最精緻的細節,但費用高 5 倍($3.76),且首幀來源影響很大——使用原始關鍵幀可獲得最接近原片的構圖與氛圍。

Kling介於兩者之間($1.26),動作自然,品質與價格取得良好平衡。

加碼:「仙宮」場景——快速版 vs 精緻版

除了橋上場景,我們另外生成了以宮殿為主的變體(「中式仙境仙宮」):雲海流動,遠方金色宮殿群,中景鯤鵬神鳥破雲而出,前景三位寬袍仙人於迎客松下閒談。我們用 Seedance 2.0 製作了兩個版本——無參考的快速版,以及搭配 2 張風格參考幀的精緻版。

V1 · Seedance 2.0 Fast(無參考)

完全由純文字生成——提示詞要求流動的雲朵、輝煌的宮殿、鯤鵬破雲而出,以及松樹下的三位仙人。低成本即產出所有元素,非常適合快速驗證想法。

Seedance 2.0 Fast · V1 480P · 6.04 秒 · 24fps · 16:9
快速版 · 純文字 · 無參考幀 · 480P(864×496)

V2 · Seedance 2.0 搭配 2 張風格參考幀

相同提示詞加上 2 張風格參考截圖。首幀經人工核對:迎客松下、懸崖石台上三位寬袍仙人(一男兩女),凝望霧中金色宮殿;鯤鵬位於中景。整體氛圍與色調遠比參考素材貼近——是更適合最終交付的選擇。

Seedance 2.0 · V2 480P · 6.04 秒 · 24fps · 16:9
標準版 · 2 張風格參考幀 · 480P(864×496)

V1 對決 V2:參考幀改變了什麼

項目 V1 · 快速版 V2 · 精緻版
模型Seedance 2.0 FastSeedance 2.0
風格參考無(純文字)2 幀(風格對齊)
用途快速草稿、驗證想法最終交付
解析度480P 864×496480P 864×496
結果所有元素皆呈現 ✓所有元素+更貼近參考 ✓

重點總結:當場景有強烈的風格需求(色調、氛圍、建築細節)時,風格參考幀就很重要——內容完全相同,但 V2 遠比 V1 貼近預期的視覺效果。若要快速實驗,480P 的快速版就已足夠。

完整流程(自己動手復刻)

1

撰寫提示詞

描述主體、環境、光線與運鏡。範例:「中式仙境電影鏡頭:白色石拱橋上紅衣漢服女子的背影,橋下雲海翻湧,遠方金色宮殿群,溫暖暮光,仙鶴滑翔。」

2

生成首幀(選用)

使用影像模型來掌控構圖。一張 Gemini 參考幀約需 $0.07。

3

生成影片

選擇 MiniMax-H3(文字生影片)或 SeeDance 2.0/Kling(圖生影片),設定為 10 秒/768P/16:9。

4

檢視並優化

比對還原度;若不滿意,調整提示詞或更換首幀。

為什麼選擇在 Neta Studio 上進行?

Neta Studio 的多模態閘道將 MiniMax-H3、SeeDance 2.0、Kling、Seedance 等模型整合在單一指令之後——不必管理多組 API 金鑰。生成結果會自動上傳至 CDN,可直接嵌入或分享。

生成你自己的 AI 影片

只要一句提示詞,或直接說「幫我製作一支中式仙境影片」——Neta Studio 就能搞定。免費開始,無需寫程式。

本評測使用 MiniMax-H3、SeeDance 2.0(Gemini 參考幀+原始關鍵幀)與 Kling 的實際生成成果。生成日期:2026-08-05。
×