중국 선경 AI 영상 재현: MiniMax-H3 vs SeeDance 2.0 vs Kling
구름바다 위 다리에 선 붉은 한푸 여인 — 2026년 가장 뜨거운 "중국 선경" AI 영상. 두 가지 첫 프레임 소스를 사용해 MiniMax-H3, SeeDance 2.0, Kling으로 재현했습니다. 실제 생성한 4개의 클립을 정면으로 비교했습니다.
중국 선경 AI 영상 재현: MiniMax-H3 vs SeeDance 2.0 vs Kling
2026년 8월 초, "중국 선경" AI 영상이 소셜 플랫폼 전반에서 폭발적으로 퍼졌습니다. 붉은 한푸를 입은 여인이 돌 아치교 위에 서 있고, 구름바다가 출렁이며, 멀리 황금빛 궁전 단지가 나타나는 영상이었습니다. 원작 제작자는 MiniMax H3 API로 이 장면을 재현해 전체 워크플로우를 공개했습니다. 우리는 Neta Studio의 멀티모달 게이트웨이에서 같은 장면을 MiniMax-H3, SeeDance 2.0, Kling으로 생성했고, 두 가지 참조 프레임 소스(Gemini 생성 프레임 vs 원본 영상 키프레임)를 적용해 정면 비교를 진행했습니다.
참조 프레임
두 가지 첫 프레임 소스를 사용했습니다. 왼쪽의 Gemini 생성 프레임은 순수하게 텍스트 프롬프트로만 만들었습니다. 오른쪽의 원본 키프레임은 바이럴 영상에서 가져왔으며, 하단 워터마크를 잘라냈습니다. 이렇게 하면 모델이 원본과 정확히 같은 구도를 얻게 됩니다.



4가지 생성 결과 — 영상 보기
아래 네 개의 클립은 모두 텍스트 프롬프트(또는 프롬프트 + 첫 프레임 참조)로 생성했으며, 10초 / 768P / 16:9로 제작되었습니다. 재생하며 구도 충실도, 모션 부드러움, 디테일 일관성을 비교해 보세요.
사용한 프롬프트
여기에 실제 사용한 프롬프트를 그대로 공개하니, 그대로 재현하거나 변형해 보세요. 텍스트-비디오 프롬프트(MiniMax-H3)는 전체 장면을 묘사하고, 이미지-비디오 프롬프트는 고정된 첫 프레임 위의 움직임만 묘사합니다.
비용 / 상태 비교
| 모델 | 첫 프레임 | 비용 | 상태 |
|---|---|---|---|
| MiniMax-H3 | 텍스트 전용 | $0.68 | 성공 |
| SeeDance 2.0 | Gemini 프레임 | $3.76 | 성공 |
| Kling | Gemini 프레임 | $1.26 | 성공 |
| SeeDance 2.0 | 원본 키프레임 | $3.76 | 성공 |
결론: 어떤 모델이 중국 선경을 가장 잘 재현할까?
MiniMax-H3(텍스트-비디오)가 가장 가성비가 좋습니다. 10초 768P 클립에 $0.68이며, 붉은 한푸 여인, 돌 아치교, 출렁이는 구름, 황금 궁전까지 원본의 구도를 충실히 재현합니다. 참조 프레임 없이 프롬프트 하나만으로 충분합니다.
SeeDance 2.0은 가장 섬세한 디테일을 만들어 내지만 비용이 5배 더 비쌉니다($3.76). 첫 프레임 소스가 매우 중요해서, 원본 키프레임을 사용하면 원본 영상에 가장 가까운 구도와 분위기를 얻을 수 있습니다.
Kling은 그 중간($1.26)에 위치하며, 자연스러운 모션과 품질·가격의 균형이 좋습니다.
보너스: "선경 선궁" 장면 — 패스트 vs 정교
다리 장면 외에도 궁전 중심의 변형 버전("중국식 선경 선궁")을 생성했습니다. 흐르는 구름바다, 멀리 황금빛 궁전 단지, 중경에서 구름을 뚫고 솟아오르는 쿤펑 신조, 전경의 영객송 아래 이야기를 나누는 도포 차림의 선인 세 명까지 담았습니다. Seedance 2.0으로 두 가지 버전을 제작했는데, 참조 프레임 없이 빠르게 생성하는 패스트 티어와 스타일 참조 프레임 2장을 사용하는 정교한 티어입니다.


V1 · Seedance 2.0 Fast(참조 없음)
순수 텍스트로만 생성했습니다. 프롬프트는 흐르는 구름, 찬란한 궁전, 구름바다를 뚫고 솟아오르는 쿤펑, 소나무 아래 세 명의 선인을 요청합니다. 저비용으로 모든 요소를 구현해 주어 아이디어를 빠르게 검증하기에 안성맞춤입니다.
V2 · Seedance 2.0 · 스타일 참조 프레임 2장
동일한 프롬프트에 스타일 참조 스크린샷 2장을 더했습니다. 첫 프레임은 수동으로 검증했습니다. 영객송 아래 절벽 돌 단상 위에 도포를 입은 선인 세 명(남자 한 명, 여자 두 명)이 안개 속 황금 궁전을 바라보고 있고, 쿤펑은 중경에 있습니다. 전체적인 분위기와 팔레트가 참조 소재에 훨씬 가까워, 최종 전달용으로 더 좋은 선택입니다.
V1 vs V2: 참조 프레임이 만드는 차이
| 항목 | V1 · 패스트 | V2 · 정교 |
|---|---|---|
| 모델 | Seedance 2.0 Fast | Seedance 2.0 |
| 스타일 참조 | 없음(텍스트 전용) | 2장(스타일 정렬) |
| 용도 | 빠른 초안, 아이디어 검증 | 최종 전달용 |
| 해상도 | 480P 864×496 | 480P 864×496 |
| 결과 | 모든 요소 구현 완료 | 모든 요소 구현 + 참조에 더 근접 |
결론: 장면의 스타일 요구가 강할 때(팔레트, 분위기, 건축 디테일) 스타일 참조 프레임이 중요합니다. 콘텐츠는 동일하지만 V2가 의도한 느낌에 훨씬 더 가깝게 맞춰집니다. 빠른 실험에는 480P 패스트 티어로 충분합니다.
전체 워크플로우(직접 재현해 보기)
프롬프트 작성
주제, 환경, 조명, 카메라를 묘사하세요. 예: "중국 선경의 영화적 장면: 흰 돌 아치교 위에 붉은 한푸를 입은 여인의 뒷모습, 아래는 구름바다, 멀리 황금빛 궁전 단지, 따뜻한 노을빛, 활공하는 학."
첫 프레임 생성(선택 사항)
구도를 제어하려면 이미지 모델을 사용하세요. Gemini 프레임 하나는 약 $0.07입니다.
영상 생성
MiniMax-H3(텍스트-비디오) 또는 SeeDance 2.0 / Kling(이미지-비디오)을 선택하고 10초 / 768P / 16:9로 설정하세요.
검토 및 다듬기
충실도를 비교하고, 마음에 들지 않으면 프롬프트를 수정하거나 첫 프레임을 바꿔 보세요.
왜 Neta Studio에서 해야 할까?
Neta Studio의 멀티모달 게이트웨이는 MiniMax-H3, SeeDance 2.0, Kling, Seedance 등 여러 모델을 하나의 명령으로 통합 제공하므로 여러 API 키를 관리할 필요가 없습니다. 생성 결과물은 CDN에 자동으로 업로드되어 바로 삽입하거나 공유할 수 있습니다.
나만의 AI 영상 만들기
프롬프트 하나면 충분합니다. "중국 선경 영상을 만들어 줘"라고 말만 해도 Neta Studio가 처리합니다. 무료로 시작할 수 있고 코드는 필요 없습니다.