Blog
텍스트-비디오 AI 튜토리얼: 프롬프트에서 전문 비디오까지
텍스트-비디오는 말 그대로 설명을 입력하면 모델이 비디오를 반환합니다. 카메라도 없고, 스톡 영상도 없고, 편집 타임라인도 없습니다. 단어 입력, 동작 출력.
작성자 Gürsu Yaman · muvi.video 설립자 ·
텍스트-비디오 AI 튜토리얼: 프롬프트에서 전문 비디오까지
CTA 버튼: > 무료로 텍스트-비디오를 사용해 보세요
실제로 텍스트-비디오가 무엇인가요?
텍스트-비디오는 말 그대로 설명을 입력하면 모델이 비디오를 반환합니다. 카메라도 없고, 스톡 영상도 없고, 편집 타임라인도 없습니다. 단어 입력, 동작 출력.
저는 muvi.video를 운영하고 있으며 이 카테고리가 아주 짧은 시간 내에 "흥미로운 데모"에서 "이와 함께 클라이언트 작업을 제공합니다"로 바뀌는 것을 보았습니다. 그 이유는 기본 모델이 시간이 지남에 따라 움직임, 조명, 카메라 작동 방식을 이해하는 데 훨씬 더 뛰어나기 때문입니다.
이 튜토리얼은 이렇게 빨리 실력을 쌓고 싶어하는 친구에게 제가 말하고 싶은 내용의 실용적인 버전입니다. 여기서는 모델이 내부적으로 어떻게 작동하는지(간단히 설명하는 것이 중요하기 때문에), muvi.video의 실제 프롬프트-비디오 흐름, 우리가 의지하는 세 가지 모델 중에서 선택하는 방법, 완벽하게 작동하는 세 가지 예제 및 짧은 FAQ를 다룹니다.
확산 모델이 비디오를 생성하는 방법(짧은 버전)
메시지를 잘 전달하기 위해 박사 학위가 필요하지는 않지만, 메커니즘을 이해하면 메시지가 눈에 띄게 향상됩니다.
텍스트-비디오 모델은 순수한 시각적 노이즈로 시작합니다. 모든 프레임에 걸쳐 TV가 정지되는 것을 생각해 보세요. 그런 다음 텍스트 프롬프트에 따라 일련의 노이즈 제거 단계를 실행합니다. 각 단계에서 약간의 노이즈를 제거하고 설명과 일치하는 방향으로 픽셀을 조금씩 움직입니다. 충분한 단계를 거치면 일관된 프레임이 나타납니다. 이 과정을 확산이라고 합니다.
이 메커니즘의 세 가지 결과는 메시지를 표시하는 방법을 결정합니다.
1. 모델은 모호하게 남겨둔 모든 것을 채웁니다. 그럴듯한 장면을 통계적으로 재구성하기 때문에 지정하지 않은 모든 것은 가장 일반적인 훈련 데이터 답변으로 채워집니다. '여자'는 일반적인 여성이 된다. 특이성은 통제입니다. 2. 모션은 촬영되지 않고 예측됩니다. 모델은 객체와 카메라가 어떻게 움직이는 경향이 있는지 학습했습니다. 이것이 바로 카메라 움직임의 이름을 지정하는 것("느린 돌리 전진")이 작동하는 이유입니다. 카메라가 이미 알고 있는 모션 패턴 중에서 선택하는 것입니다. 3. 길고 복잡한 장면은 더 어렵습니다. 프레임이 많고 움직이는 피사체가 많을수록 노이즈 제거가 흐트러질 확률이 높아집니다. 장면이 단순하고 클립이 짧을수록 안정성이 높아집니다. 이것이 모델과 기간 선택이 단어만큼 중요한 이유입니다.
이것이 당신에게 필요한 전체 이론입니다. 이제 작업 흐름을 살펴보겠습니다.
muvi.video 시작하기
가장 빠르게 시작하는 방법은 muvi.video를 이용하는 것입니다. 설정이 빠릅니다.
1단계: 계정 만들기
muvi.video를 방문하여 이메일 주소나 Google 계정으로 가입하세요. 무료 등급을 사용하면 제한된 수의 세대로 플랫폼을 테스트할 수 있으며 신용 카드가 필요하지 않습니다.
2단계: 인터페이스 알아보기
일단 들어가면 작업 공간은 간단합니다.
- 프롬프트 필드: 텍스트 설명을 입력하는 곳
- 모델 선택기: 작업을 실행할 AI 모델을 선택하는 곳
- 설정 패널: 화면 비율, 해상도 및 지속 시간을 설정하는 곳
- 생성 버튼: 작업을 시작합니다.
- 갤러리: 완성된 동영상이 있는 곳
3단계: 핵심 설정 이해
모든 모델은 모든 프로젝트에 중요한 세 가지 설정을 공개합니다.
- 종횡비: 가로(YouTube, 웹)의 경우 16:9, 세로(릴, TikTok, Shorts)의 경우 9:16, 정사각형 및 기타 형식의 경우 Seedance의 추가 비율입니다.
- 해상도: Veo 3.1에서 1080p; Seedance 2.0에서는 480p 또는 720p(Seedance 시작/끝 프레임 작업은 최대 1440p에 도달).
- 기간: 모델이 가장 많이 갈라지는 부분이며 모델 선택을 결정합니다. 다음 섹션을 참조하세요.
설정이 완료되었습니다. 모델을 골라보자.
적합한 모델 선택
우리는 각각 명확한 차선을 소유하고 있기 때문에 세 가지 모델을 전면과 중앙에 유지합니다. 평판이 아닌 샷에 필요한 것을 선택하십시오.
Veo 3.1, 사운드가 포함된 짧은 영화 촬영용
Veo 3.1은 1080p, 16:9 또는 9:16에서 4, 6, 8초의 클립을 생성합니다. 눈에 띄는 기능은 네이티브 오디오입니다. 주변 소리를 생성하고 사진과 함께 대화까지 장면에 동기화할 수 있습니다. 또한 Fast, Quality, ECL Image-to-Video 모드, ECL Start/End Frame 모드 등 다양한 변형을 제공합니다.
세련된 8초 시네마틱 비트를 원할 때, 동기화된 사운드의 이점을 얻을 때, 또는 영웅 품질의 최종 영상을 제작할 때 Veo 3.1을 사용해 보세요. 더 자세한 내용은 Veo 3.1 전체 가이드를 참조하세요.
Seedance 2.0, 더 긴 시간(최대 15초)
Seedance 2.0은 4~15초의 정수 지속 시간을 생성하므로 Veo가 한 번에 생성할 수 있는 것보다 더 긴 테이크가 필요할 때 사용할 수 있는 모델입니다. 480p 또는 720p에서 6가지 화면비를 지원합니다(최대 1440p의 시작/끝 프레임 작업). 변형은 광범위합니다. 텍스트-비디오, 이미지-비디오, 최대 9개의 이미지 참조, 3개의 비디오 참조, 3개의 오디오 참조를 허용하는 전방향 참조 모드와 시작/끝 프레임 모드가 있습니다.
지속 시간이 최우선인 경우, 캐릭터나 제품을 고정하기 위한 참조 자산이 여러 개 있는 경우, 또는 16:9 및 9:16 이외의 화면 비율이 필요한 경우 Seedance 2.0을 사용해 보세요.
스타일리쉬한 모션을 위한 Kling 3.0
Kling 3.0은 엄격한 포토리얼리즘보다는 스타일리시하고 개성 넘치는 룩을 원할 때 선택합니다. T2V(텍스트-비디오), I2V(이미지-비디오) 및 Kling O3의 세 가지 변형으로 제공됩니다. 모션은 창의적이고 애니메이션 지향적이며 예술적인 콘텐츠에 적합한 독특하고 표현력이 풍부한 품질을 가지고 있습니다.
빠른 의사결정 테이블
| 필요 | 모델 | 왜? |
|---|---|---|
| 사운드가 포함된 8s 영화 샷 | 베오 3.1 | 네이티브 오디오, 1080p, 세련된 모션 |
| 8초 이상 소요(최대 15초) | 시드런스 2.0 | 정수 4~15초 지속 시간 |
| 여러 참조 자산(이미지/비디오/오디오) | 시드런스 2.0 | 옴니 레퍼런스: 이미지 9개 + 비디오 3개 + 오디오 3개 |
| 양식화된/표현적인 모션 | 클링 3.0 | 비현실적인 독특한 모습 |
| 정사각형 또는 비표준 종횡비 | 시드런스 2.0 | 6가지 종횡비 |
실용적인 작업 흐름
대부분의 프로젝트에서는 프롬프트 초안을 작성하고 첫 번째 단계를 실행하고 검토하고 문구를 다듬은 다음 최종 단계를 실행합니다. 실제로 출시할 테이크에 한 세대를 소비하기 전에 아이디어를 저렴하게 검증하십시오. 더 깊은 프롬프트 제작을 위해서는 프롬프트 작성 가이드 및 AI 비디오 생성기 개요를 참조하세요.
효과적인 프롬프트 작성
모델보다 프롬프트가 더 중요합니다. 게으른 프롬프트를 가진 좋은 모델은 매번 신중한 프롬프트에 패배합니다. 이 5가지 요소를 모두 충족하면 적중률이 즉시 올라갑니다.
1. 피사체, 현장에 누가 또는 무엇이 있는지. 구체적으로 말하세요. '여자'는 약하다. “짧은 은발에 남색 블레이저를 입은 40대 여성”이 강렬하다. 모델은 귀하가 제공한 대로만 작동할 수 있습니다.
2. 액션, 무슨 일이 일어나고 있는 걸까요. 움직임과 사건을 설명합니다. "서 있는 것"은 정적입니다. "신선한 농산물을 살펴보기 위해 잠시 멈춰 시장을 천천히 걷다"는 모델에 렌더링할 동적 콘텐츠를 제공합니다.
3. 설정, 발생 장소. 환경은 인지된 품질을 결정합니다. "주방"은 일반적입니다. "천장에 구리 냄비가 걸려 있고 레이스 커튼을 통해 아침 햇살이 들어오는 소박한 이탈리아 농가 주방"이 생생하고 구체적인 장면을 연출합니다.
4. 카메라, 촬영 방식. 대부분의 사람들이 건너뛰는 요소이자 일반 영화와 영화의 차이점입니다. 샷 크기("클로즈업" vs "와이드 샷"), 움직임("정적 삼각대" vs "느린 추적 샷"), 각도("낮은 각도 올려다보기" vs "오버헤드"), 초점("얕은 피사계 심도" vs "깊은 초점")의 이름을 지정하세요.
5. 스타일과 무드, 어떤 느낌일까. "영화적, 따뜻함, 친밀함" 또는 "다큐멘터리 스타일, 휴대용, 투박함" 또는 "깨끗함, 현대적, 기업" 등 미적, 감정적 톤을 설정하세요.
프롬프트 길이
- 15단어 미만: 정보가 충분하지 않습니다. 모델은 일반적인 선택으로 공백을 메웁니다.
- 30~80단어: 최적의 위치입니다. 부담스럽지 않게 조종할 수 있는 충분한 디테일.
- 120단어 초과: 모델에서 나중에 지침을 삭제할 수 있습니다. 가장 중요한 세부정보를 먼저 입력하세요.
조기에 추가할 가치가 있는 두 가지 기술
- 영화 참조. 이 모델은 이름으로 시각적 스타일을 인식합니다. "진한 주황색 및 청록색 그레이딩, 넓은 아나모픽 프레임" 또는 "대칭 구성, 파스텔 팔레트"는 많은 설명 단어를 줄여서 표현하는 역할을 합니다.
- 오디오 방향(Veo 3.1). Veo는 기본 오디오를 생성하므로 원하는 사운드를 설명하십시오. "양철 지붕에 내리는 부드러운 비 소리, 멀리서 들리는 천둥 소리, 음악 없음." 오디오 신호가 결과를 결정합니다.
세 가지 작업 예: 프롬프트 → 설정 → 모델 → 이유
예 1: Instagram용 제품 쇼케이스(Veo 3.1)
목표: 커피 브랜드의 릴용 세련된 수직 클립.
프롬프트: "9:16 수직. 전문 기계에서 천천히 에스프레소를 채우고 있는 도자기 컵의 클로즈업. 표면에 풍부한 크레마가 형성됩니다. 부드러운 뭉치 속에서 증기가 올라옵니다. 카메라가 약간 뒤로 당겨져 미니멀한 대리석 조리대가 드러납니다. 따뜻하고 분위기 있는 측면 조명. 에스프레소가 쏟아지는 소리. 고급스럽고 장인적인 느낌."
설정: 9:16 화면 비율, 1080p, 8초, Veo 3.1.
어떤 모델과 그 이유: Veo 3.1. 장면은 짧고 영화적이며 브리핑에서는 쏟아지는 사운드를 요청합니다. Veo의 기본 오디오는 이를 한 번에 처리하므로 별도의 사운드 디자인 단계가 없습니다. 8초는 단일 제품 비트에 충분하며 정확히 Veo의 4/6/8 범위 내에 위치합니다.
검토 및 반복: 깨끗한 붓기 동작, 일관된 증기 및 부드러운 풀백을 확인합니다. 크레마가 흐릿해 보인다면 "자연스러운 마블링이 살아있는 현실적인 에스프레소 크레마"를 추가해보세요. 게시물에 로고를 추가하세요.
예 2: 더 긴 여행 영웅 루프(시드런스 2.0)
목표: 여행 사이트 헤더에 대한 12초 공중 배경 루프입니다.
프롬프트: "16:9. 공중 드론이 열대 섬 근처의 청록색 바다 위로 천천히 날아갑니다. 왼쪽의 백사장. 잔잔한 파도가 물 속에서 패턴을 형성합니다. 밝은 일광, 선명한 색상, 부드럽고 루프 친화적입니다. 사람이 없습니다."
설정: 화면비 16:9, 720p, 12초, 시던스 2.0.
어떤 모델과 그 이유: Seedance 2.0. 12초에 대한 간략한 요구는 Veo의 8초 상한선보다 길기 때문에 Seedance의 정수 4~15초 범위가 올바른 도구입니다. 웹 배경 루프에는 동기화된 오디오가 필요하지 않으므로 Veo의 기본 사운드를 포기해도 비용이 들지 않으며 음소거된 내장 헤더에는 720p가 적합합니다.
검토 및 게시: 드론의 부드러운 움직임과 일관된 수채화 색상을 확인한 다음 깨끗한 루프를 위해 끝 부분을 다듬고 시작 부분으로 크로스페이드합니다. 웹에 최적화된 MP4를 내보냅니다.
예 3: 소셜용 양식화된 스크롤 스토퍼(Kling 3.0)
목표: 독특한 모양으로 시선을 사로잡는 초현실적인 클립입니다.
프롬프트: "9:16 수직. 버려진 쇼핑몰 중앙에 자라고 있는 거대한 고대 나무. 대리석 바닥을 뚫고 뿌리가 나옵니다. 부서진 유리 천장을 통해 햇빛이 흐르고, 나뭇잎 사이로 신의 빛이 쏟아집니다. 이끼와 덩굴이 에스컬레이터를 덮고 있습니다. 종말 이후의 아름다움, 회화적이고 양식화된 아름다움."
설정: 9:16 화면 비율, Kling 3.0(T2V 변형).
어떤 모델과 그 이유: Kling 3.0. 목표는 시각적 스펙터클이며 실사라기보다는 예술적인 느낌을 주는 모습입니다. Kling의 양식화되고 표현력이 풍부한 모션은 초현실적인 전제에 맞서기보다는 그 전제에 기댄 것입니다. 동일한 장면에 사운드가 포함된 실사 버전을 원한다면 Veo 3.1로 전환하여 8초로 줄였습니다.
검토 및 게시: 나무 구조가 일관되게 유지되고 조명이 자연스럽게 작동하는지 확인하세요. 짧은 텍스트 오버레이, 관련 해시태그, AI 콘텐츠 공개를 추가하세요.
일반적인 문제 해결
모델이 내 프롬프트의 일부를 무시합니다.: 아마도 너무 길거나 지침이 충돌할 수 있습니다. 길이를 줄이고 가장 중요한 세부 사항을 먼저 배치하세요. 모델은 나중에 지침을 생략하는 경향이 있습니다. 복잡한 장면의 경우 별도의 클립을 생성하고 함께 편집하세요.
인공물 및 시각적 결함.: 한 장면에 너무 많은 것을 요구하고 있습니다. 피사체가 너무 많고, 빠르며, 세부적입니다. 단순화하십시오. 더 적은 수의 캐릭터, 더 느린 동작, 더 짧은 지속 시간, 길이에 따라 드리프트가 증가합니다.
캐릭터는 매번 다르게 보입니다.: 참고 자료가 없으면 모델은 실행할 때마다 캐릭터를 다시 만들어냅니다. 매우 구체적으로 설명하세요("회색 수염과 둥근 안경을 쓴 50대 대머리 남성"). 실제 일관성을 위해 Seedance 2.0의 전방향 참조 모드를 사용하고 이미지 참조를 제공하세요.
카메라 움직임이 불안정합니다.: "동적 카메라"와 같은 모호한 용어는 예측할 수 없는 결과를 낳습니다. "천천히 돌리 전진", "안정적인 추적 촬영", "정적 삼각대" 등을 정확하게 수행하고 카메라 속도를 장면에 맞추세요.
색상이 잘못되었거나 바랜 경우.: "호박색과 벌꿀색 팔레트, 3500켈빈에 가까운 따뜻한 색온도"라고 구체적으로 설명하거나 알려진 시각적 스타일을 참조하세요. 언제든지 게시물을 통해 채점할 수 있습니다.
동영상이 일반적인 것처럼 보입니다.: 이는 즉각적인 문제입니다. 피사체, 동작, 환경, 카메라, 스타일 등 모든 곳에 세부 사항을 추가하세요. 모델은 프롬프트만큼 구체적일 수 있습니다.
자주 묻는 질문
텍스트-비디오에는 어떤 모델을 사용해야 합니까?+
샷에 따라 다릅니다. 특히 네이티브 오디오를 원하는 경우 1080p의 짧은 영화 클립(4, 6 또는 8초)에 Veo 3.1을 사용하세요. 더 긴 테이크의 경우 Seedance 2.0을 사용하세요. 4~15초의 정수 지속 시간을 수행하거나 여러 참조 자산이 필요한 경우에 사용하세요. 스타일리시하고 표현력이 풍부한 모션을 위해서는 Kling 3.0을 사용하세요. 세 가지 모두 muvi.video에서 감상하실 수 있습니다.
질문 2: 단일 텍스트-비디오 클립의 길이는 얼마나 되나요? Veo 3.1에서 클립은 4, 6, 8초입니다. Seedance 2.0에서는 4~15초 사이의 정수 길이를 설정할 수 있습니다. 더 긴 내용을 보려면 여러 개의 클립을 생성하고 타임라인에서 함께 편집하세요.
내 동영상에 오디오를 추가할 수 있나요?+
예, Veo 3.1을 사용하면 됩니다. 장면에 동기화된 기본 주변 사운드와 대화를 생성하므로 프롬프트에서 바로 오디오를 지정할 수 있습니다. Seedance와 Kling은 비주얼에 중점을 둡니다. 게시물에 사운드트랙을 추가하세요.
질문 4: 실제로 출력을 얼마나 제어할 수 있나요? 많이. 프롬프트는 피사체, 동작, 설정, 카메라 움직임, 조명, 스타일 및 (Veo 3.1의 경우) 오디오를 제어합니다. 프롬프트 외에도 Seedance 2.0의 옴니 참조 모드를 사용하면 일관성을 위해 최대 9개의 이미지 참조, 3개의 비디오 참조 및 3개의 오디오 참조로 결과를 고정할 수 있습니다.
어떤 화면비와 해상도가 지원되나요?+
Veo 3.1은 16:9 또는 9:16으로 1080p를 출력합니다. Seedance 2.0은 480p 또는 720p에서 6가지 화면 비율을 지원하며 시작/끝 프레임 작업은 최대 1440p에 이릅니다. 웹과 YouTube의 경우 16:9를 선택하고 수직 소셜의 경우 9:16을 선택합니다.
텍스트-비디오를 무료로 사용해 볼 수 있나요?+
세대수 제한이 있고 신용카드 없이 muvi.video에서 무료로 테스트할 수 있습니다. 유료 플랜은 귀하가 제작한 비디오에 대해 더 많은 세대 볼륨과 상용 라이센스를 추가합니다.
동영상을 어떤 용도로 사용할 수 있나요?+
소셜 미디어, 마케팅 클립, 광고, 웹사이트 배경, 프리젠테이션, 단편 영화, 제품 시각화 및 교육 콘텐츠. muvi.video의 유료 플랜에서는 귀하가 생성하는 비디오에 상업용 라이센스가 함께 제공됩니다.
첫 번째 텍스트-비디오 프로젝트 시작
muvi.video는 Veo 3.1, Seedance 2.0 및 Kling 3.0을 한 곳에 모아 모든 장면에 적합한 모델을 일치시킬 수 있습니다. 프롬프트를 입력하고, 모델을 선택하고, 비디오를 생성하세요.
CTA 버튼: > 무료로 텍스트-비디오를 사용해 보세요
Related Guides
텍스트-비디오 AI 튜토리얼: 프롬프트에서 전문 비디오까지
텍스트-비디오는 말 그대로 설명을 입력하면 모델이 비디오를 반환합니다. 카메라도 없고, 스톡 영상도 없고, 편집 타임라인도 없습니다. 단어 입력, 동작 출력.