Blog
Metinden Videoya Yapay Zeka Eğitimi: İstemden Profesyonel Videoya
Metinden videoya geçiş tam olarak göründüğü gibidir: bir açıklama yazıyorsunuz ve bir model bir video döndürüyor. Başlangıç için kamera yok, stok görüntüleri yok, düzenleme zaman çizelgesi yok. Kelimeler içeri, hareket dışarı.
Yazar Gürsu Yaman · Kurucu, muvi.video ·
Metinden Videoya Yapay Zeka Eğitimi: İstemden Profesyonel Videoya
Metinden Videoya Gerçekte Nedir?
Metinden videoya geçiş tam olarak göründüğü gibidir: bir açıklama yazıyorsunuz ve bir model bir video döndürüyor. Başlangıç için kamera yok, stok görüntüleri yok, düzenleme zaman çizelgesi yok. Kelimeler içeri, hareket dışarı.
muvi.video'yu çalıştırıyorum ve bu kategorinin çok kısa bir süre içinde "ilginç demo"dan "müşteri çalışmasını bununla gönderiyoruz"a geçişini izledim. Bunun nedeni, temel modellerin hareketi, ışığı ve bir kameranın zaman içinde nasıl davrandığını anlamada önemli ölçüde daha iyi hale gelmesidir.
Bu eğitim, bu konuda hızla ilerlemek isteyen bir arkadaşıma anlatacaklarımın pratik versiyonudur. Modellerin genel olarak nasıl çalıştığını (kısaca, çünkü yönlendirme için önemli olduğu için), muvi.video'daki gerçek istem-video akışını, güvendiğimiz üç model arasında nasıl seçim yapılacağını, tamamen çalışılmış üç örneği ve kısa bir SSS'yi kapsar.
Yayılım Modelleri Videoyu Nasıl Oluşturur (Kısa Versiyon)
İyi bir ipucu vermek için doktora derecesine ihtiyacınız yoktur, ancak mekanizmayı anlamak, yönlendirmelerinizi fark edilir derecede daha iyi hale getirir.
Metinden videoya modeli, saf görsel gürültüyle başlar; her karedeki TV statikliğini düşünün. Ardından, metin isteminizin rehberliğinde bir dizi gürültü giderme adımı gerçekleştirir. Her adımda bir miktar gürültüyü ortadan kaldırır ve pikselleri açıklamanıza uyan bir şeye doğru iter. Yeterli adımın ardından tutarlı çerçeveler ortaya çıkar. Bu sürece difüzyon denir.
Bu mekanizmanın üç sonucu, nasıl yönlendirmeniz gerektiğini şekillendirir:
1. Model belirsiz bıraktığınız her şeyi doldurur. Makul bir sahneyi istatistiksel olarak yeniden oluşturduğundan, belirtmediğiniz her şey en yaygın eğitim verileri yanıtıyla doldurulur. "Bir kadın" genel bir kadın haline gelir. Spesifiklik kontroldür. 2. Hareket tahmin edilir, filme alınmaz. Model, nesnelerin ve kameraların nasıl hareket etme eğiliminde olduğunu öğrenmiştir. Bu nedenle bir kamera hareketini adlandırmak ("yavaş kaydırma") işe yarar, onun zaten bildiği hareket kalıpları arasından seçim yaparsınız. 3. Daha uzun ve daha yoğun sahneler daha zordur. Daha fazla kare ve daha fazla hareketli nesne, gürültünün azaltılması için daha fazla şans anlamına gelir. Daha basit sahneler ve daha kısa klipler daha güvenilirdir. Bu nedenle kelimeler kadar model ve süre seçimi de önemlidir.
İhtiyacınız olan tüm teori bu. Şimdi iş akışına geçelim.
muvi.video'ya Başlarken
Başlamanın en hızlı yolu muvi.video kullanmaktır. Kurulum hızlıdır.
1. Adım: Hesabınızı Oluşturun
muvi.video adresini ziyaret edin ve e-posta adresiniz veya bir Google hesabıyla kaydolun. Ücretsiz katman, platformu sınırlı sayıda nesille test etmenize olanak tanır; kredi kartı gerekmez.
Adım 2: Arayüzü Öğrenin
İçeri girdiğinizde çalışma alanı basittir:
- Bilgi alanı: metin açıklamanızı yazdığınız yer
- Model seçici: işi hangi yapay zeka modelinin çalıştıracağını seçeceğiniz yer
- Ayarlar paneli: en boy oranını, çözünürlüğü ve süreyi ayarladığınız yer
- Oluştur düğmesi: işi başlatır
- Galeri: tamamlanan videolarınızın yayınlandığı yer
3. Adım: Temel Ayarları Anlayın
Her model, her proje için önemli olan üç ayarı ortaya çıkarır:
- En boy oranı: Yatay için 16:9 (YouTube, web), dikey için 9:16 (Reels, TikTok, Shorts), artı Sedance'te kare ve diğer formatlar için ek oranlar.
- Çözünürlük: Veo 3.1'de 1080p; Sedance 2.0'da 480p veya 720p (Sedance başlangıç/son kare işleri 1440p'ye kadar çıkarken).
- Süre: Modellerin en çok farklılaştığı nokta burasıdır ve model seçimini yönlendirir; sonraki bölüme bakın.
Kurulum için bu kadar. Bir model seçelim.
Doğru Modeli Seçmek
Üç modeli önde ve ortada tutuyoruz çünkü her birinin açık bir şeridi var. İtibara göre değil, atışın neye ihtiyacı olduğuna göre seçim yapın.
Veo 3.1, sesli kısa sinematik çekimler için
Veo 3.1 4, 6 veya 8 saniyede 1080p ve 16:9 veya 9:16 formatında klipler oluşturur. Öne çıkan özelliği doğal ses: ortam sesi üretebilir ve hatta görüntüyle birlikte sahneyle senkronize diyaloglar bile üretebilir. Ayrıca Hızlı, Kaliteli, ECL Görüntüden Videoya modu ve ECL Başlangıç/Bitiş Çerçevesi modu gibi çeşitli değişkenler sunar.
Gösterişli 8 saniyelik sinematik bir ritim istediğinizde, çekim senkronize sesten yararlandığında veya son, kahraman kalitesinde çekimler yaparken Veo 3.1'e ulaşın. Daha ayrıntılı bilgi için The Complete Guide to Veo 3.1 konusuna bakın.
Sedance 2.0, daha uzun süreler için, 15 saniyeye kadar
Sedance 2.0, 4 ila 15 saniye arasında tam sayı süreleri oluşturur; bu da onu, Veo'nun tek geçişte üretebileceğinden daha uzun bir süreye ihtiyaç duyduğunuzda kullanılacak model haline getirir. 480p veya 720p'de altı en boy oranını (ve 1440p'ye kadar başlangıç/son kare işlerini) destekler. Çeşitleri oldukça geniştir: metinden videoya, görüntüden videoya, dokuz görüntü referansını, üç video referansını ve üç ses referansını kabul eden çoklu referans modu ve ayrıca bir başlangıç/bitiş kare modu.
Süre öncelikli olduğunda, bir karakteri veya ürünü sabitlemek için birden fazla referans varlığınız olduğunda veya 16:9 ve 9:16 dışında bir en boy oranına ihtiyaç duyduğunuzda Sedance 2.0'a ulaşın.
Stilize hareket için Kling 3.0
Katı fotogerçekçilik yerine stilize edilmiş, karakterli bir görünüm istediğinizde Kling 3.0 tercihinizdir. T2V (metinden videoya), I2V (görüntüden videoya) ve Kling O3 olmak üzere üç modelle gönderilir. Hareketi, yaratıcı, animasyona dayalı ve sanat odaklı içeriğe uygun, ayırt edici, etkileyici bir kaliteye sahiptir.
Hızlı karar tablosu
| İhtiyaç | Modeli | neden |
|---|---|---|
| 8'li sesli sinematik çekim | Veo3.1 | Yerel ses, 1080p, geliştirilmiş hareket |
| A 8 saniyeden uzun sürer (15 saniyeye kadar) | Sedans 2.0 | Tamsayı 4–15s süreleri |
| Çoklu referans varlıkları (resim/video/ses) | Sedans 2.0 | Çok yönlü referans: 9 resim + 3 video + 3 ses |
| Stilize / etkileyici hareket | Kling 3.0 | Ayırt edici, fotogerçekçi olmayan görünüm |
| Kare veya standart dışı en boy oranı | Sedans 2.0 | Altı en boy oranı |
Pratik iş akışı
Çoğu proje için, isteminizin taslağını çıkarın ve bir ilk geçiş yapın, metni gözden geçirin, hassaslaştırın ve ardından finali çalıştırın. Gerçekte göndereceğiniz ürün üzerinde bir nesil harcamadan önce fikri ucuz bir şekilde doğrulayın. Daha derin anlık zanaat için istem yazma kılavuzumuza ve AI video oluşturucuya genel bakışımıza bakın.
Etkili Bilgi İstemleri Yazma
İstem modelden daha önemlidir. Tembel bir ipucuna sahip iyi bir model, her seferinde dikkatli bir ipucuna karşı kaybeder. Bu beş unsuru kapsadığınızda isabet oranınız anında yükselir.
1. Konu, olay yerinde kim veya ne var. Spesifik olun. "Kadın" zayıftır. "40'lı yaşlarında, kısa gümüş saçlı, lacivert ceket giyen bir kadın" güçlüdür. Model ancak ona verdiğiniz şeyle çalışabilir.
2. Eylem, neler oluyor. Hareketi ve olayları açıklayın. "Ayakta" statiktir. "Bir pazarda yavaşça yürümek, taze ürünleri incelemek için duraklamak", modele oluşturulacak dinamik içerik kazandırır.
3. Gerçekleştiği yer. Çevre algılanan kaliteyi yönlendirir. "Mutfak" geneldir. "Tavandan sarkan bakır tencere ve dantel perdelerden sabah ışığının olduğu rustik bir İtalyan çiftlik evi mutfağı" canlı, özel bir sahne yaratıyor.
4. Kamera, nasıl çekildiğini. Çoğu insanın atladığı öğe ve genel ile sinematik arasındaki fark. Çekim boyutunu ("yakın çekim" vs "geniş çekim"), hareketi ("statik tripod" vs "yavaş takipli çekim"), açıyı ("düşük açılı yukarıya bakma" vs "tepeden") ve odağı ("sığ alan derinliği" vs "derin odak") adlandırın.
5. Stil ve ruh hali, nasıl hissettirdiği. Estetik ve duygusal tonu belirleyin: "sinematik, sıcak, samimi" veya "belgesel tarzı, elde taşınır, cesur" veya "temiz, modern, kurumsal."
Bilgi istemi uzunluğu
- 15 kelimenin altında: yeterli bilgi yok; model, boşlukları genel seçimlerle dolduruyor.
- 30–80 kelime: en önemli nokta. Ezilmeden yönlendirmek için yeterli ayrıntı.
- 120 kelimeden fazla: model daha sonraki talimatları bırakabilir. En önemli ayrıntılarınızı ilk sıraya koyun.
Erken eklemeye değer iki teknik
- Sinematik referanslar. Bu modeller görsel stilleri adlarına göre tanır. "Derin turuncu ve turkuaz tonlama, geniş anamorfik çerçeveleme" veya "simetrik kompozisyon, pastel palet" birçok açıklama kelimesi için kısa yol görevi görür.
- Ses yönü (Veo 3.1). Veo yerel ses ürettiğinden, istediğiniz sesi tanımlayın: "teneke çatıya yağan hafif yağmurun sesi, uzaktaki gök gürültüsü, müzik yok." Sesli ipuçlarınız sonuca yön verir.
Çalışılan Üç Örnek: Bilgi İstemi → Ayarlar → Model → Neden
Örnek 1: Instagram için Ürün Vitrini (Veo 3.1)
Hedef: Bir kahve markasının Reels'i için gösterişli dikey bir klip.
İstem: "9:16 dikey. Profesyonel bir makineden yavaşça espresso ile doldurulan porselen bir bardağın yakın çekimi. Yüzeyde zengin krema oluşuyor. Buhar yumuşak tutamlar halinde yükseliyor. Kamera hafifçe geri çekilerek minimalist mermer tezgahı ortaya çıkarıyor. Sıcak, karamsar yan aydınlatma. Espresso dökme sesi. Lüks, zanaatkarlık hissi."
Ayarlar: 9:16 en boy oranı, 1080p, 8 saniye, Veo 3.1.
Hangi model ve nedeni: Veo 3.1. Çekim kısa ve sinematiktir ve özet, dökümün sesini ister; Veo'nun yerel sesi bunu tek geçişte halleder, dolayısıyla ayrı bir ses tasarımı adımı yoktur. Sekiz saniye, tek bir ürün ritmi için fazlasıyla yeterli ve Veo'nun 4/6/8 aralığının tam içinde yer alıyor.
İnceleyin ve yineleyin: Temiz dökme hareketi, tutarlı buhar ve sorunsuz geri çekme olup olmadığını kontrol edin. Krema kötü görünüyorsa, "doğal ebrulu gerçekçi espresso kreması" ekleyin. Logonuzu yazıya ekleyin.
Örnek 2: Daha Uzun Seyahat Kahraman Döngüsü (Seedance 2.0)
Hedef: Seyahat sitesi başlığı için 12 saniyelik havadan arka plan döngüsü.
İstem: "16:9. Tropikal bir ada yakınındaki turkuaz okyanus üzerinde yavaşça uçan bir drone çekimi. Soldaki beyaz kumlu plaj. Hafif dalgalar suda desenler oluşturur. Parlak gün ışığı, canlı renkler, pürüzsüz ve döngü dostu. Hiç insan yok."
Ayarlar: 16:9 en boy oranı, 720p, 12 saniye, Seedance 2.0.
Hangi model ve nedeni: Sedance 2.0. Özette 12 saniye gerekiyor ve bu da Veo'nun 8 saniyelik tavanından daha uzun, dolayısıyla Sedance'in 4-15 saniyelik tamsayı aralığı doğru araç. Bir web arka plan döngüsü senkronize sese ihtiyaç duymaz, bu nedenle Veo'nun yerel sesinden vazgeçmenin burada hiçbir maliyeti yoktur ve sessiz, yerleşik bir başlık için 720p iyidir.
İnceleyin ve yayınlayın: Düzgün drone hareketi ve tutarlı sulu renk olup olmadığını kontrol edin, ardından temiz bir döngü için ucu kırpın ve başlangıca çapraz geçiş yapın. Web için optimize edilmiş bir MP4'ü dışa aktarın.
Örnek 3: Sosyal Medya için Stilize Kaydırma Durdurucu (Kling 3.0)
Hedef: Kendine özgü bir görünüme sahip, dikkat çekici, gerçeküstü bir klip.
İstem: "9:16 dikey. Terk edilmiş bir alışveriş merkezinin ortasında büyüyen devasa, antik bir ağaç. Kökler mermer zemini delip geçiyor. Güneş ışığı parçalanmış cam tavandan süzülüyor, tanrı ışınları yaprakların arasından süzülüyor. Yürüyen merdivenleri yosun ve sarmaşıklar kaplıyor. Kıyamet sonrası güzellik, resimsel ve stilize."
Ayarlar: 9:16 en boy oranı, Kling 3.0 (T2V modeli).
Hangi model ve nedeni: Kling 3.0. Amaç görsel gösteri ve fotogerçekçi olmaktan çok sanat odaklı bir görünümdür. Kling'in stilize, etkileyici hareketi gerçeküstü önermeyle mücadele etmek yerine ona yaslanıyor. Aynı sahnenin sesli, fotoreal versiyonunu isteseydik Veo 3.1'e geçip bunu 8 saniyeye indirirdik.
İnceleyin ve yayınlayın: Ağaç yapısının tutarlı kaldığını ve ışığın doğal davrandığını kontrol edin. Kısa bir metin katmanı, ilgili hashtag'ler ve yapay zeka içeriği açıklamanızı ekleyin.
Yaygın Sorunları Giderme
Model, istemimin bir kısmını yok sayıyor.: Muhtemelen çok uzun veya çelişkili talimatlar içeriyor. Kısaltın ve en önemli ayrıntıları ilk sıraya koyun; modeller talimatları daha sonra bırakma eğilimindedir. Karmaşık sahneler için ayrı klipler oluşturun ve bunları birlikte düzenleyin.
Yapılar ve görsel aksaklıklar.: Bir sahneden çok fazla şey istiyorsunuz: çok fazla konu, çok hızlı, çok ayrıntılı. Basitleştirin. Daha az karakter, daha yavaş aksiyon, daha kısa süre, uzunluk arttıkça sürüklenme artar.
Karakterler her seferinde farklı görünüyor.: Referans olmadan model, her çalıştırmada karakteri yeniden icat eder. Son derece spesifik olun ("50'li yaşlarında, gri sakallı ve yuvarlak gözlüklü kel bir adam"). Gerçek tutarlılık için Sedance 2.0'ın çok yönlü referans modunu kullanın ve görüntü referanslarını besleyin.
Kamera hareketi sarsıntılı.: "Dinamik kamera" gibi belirsiz terimler öngörülemeyen sonuçlar doğurur. Kesin olun, "yavaş ileri doğru hareket ettirin", "sabit takipli çekim", "statik tripod" kullanın ve kamera hızını sahneye göre ayarlayın.
Renkler yanlış veya soluk.: Açıkça belirtin: "kehribar ve bal-altın rengi paleti, 3500 kelvin civarında sıcak bir renk sıcaklığı" veya bilinen bir görsel stile atıfta bulunun. Gönderide her zaman not verebilirsiniz.
Video genel görünüyor.: Bu anlık bir sorundur. Her yere konu, eylem, ortam, kamera ve stil gibi ayrıntıları ekleyin. Model yalnızca isteminiz kadar spesifik olabilir.
Sıkça Sorulan Sorular
S1: Metinden videoya geçiş için hangi modeli kullanmalıyım? Bu vuruşa bağlı. Özellikle yerel ses istediğinizde, 1080p'de kısa sinematik klipler (4, 6 veya 8 saniye) için Veo 3.1 kullanın. Daha uzun çekimler için Seedance 2.0'ı kullanın, 4 ile 15 saniye arasındaki tamsayılı süreleri veya birden fazla referans varlığına ihtiyaç duyduğunuzda kullanın. Stilize, etkileyici hareket için Kling 3.0 kullanın. Üçüne de muvi.video adresinden ulaşılabilir.
S2: Metinden videoya dönüştürülen tek bir klip ne kadar uzun olabilir? Veo 3.1'de bir klip 4, 6 veya 8 saniyedir. Sedance 2.0'da 4 ila 15 saniye arasında herhangi bir tamsayı uzunluğunu ayarlayabilirsiniz. Daha uzun bir süre için birden fazla klip oluşturun ve bunları zaman çizelgenizde birlikte düzenleyin.
S3: Videomla ses alabilir miyim? Evet, Veo 3.1 ile. Yerel ortam sesi ve sahneyle senkronize edilmiş diyaloglar üretir, böylece sesi doğrudan isteminizde yönlendirebilirsiniz. Sedance ve Kling görsellere odaklanıyor; bunlar için yazıya bir film müziği ekleyin.
S4: Çıktı üzerinde gerçekte ne kadar kontrole sahibim? Çok fazla. Komut istemi konuyu, eylemi, ayarı, kamera hareketini, aydınlatmayı, stili ve (Veo 3.1'de) sesi kontrol eder. İstemin ötesinde, Seedance 2.0'ın çok yönlü referans modu, tutarlılık için sonuçları dokuz adede kadar görüntü referansı, üç video referansı ve üç ses referansıyla sabitlemenize olanak tanır.
S5: Hangi en boy oranları ve çözünürlükler destekleniyor? Veo 3.1, 1080p'yi 16:9 veya 9:16 formatında üretir. Sedance 2.0, 480p veya 720p'de altı en boy oranını destekler ve başlangıç/son çerçeve işleri 1440p'ye kadar ulaşır. Web ve YouTube için 16:9'u, dikey sosyal medya için ise 9:16'yı seçin.
S6: Metinden videoya dönüştürmeyi denemek ücretsiz midir? Sınırlı sayıda nesille ve kredi kartı olmadan muvi.video üzerinden ücretsiz olarak test edebilirsiniz. Ücretli planlar, oluşturduğunuz videolara daha fazla üretim hacmi ve ticari lisanslama ekler.
S7: Videoları ne için kullanabilirim? Sosyal medya, pazarlama klipleri, reklamlar, web sitesi arka planları, sunumlar, kısa filmler, ürün görselleştirmeleri ve eğitim içerikleri. muvi.video'nun ücretli planlarında oluşturduğunuz videolar ticari bir lisansla birlikte gelir.
İlk Metinden Videoya Projenize Başlayın
muvi.video, Veo 3.1, Sedance 2.0 ve Kling 3.0'ı tek bir yerde toplayarak her çekime doğru modeli eşleştirebilmenizi sağlar. Bir bilgi istemi yazın, bir model seçin, bir video oluşturun.
Related Guides
Metinden Videoya Yapay Zeka Eğitimi: İstemden Profesyonel Videoya
Metinden videoya geçiş tam olarak göründüğü gibidir: bir açıklama yazıyorsunuz ve bir model bir video döndürüyor. Başlangıç için kamera yok, stok görüntüleri yok, düzenleme zaman çizelgesi yok. Kelimeler içeri, hareket dışarı.