Bloga dön
BananaBanana Teamtutorialvideoimage-to-video

Yapay Zeka Görselden Video: Fotoğrafları Canlandırın

Yapay zeka görselden video üretimi nasıl çalışır? Veo 3.1 ve Omni Flash modelleri, $0.10'dan başlayan fiyatlar, hareket komutları ve döngüler.

Yapay Zeka Görselden Video: Fotoğrafları Canlandırın

Yapay zeka görselden video, yapay zeka modelinin tek bir sabit resmi alıp bir klibin ilk karesi olarak kabul ettiği ve sonrasında gerçekleşen her şeyi kendi kurguladığı bir üretim tekniğidir: hareket, kamera hareketleri, ışık değişimleri ve hatta bazen ses. Tek yapmanız gereken bir fotoğraf yüklemek ve neyin hareket etmesini istediğinizi metinle tarif etmektir. Model, yüklediğiniz görselin birebir canlandığı, genellikle 4 ila 10 saniye uzunluğunda kısa bir video üretir.

Kısaca özetlemek gerekirse: BananaBanana generator sayfasına bir fotoğraf yükleyin, hareketi tarif edin ve 2–5 dakika bekleyin. Veo 3.1 Lite ile fotoğrafınızdan üretilen 4 saniyelik sessiz bir klip $0.10'dan başlar; ses eklemek bu fiyatı $0.18'a çıkarır. Gemini Omni Flash ise bir fotoğrafı tam bir ses kuşağıyla $0.30'dan başlayan fiyatlarla canlandırır ($0.10 saniye başına faturalandırılır). Yeni hesaplara hediye edilen ücretsiz $0.20 bakiye, iki adet sessiz deneme klibi üretmenizi sağlar.

Sistemimizde aktif olarak dört farklı video modeli çalıştırıyoruz. Bu yüzden buradaki kılavuz, pazarlama vaatlerine değil, başarısız denemelerimiz de dahil olmak üzere gerçek üretim loglarına dayanıyor. Zaten bazen hatalardan öğrenmek başarılardan öğrenmekten çok daha öğreticidir.

Yapay zeka görselden video üretimi nasıl çalışır?

İşin arka planında, sabit görsel modele bir yönlendirici referans kare (conditioning frame) olarak aktarılır. Google'ın Gemini API video docs dokümanlarında, Veo 3.1 modelinin "görsel tabanlı yönlendirme" (image-based direction) ve "kareye özel üretim" (frame-specific generation) özelliklerini desteklediği belirtiliyor. Yani daha sade bir dille söylersek; yüklediğiniz resim tüm klibi yönlendirir ve isterseniz tam olarak hangi karelerin nerede yer alacağını sabitleyebilirsiniz. Model sahneyi inceler, fizik kurallarını tahmin eder (fotoğraftaki suyun nasıl dalgalanacağını veya rüzgarda saçların nasıl savrulacağını hesaplar) ve başlangıç noktanızdan itibaren kare kare videoyu işlemeye başlar.

Bunun pratik sonucu şudur: Çıktının ilk karesi, neredeyse pikseli pikseline sizin fotoğrafınızdır. Sonrasındaki her şey modelin hayal gücüdür. Bu yüzden iyi komutlar (prompt), modelin zaten gördüğü şeyleri tekrar tarif etmek yerine tamamen sonradan gelişecek olaylara odaklanır.

Bu yöntem, içinde doğal bir hareket potansiyeli barındıran sahnelerde şaşırtıcı derecede iyi sonuç verir. Portredeki bir insan nefes alıp göz kırpar. Kahveden dumanlar yükselir. Park edilmiş bir araba hareket edip uzaklaşır. Ancak fotoğrafta mantıklı hiçbir hareket ihtimali yoksa sonuçlar o kadar da etkileyici olmaz: Beyaz arka plan üzerinde duran düz bir ürün modellemesi yükleyip komut satırında da hiçbir hareket belirtmezseniz, genellikle ortaya yavaş ve hafif sarsıntılı bir yakınlaştırma efekti çıkar. Sistem bozuk değildir, sadece sonuç sıkıcıdır.

Yapay zeka görselden video canlandırma sürecini gösteren, iki elin arasında tutulan ve içindeki sahnesi hareketlenmeye başlayan eski bir fotoğraf

Bir fotoğrafı en iyi hangi model videoya dönüştürür?

Platformdaki dört video modelinin tümü ilk kare olarak görsel kabul eder. Ancak sınırları ve maliyetleri açısından birbirlerinden ayrılırlar.

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
Fiyat (4 saniye, sessiz)$0.70$0.35$0.10
Fiyat (4 saniye, sesli)$1.50$0.50$0.18$0.40 ($0.10 saniye başına)
Maksimum çözünürlük4K4K1080pSadece 720p
Süretam olarak 4/6/7/8 stam olarak 4/6/7/8 stam olarak 4/6/7/8 stam olarak 3–10 s
Sesisteğe bağlıisteğe bağlıisteğe bağlıher zaman açık
Son kare + döngülerevetevetevethayır
148 saniyeye uzatmaevetevethayırhayır, yerine sohbet tabanlı düzenleme

Benim genellikle tercih ettiğim model Veo 3.1 Fast. Amiral gemisi modelin yarı fiyatına tüm kullanışlı kontrolleri (tam süre, isteğe bağlı son kare, uzatma) sunuyor. Sosyal medya boyutlarındaki çıktılarda ana Veo 3.1 ile arasındaki kalite farkı da neredeyse hiç hissedilmiyor. Görseli hareketlendirme fikrimin tutup tutmayacağını, yani işe yarayıp yaramayacağını gerçek bir bütçe harcamadan önce denemek için $0.10 fiyatındaki Lite sürümünü kullanıyorum. Tam sürüm Veo 3.1 ise özellikle su, kumaş dalgalanması, çarpışma sahneleri barındıran veya teslim formatının kesinlikle 4K olması gereken durumlarda parasının hakkını sonuna kadar veriyor. Sesin de görüntü kadar kritik olduğu işlerde ise tercih Gemini Omni Flash olmalı. Bu modeli, tam ekran projeler için can sıkıcı olan 720p sınırı dahil tüm detaylarıyla ayrı bir Omni Flash API incelemesi yazısında masaya yatırmıştık.

Yukarıdaki klip, bu yazı için kendi sistemimiz üzerinden Veo 3.1 Fast modeliyle ürettiğimiz gerçek bir örnek: Masanın üzerinde duran çerçeveli bir yelkenli fotoğrafı var ve girdiğimiz komut, kamera yavaşça yaklaşırken çerçevenin içindeki denizin dalgalanmaya başlamasını istiyor. Tek denemede çıktı aldık, hiçbir düzenleme yapmadık ve bilerek sessiz ürettik (taslaklar için genellikle Fast modelinin sessiz seçeneğini kullanıyoruz). Bu "fotoğrafın canlanması" etkisi, modelin kendi yüklediğiniz görsellere de uygulayacağı şeyin tam olarak aynısı.

Adım adım fotoğraftan video nasıl üretilir?

Yaratıcı araçtaki tüm bu süreç, video oluşturma (render) süresi hariç yaklaşık bir dakikanızı alır.

  1. Paneli video moduna alın ve bir model seçin. İlk deneme için $0.10 fiyatıyla Veo 3.1 Lite, işi öğrenmenin en hesaplı yoludur.
  2. Fotoğrafınızı ilk kare olarak yükleyin. JPG veya PNG formatındaki görseliniz seçtiğiniz video en boy oranına göre kırpılacaktır, bu nedenle üretime başlamadan önce kenarları kontrol edin.
  3. 16:9 veya 9:16 oranını seçin. Dikey format TikTok ve Reels için gayet iyi çalışır; model portre kadrajını sorunsuz şekilde işler.
  4. Hareket komutunu yazın (bir sonraki bölümde değineceğiz). İsteğe bağlı olarak, videoda olmasını istemediğiniz unsurlar için 1000 karaktere kadar bir olumsuz (negative) prompt ekleyebilirsiniz.
  5. Süreyi ve ses isteyip istemediğinizi seçin. Veo modellerinde her ikisi de tam ayarlardır; Omni Flash'te ise 3 ila 10 saniye arasında herhangi bir uzunluk seçebilir ve ses her zaman açık olur.
  6. Videoyu üretin. İşlem yaklaşık 2–5 dakika sürer. Bu sırada sekmeyi kapatabilirsiniz; üretilen videolar 30 gün boyunca geçmişinizde saklanır.

Bakiyenizden harcama sadece işlem başarıyla tamamlandığında düşer. Hatalı denemeler otomatik olarak iade edilir. Video üretiminde deneme yanılma oranı görsellere kıyasla daha yüksek olduğundan bu iade konusu oldukça önemlidir.

Yapay zeka ile görselden video yapma iş akışını gösteren; fotoğraf yükleme adımı, ayarlar paneli ve tamamlanmış video oynatıcıdan oluşan üç panelli görsel

Görselden video üretimi için hareket komutları nasıl yazılır?

Birinci kural: Sahneyi değil, hareketi tarif edin. Sahne zaten fotoğrafta mevcut. "Kırmızı paltolu bir kadın köprüde duruyor" ifadesi, modelin zaten gördüğü detayları tekrarlayarak komut alanını boşa harcamaktır. Bunun yerine aynı uzunluktaki "Rüzgarda saçları dalgalanırken kameraya dönüp gülümsüyor, yavaş dolly-in" komutu doğrudan hareket odaklıdır ve mükemmel sonuç verir.

Veo modellerinde kamera terimleri çok büyük iş başarır: Dolly-in, orbit (etrafında dönme), handheld (el kamerası), static tripod shot (sabit tripod çekimi), slow pan left (yavaşça sola kaydırma). Modellerin gerçek çekim açıklamalarıyla eğitildiği çok belli; bu yüzden "dinamik olsun" gibi belirsiz ifadeler yerine sinematografik terimlere çok daha kararlı tepki veriyorlar. Ben olsam "dinamik" kelimesini tamamen kullanmaktan kaçınırdım. Model de dahil olmak üzere hiç kimse bu kelimenin tam olarak ne anlama geldiği konusunda hemfikir değil.

Bu blog için tanıtım klipleri hazırlarken pahalıya mal olan bir tecrübe edindik: Bu modeller, ilk karede halihazırda ne oluyorsa onu sürdürme eğilimindedir ve videonun ilerleyen saniyelerinde başlamasını istediğiniz hareketleri sessizce es geçer. Bir keresinde Omni Flash modelinden "klibin ortalarına doğru" bir pankeki havada ters yüz etmesini istedik ve elimizde on saniye boyunca öylece duran bir pankek videosu kaldı. Üstelik bunu arka arkaya üç kez denedik, yani deneme başına bir dolarımız boşa gitti. Hareketi "halihazırda gerçekleşiyormuş gibi" yeniden yazdığımızda ise ilk denemede başardık. Yani: "Pankeklerin üzerine şurup dökülüyor" komutu, "iki saniye sonra şurup dökülmeye başlasın" komutundan katbekat iyidir. Özellikle görselden video üretirken, istediğiniz hareketin o anda gerçekleşiyor olmasının mantıklı duracağı bir başlangıç fotoğrafı seçin.

İşte her zaman harika sonuç veren birkaç hazır şablon:

  • Portreler: "hafif nefes alma, yavaşça göz kırpma ve ardından küçük bir gülümseme; sabit kamera". Bu komut, büyük hareketlerin neden olduğu o tuhaf ve yapay bozulmalar (uncanny valley) olmadan görseli canlandırır.
  • Ürünler: "nesnenin etrafında yavaşça 180 derece dönen kamera, stüdyo ışıkları sabit kalıyor". Ürün tanıtımları için en kullanışlı şablondur. Kaynak fotoğrafta arka planın sade olmasına dikkat edin.
  • Manzaralar: Hareket eden unsurları doğrudan adlandırın ("bulutlar sağa kayıyor, çimenler dalgalanıyor, ışık daha sıcak bir tona dönüyor"). Aksi takdirde model, varsayılan olarak o sarsıntılı yakınlaştırma efektine dönecektir.

Yapay zeka görselden video üretimi için hareket komutları yazımını gösteren; bir fotoğraf, üzerinde çizilmiş kamera hareket yönleri ve el yazısı notların yanındaki yönetmen klaketi

Döngüler, son kareler ve 148 saniyelik videolar

Veo 3.1 modelleri, ilk karenin yanı sıra isteğe bağlı olarak bir son kare de kabul eder. Modele iki farklı fotoğraf verdiğinizde, aralarında yumuşak bir geçiş oluşturur. Bu sayede bir gündüz çekimini geceye dönüştürebilir veya kaba bir taslağı bitmiş bir ürüne dönüştürebilirsiniz (morphing). Hem başlangıç hem de son kare için aynı fotoğrafı seçerseniz, başladığı yerde biten pürüzsüz bir döngü (loop) elde edersiniz; bu, web siteleri arka planları veya sinemagraf tarzı paylaşımlar için mükemmeldir. Bu benim platformda en az değer gören ama en sevdiğim özelliktir.

Uzatma (extension) özelliği ise bir diğer Veo marifetidir. Tamamlanmış bir klibe, yeni bir komut ekleyerek 7 saniye daha süre ekleyebilirsiniz. Bu zincirleme uzatma işlemi, görsel bütünlük tamamen korunarak toplamda 148 saniyeye kadar sürdürülebilir (yalnızca Veo 3.1 ve Fast modellerinde geçerlidir; Lite ve Omni Flash bu özelliğe sahip değildir). Kendi fotoğrafınızla başlayıp böyle uzun bir video zinciri oluşturmak, günümüz API'lerinin sunduğu hikaye tahtasından (storyboard) bağımsız film yapımına en yakın deneyimdir. Tabii ki bu özellik maliyetleri de katlayarak artırır; bu yüzden fikre aşık olmadan önce bütçenizi iyi planlayın.

Omni Flash ise uzatma özelliğinin yerini düzenleme ile doldurur: bitmiş klipte bir değişiklik tarif edersiniz ("akşamüstü yap, diğer her şeyi aynı tut" gibi) ve saniyeleri için tekrar ödeme yaparsınız – ayrıca kendi yüklediğiniz de dahil olmak üzere kendisinin üretmediği videoları da kabul eder ve aynı uzunlukta geri döndürür. Farklı bir felsefe. Düzenleme tek bir anı iyileştirirken; uzatma bir zaman çizelgesini büyütür.

Yapay zeka ile görselden video yapma sürecinde, başladığı yerde biten pürüzsüz bir döngüyü simgeleyen, pastel arka planda dairesel bükülmüş film şeridi

Sıkça Sorulan Sorular

Fotoğrafı ücretsiz olarak videoya dönüştürebilir miyim?

Neredeyse evet. Yeni bir BananaBanana hesabı açtığınızda, kart bilgisi gerekmeden ücretsiz $0.20 bakiye tanımlanır. Bu bakiye, fotoğrafınızdan iki adet sessiz ve 4 saniyelik Veo 3.1 Lite klibi üretmeniz için yeterlidir. Sonrasında ise klip başına $0.10'dan başlayan fiyatlarla ödeme yaparsınız.

Görselden video dönüştürme için en ucuz API seçeneği hangisidir?

BananaBanana üzerinde en ucuz seçenek Veo 3.1 Lite modelidir: 4 saniyelik sessiz 720p bir klip için $0.10, sesli için ise $0.18 ödersiniz. Bu ücret yalnızca başarılı üretimler için alınır; başarısız denemeler için iadeniz otomatik yapılır. Herhangi bir abonelik veya Google Cloud kurulumu da gerekmez.

Üretilen video ses içerebilir mi?

Evet. Veo 3.1 modellerinde isteğe bağlı ses açma seçeneği bulunur (komutunuzda tarif edilen diyaloglar, efektler ve ortam sesleri üretilir). Gemini Omni Flash ise her zaman ses üretir ve bu, saniye başına $0.10 olan fiyatına dahildir.

TikTok veya Reels için dikey bir fotoğrafı canlandırabilir miyim?

Evet, dört modelin tümü 9:16 formatını destekler. Fotoğrafı yükleyin, 9:16 oranını seçin. Kaynak fotoğrafın bu orana göre kırpılacağını unutmayın, bu yüzden orijinal çekimin üst kısmında biraz boşluk bırakmaya dikkat edin.

Fotoğraftan üretilen bir yapay zeka videosu en fazla ne kadar uzunlukta olabilir?

Veo modellerinde tek bir klip 4–8 saniye uzunluğundadır (Omni Flash'te ise sizin seçiminize göre 3–10 saniye). Ancak Veo 3.1 ve Veo 3.1 Fast ile üretilen klipleri, orijinal fotoğrafınızın görsel bütünlüğünü koruyarak 7'şer saniyelik adımlarla toplamda 148 saniyeye kadar uzatabilirsiniz.

tutorialvideoimage-to-video