Dudak senkronu (lip sync), bir karakterin ağız hareketlerinin duyulan konuşmayla zamansal ve biçimsel olarak eşleşmesidir. Yapay zekâ animasyonunda bu eşleşme iki temel yoldan kurulur: ya ses verilir ve model ağzı sese göre üretir, ya da görüntü önce üretilir ve ses sonradan ağız hareketine hizalanır. İyi bir dudak senkronu fark edilmez; kötüsü ise izleyicinin hikâyeden kopmasına en hızlı yol açan kusurdur.

Temel kavramlar

Fonem ve vizem

Konuşma, fonem denen ses birimlerinden oluşur. Ancak birçok fonem dudakta aynı görünür: "b", "p" ve "m" seslerinin hepsinde dudaklar kapanır. Bu yüzden animasyonda fonemler, vizem adı verilen daha küçük bir görsel ağız biçimleri kümesine indirgenir. Klasik çizgi filmde bir düzine civarında ağız çizimi, bütün bir diyaloğu taşımaya yeter: kapalı dudak, geniş açık "a", yuvarlak "o", dişlerin göründüğü "i" gibi.

Zamanlama

Ağız biçimi doğru olsa bile zamanlama yanlışsa senkron bozuk görünür. İnsan algısı sesin görüntüden biraz geride kalmasına, önde olmasına göre daha hoşgörülüdür; çünkü gerçek hayatta ses ışıktan yavaş gelir. Yine de gecikme belli bir eşiği aşınca izleyici bunu hemen fark eder. Animatörler bu yüzden genellikle ağız biçimini sesin çok az önüne yerleştirir.

Ortak eklemlenme

Konuşmada her ses bir sonrakinden etkilenir. "Su" derken dudaklar "s" sesini çıkarırken bile "u" için yuvarlanmaya başlar. Ağızları tek tek, bağlamdan kopuk çizen sistemler bu yüzden robotik görünür. İyi bir dudak senkronu geçişleri yumuşak tutar.

Yaklaşım 1: sesten ağız üretimi

Bu yöntemde önce ses hazırlanır. Ardından bir model, verilen yüz görüntüsünü ya da videosunu sese göre yeniden çizer; ağız ve çevresi her karede konuşmaya uyacak şekilde değiştirilir. Ses tahrikli (audio-driven) üretim olarak da bilinir.

  • Güçlü yanı: Ağız biçimleri sese çok yakından uyar; özellikle ön cepheden, yakın plan yüzlerde etkileyici sonuç verir.
  • Zayıf yanı: Yüz profilden görünüyorsa, karakter hareket ediyorsa ya da stil gerçekçi değilse (anime, kil, gölge oyunu) model zorlanır. Ağız bölgesi çevresinden farklı bir dokuya bürünebilir; stilize çizimlerde "yapıştırılmış" görünebilir. Ayrıca yeniden çizim ek bir üretim adımı olduğu için maliyet ve süre ekler.

Yaklaşım 2: dublaj hizalaması

Bu yöntemde sıra tersine döner. Video modeli sahneyi üretirken konuşan karakterin ağzını da hareketlendirir. Ardından replik, o karakterin sabit sesiyle seslendirilir ve zaman ekseninde ağız hareketine oturtulur. Film dublajında yapılan işe benzer: görüntü sabittir, ses ona göre ayarlanır.

  • Güçlü yanı: Görüntü, stilin kendi dilinde kalır; ağız sonradan yamanmaz. Her karakter her sahnede aynı sesle konuşur.
  • Zayıf yanı: Ağız hareketleri fonem düzeyinde değil, konuşmanın genel ritmi düzeyinde eşleşir. Yakın planda dikkatli bir göz küçük farkları görebilir.

Kelime düzeyinde hizalama nasıl yapılır

Dublaj hizalamasında temel sorun şudur: seslendirilmiş replik ile ağzın hareket ettiği süre aynı uzunlukta değildir. Bunu çözmek için yaygın bir yol izlenir:

  1. Seslendirilmiş replik bir konuşma tanıma modelinden geçirilir ve her kelimenin başlangıç ve bitiş zamanı çıkarılır.
  2. Videoda ağzın konuşmaya başladığı ve durduğu an belirlenir.
  3. Replik bu aralığa yerleştirilir. Süre farkı varsa bütün replik bir bütün olarak, doğal perdeyi koruyan bir yöntemle hafifçe esnetilir ya da sıkıştırılır.
  4. Kelime zamanlamaları, altyazının kelime kelime görünmesi için de kullanılabilir.

Burada önemli bir tasarım kararı vardır: repliği kelime kelime kesip her kelimeyi ayrı yere yapıştırmak teoride daha hassas görünür, ancak pratikte konuşmanın doğallığını bozar ve kelime sonlarını keser. Bütün repliği tek parça olarak esnetmek, kulağa çok daha insan gibi gelir.

Yeşilçam’da dudak senkronu

Yeşilçam Animation’da video modeliyle çalışan sekiz Cinemation stilinde (Wuxiamation, Celmation, Neonmation, Toymation, Toonmation, Claymation, Postermation ve Panelmation) diyalog, ikinci yaklaşımla işlenir; 2.5D bir animasyon motoruyla çizilen Shadowmation ve Pixelmation’da replikler yine her karakterin sabit sesiyle seslendirilir ve altyazıda konuşanın adı görünür, ama ağız hareketi ve klip incelemesi yoktur. Video modeli konuşan karakterin ağzını hareketlendirir; replik o karakterin sabit sesiyle seslendirilir ve kelime kelime ağız hareketine hizalanır. Kelime zamanlamaları konuşmanın yazıya dökülmesiyle elde edilir; replik kelime kelime kesilmez, bir bütün olarak sığacak şekilde esnetilir, böylece cümle sonları kırpılmaz. Bunun sonucu, bir karakterin her sahnede aynı sesle konuşmasıdır. Neden genel bir dudak senkronu yerine ses tutarlılığını seçtiğimizi bu blog yazısında anlattık; ses seçimi ve iyi uygulamalar için dudak senkronu rehberine bakabilirsiniz.

Sık görülen tuzaklar

  • Uzun replikler. Sahnenin süresine sığmayan bir replik ya aşırı hızlanır ya da kesilir. Replikleri kısa, konuşma diline yakın tutun.
  • Aynı karede birden fazla konuşan. Model hangi ağzın hareket edeceğini karıştırabilir. Her satırda tek bir konuşan olması daha güvenlidir.
  • Karakterin arkası dönük olması. Ağız görünmüyorsa senkronun bir anlamı yoktur; bu tür sahnelerde anlatıcı daha uygun olabilir.
  • Ses değişikliği. Aynı karakterin sahneden sahneye farklı seslerle konuşması, ağız senkronu kusursuz olsa bile karakterin kimliğini zayıflatır.
  • Stil uyuşmazlığı. Gerçekçi bir ağız yamasını çizgi film karakterine uygulamak, izleyiciye tuhaf gelir.

Dudak senkronu kalitesi nasıl değerlendirilir

Dudak senkronunu değerlendirmenin en güvenilir yolu, videoyu sesi açık ve normal hızda izlemektir; kare kare incelemek, izleyicinin gerçekte fark etmeyeceği ayrıntılara takılmaya yol açar. Kontrol edilecek birkaç şey vardır: konuşma başladığında ağız da açılıyor mu, replik bittiğinde ağız kapanıyor mu, dudakların kapandığı sesler ("b", "m", "p") kapalı ağızla mı görünüyor ve konuşmayan karakterin ağzı gereksiz yere hareket ediyor mu. Son madde çok karakterli sahnelerde en sık rastlanan sorundur. Ayrıca aynı karakterin farklı sahnelerdeki repliklerini art arda dinleyerek sesin gerçekten aynı kaldığını doğrulamak iyi bir alışkanlıktır.

Hangi yöntem ne zaman seçilmeli

Gerçekçi, yakın plan, tek kişilik konuşma videolarında (örneğin bir sunucunun kameraya konuştuğu içerik) sesten ağız üretimi genellikle daha iyi sonuç verir. Stilize, çok karakterli, sahne sahne ilerleyen hikâyelerde ise dublaj hizalaması hem görsel bütünlüğü hem de ses kimliğini korur. Çok karakterli diyaloğun nasıl yazıldığı ve seslere nasıl dağıtıldığı çok karakterli diyalog makalesinde ele alınıyor.

Sık sorulan sorular

Vizem nedir? Konuşmanın görsel karşılığı olan ağız biçimidir. Birçok ses dudakta aynı göründüğü için onlarca fonem, bir düzine civarında vizemle temsil edilebilir.

Dudak senkronu hangi animasyon stillerinde işe yarar? Konuşan karakteri yüzü görünecek şekilde gösteren her stilde işe yarar. Yazının içerik olduğu kinetik tipografi ya da diyaloğu olmayan etkileşimli kitaplar gibi biçimlerde gerekmez.

Replik neden kelime kelime kesilmez? Kelimeleri ayrı ayrı kaydırmak konuşmanın akışını bozar ve kelime sonlarını kırpabilir. Repliğin bir bütün olarak esnetilmesi daha doğal bir sonuç verir.

Aynı karakter her sahnede aynı sesle konuşur mu? Ses tutarlılığını esas alan bir hatta evet; her karaktere sabit bir ses atanır ve bütün replikleri o sesle seslendirilir.