Scene-preserving person appearance transfer


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2021

Tezin Dili: İngilizce

Öğrenci: FAHRİYE ÖZGE ÜNEL

Danışman: Ramazan Gökberk Cinbiş

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Derin öğrenme ve derin üretken modellerdeki son gelişmeler, görüntü ve video düzenleme alanında çok sayıda yeni uygulamayı mümkün kılmıştır. Kişinin poz ve görünüşünün görüntüler arasında düzenlenmesi bu tür konulardan bir tanesidir. Son zamanlarda yapılan birkaç çalışma, aynı sahnede tek bir kişinin pozunu dönüştürmek için yöntemler ortaya koymuştur. Ayrıca görünüşü, sahneyi ve pozu ayrı temsiller üzerinden modellemeyi ve bu temsiller üzerinden keyfi görünümler, arka planlar veya pozlarla yeni imajlar üretmeyi amaçlayan çalışmalar vardır. Benzer şekilde, bazı çalışmalar, bir kişinin videosunu kullanarak kişiyi rastgele pozlarda oluşturmayı öğrenmek için belirli bir kişinin görünümünü modellemektedir. Bu tezde, bir görüntüdeki kişiyi hem muhtemelen farklı pozlar hem de farklı arka planlara sahip tek bir görüntüden başka bir kişiyle değiştirebilecek üretken bir model öğrenmeyi hedefleyerek bu sorunların kapsamlı bir versiyonunu ele alıyoruz. Daha spesifik olarak, rastgele bir poza sahip bir aktörün tek bir görüntüsünü ve poz ve sahne bilgilerini sağlayan dublörün görüntüsünü kullanarak aktörün kendi görünümünde, dublörün pozunda ve arka planında görünüşünü içeren yeni bir görüntüsünü oluşturan üretken bir model öğrenmeyi hedefliyoruz. Dublör pozundaki aktörün görünümünün düzgün bir şekilde yeniden oluşturulmasını ve poz ve fiziksel özellik farklılıklarından kaynaklanan eksik arka plan ve ön plan piksel bilgilerinin sentezlenmesini gerektiren gerçekçi bir son görüntü elde etmeyi hedefliyoruz. Bu amaçla, maskelenmiş rekonstrüksiyon kaybı aracılığıyla piksel bazlı ön plan ve arka plan ayrıntılarının tahmin kalitesini maksimize etmek ve rakip eğitimli bir ayırt edici ağ aracılığıyla üretilen görüntünün gerçekliğini en üst düzeye çıkarmak için eğitilmiş uçtan uca bir çerçeve öneriyoruz. Ayrıca, video segmentasyon veri seti olan YouTube VOS ve Davis'i önerilen görev için uyarlayarak yeni bir karşılaştırma ölçütü sunuyoruz. Yaklaşımımızı önerilen kıyaslama veri setlerinede deneysel olarak inceliyor ve değerlendiriyoruz.