Bridging the MoCap-to-visual domain gap in human mesh recovery from 2D keypoints
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2023
Tezin Dili: İngilizce
Öğrenci: BEDİRHAN UĞUZ
Danışman: Emre Akbaş
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bu çalışma, 2B anahtar noktalardan insan vücut örgüsünün geri kazanılması problemini çözmeyi hedeflemektedir. Yalnızca hareket yakalama veri kümesi (hareket yakalama alanı) kullanan ve bu verilere karşılık gelen görüntüleri gerektirmeyen bir model geliştirdik. Bu yaklaşım, mevcut geniş hareket yakalama veri kümelerinden yararlanmamıza ve toplanması zor olan eşleştirilmiş görüntü-3B veri kümelerinin eksikliğini aşmamıza olanak tanıyor. Kullanıma hazır 2B anahtar nokta tespit eden bir model kullanarak eğitim sonrası modellerimizi alan değiştirip gerçek görsel verilere (görsel alan) uyguluyoruz. Hareket yakalama alanından görsel alana olan alan bu değişimin etkisini en aza indirmek icin, bir çekişmeli alan uyarlama yöntemi sunduk ve modellerimizi görsel alana uyarladık. Katkılarımız şunlardır: (i) 2B anahtar nokta tespitlerinden 3B insan vücut ağının geri kazanmak için kestirim tabanlı bir yöntem sunuyoruz, (ii) görsel veri etiketine ihtiyaç duymadan hareket yakalama alanı ile görsel alan arasındaki alan farkını kapatıyoruz, (iii) yaygın olarak kullanılan H3.6M ve 3DPW veri kümeleri üzerindeki deneysel sonuçlarımız, yöntemimizin eşleştirilmemiş 3B eğitim koşullarında 2B anahtar noktalardan insan vücut ağının geri kazanılmasında, her iki veri kümesi için de mevcut yöntemleri PA-MPJPE metriğinde geride bıraktığını göstermektedir. Ayrıca yöntemimiz 3DPW'de MPJPE ve PVE metriklerinde de var olan yöntemlere göre daha iyi performans sergilemektedir ve (iv) yöntemimiz tek adımlı olması sebebiyle, en yakın rakibinden (LGD) 33 kata kadar daha hızlıdır.