The reusability prior in deep learning models


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Mühendislik Fakültesi, Bilgisayar Mühendisliği Bölümü, Türkiye

Tezin Onay Tarihi: 2023

Tezin Dili: İngilizce

Öğrenci: AYDIN GÖZE POLAT

Danışman: Ferda Nur Alpaslan

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Çeşitli seçimler, derin öğrenme (DÖ) modellerinin performansını etkileyebilir. Örneğin, katmanlar arası parametre paylaşımı, evrişimli katmanlarö ve atlama bağlantıları yoluyla bir modelde elde edilen tekrarlamalar, DÖ modellerindeki bileşenlerin yeniden kullanılabilirliğini etkileyerek parametre verimliliğini etkiler. Bu çalışmada, bu tür tekrarlamalar açısından farklı tasarım seçimlerinin model performansını nasıl etkilediğini araştırmak için üç farklı çözüm önerildi. İlk olarak, bir DÖ modelleri popülasyonunu eğitirken yeniden kullanılabilir modülleri veya model bileşenlerini analiz etmek için yeni bir kitaplık olan Revolver önerildi. Deneyler sırasında modeller arasında modüllerin yeniden kullanılması, tüm model popülasyonunun tek bir GPU üzerinde eğitilmesini ve en yüksek puanı alan paylaşılan modüller hakkında istatistiklerin toplanabilmesini sağladı. İkincisi, yeniden kullanılabilirlik önseli şu şekilde önerildi: model bileşenleri, yalnızca eğitim koşulları ve düzenlileştirme seçenekleri nedeniyle değil, aynı zamanda model tasarımı nedeniyle de farklı bağlamlarda çalışmaya zorlanır. Bu önsele dayanarak, öğrenilebilir her parametre için bağlam sayısını ölçebilen saymaya dayalı bir grafik analizi önerildi. Deneylerde, bu yöntem, herhangi bir eğitime dayanmadan, ilk-1 doğruluk açısından analiz edilen birçok modelin sıralamasına ilişkin performansı doğru bir şekilde tahmin edebildi. Son olarak, istatistiksel mekanikten ilham alan genelleştirilmiş bir yaklaşım önerildi; burada bağlama dayalı sayma yönteminin, T=-1 mutlak sıcaklığına sahip modelleri tanımladığı anlaşıldı. Genelleştirilmiş yaklaşım, kısıtlamaları ve varsayımları parametre düzeyinde enerji şeklinde kodlayarak önerilen sayma yönteminin ötesine geçmeye izin verdi. Sonuç olarak, önerilen bu çözümler, model analizi ve karşılaştırması üzerine araştırmalara veya nöral mimari araştırması için pratik uygulamalara imkan sağlayabilir.