A similarity based oversampling method for multi-label imbalanced text data
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Mühendislik Fakültesi, Endüstri Mühendisliği Bölümü, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: İngilizce
Öğrenci: İSMAİL HAKKI KARAMAN
Asıl Danışman (Eş Danışmanlı Tezler İçin): Gülser Köksal
Eş Danışman: Levent Erişkin
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Dünyamızda veri miktarı artmasına rağmen veri etiketlemenin maliyeti ve zorluğu nedeniyle etiketlenmiş veri bulmak kolay değildir. Ayrıca makine öğrenmesi projelerinde, özellikle çok etiketli sınıflandırma problemlerinde, veri dengesizliği nedeniyle başarım sorunlarıyla karşılaşılmaktadır. Çok etiketli sınıflandırma problemlerinde bazı sınıflar için bir sınıflandırıcı eğitmek için bile yeterli veri olmayabilir. Bu çalışmada çok etiketli sınıflandırma problemlerindeki başarım problemlerini çözmek için bir aşkın örnekleme yöntemi geliştirilmiştir. Önerilen yöntem etiketsiz veri kümesinden benzerlik yardımıyla yeni örnekler bulur ve bu örnekler, başarımı iyileştirmesi halinde etiketli sınıfa dahil edilir. Etiketsiz küme tekrarlı olarak taranır ve başarımı iyileştiren örnekler etiketli kümeye eklenerek bu sınıf genişletilir. Yapılan denemelerde algoritma başarımının iyileştiği gözlemlenmiştir. Önerilen yöntem ile insan çabası gerekmeden veri etiketlemenin mümkün olacağı düşünülmektedir.