Imbalanced learning techniques: Experiments on NCAA college basketball league player statistics dataset
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, İSTATİSTİK ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: İngilizce
Öğrenci: EMİR GÜLER
Danışman: BARIŞ SÜRÜCÜ
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bu çalışma, "Dengesiz sınıflandırma için en güncel yöntemler nelerdir ve bu yöntemlerin hangi kombinasyonları aşırı dengesiz gerçek dünya verilerinde en iyi sonuçları verir?" sorusuna cevap bulmak amacıyla yapılmıştır. Amacı gerçekleştirmek için içsel (algoritma tabanlı) ve dışsal (örnekleme tabanlı) dengesiz öğrenme teknikleri ayrı ayrı ve birlikte uygulanmıştır. Dengesiz sınıflandırma görevi için kullanılan veri seti, National Collegiate Athletic Association (NCAA) Erkekler Basketbol Ligi Oyuncu İstatistikleri Verileridir. Oyuncuların draft durumu (oyuncunun herhangi bir NBA takımı tarafından draft edilip edilmediği) ikili sınıflandırma için hedef değişken olarak kullanılmıştır. Azınlık sınıf : Çoğunluk sınıf oranı 3.39 : 96.61'dir. Model performansı değerlendirme ölçütü olarak F1 skoru kullanılmıştır. Deneylerde, örnekleme tekniklerinin varsayılan hiperparametrelerinin aşırı dengesizlik durumunda iyi çalışmadığı bulunmuştur. Optimum azınlık/çoğunluk oranı hiperparametreleri 0.07 ile 0.11 arasında değişmiştir, bu da azınlık ve çoğunluk sınıfı frekanslarının eşitlendiği ve oran hiperparametresini 1'e eşit yapan genel tavsiyeden ve uygulamadan farklı olduğu saptanmıştır. Öte yandan, Maliyet duyarlı (cost-sensitive) yöntemler örnekleme yöntemleriyle birleştirilmiş ve maliyete duyarlı öğrenme modelinin optimal olarak çalışan sınıf ağırlığı hiperparametreleri, "sınıf oranı 1:9 ise, maliyete duyarlı ağırlık hiperparametresi orijinal sınıf oranının tersi olmalıdır." genel tavsiyesinden farklı olarak {class0: 1, class1: 1}, {class0: 2, class1: 1} veya {class0: 3, class1: 2} olarak bulunmuştur. Son olarak, F1 skorunu en üst düzeye çıkarmak için olasılık eşiğini değiştirme yöntemi uygulanmıştır. Bu şekilde, çalışmada dengesiz öğrenmedeki 3 farklı yöntemi birleştirilmiş ve güncel yöntemlerin tek başına kullanımına kıyasla daha iyi sonuçlar elde edilmiştir. Bunlara ek olarak, gerçek dünya veri seti ile elde edilen sonuçları güçlendirmek ve genellemek adına Monte Carlo simülasyonu uygulanmıştır.