Classification of imbalanced credit data sets with borrower-specific cost-sensitive algorithms


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Uygulamalı Matematik Enstitüsü, Finansal Matematik Anabilim Dalı, Türkiye

Tezin Onay Tarihi: 2023

Tezin Dili: İngilizce

Öğrenci: YASEMİN YAMAN KANMAZ

Asıl Danışman (Eş Danışmanlı Tezler İçin): Ayşe Sevtap Kestel

Eş Danışman: Şahap Kasirga Yildirak

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Dengesiz kredi veri setlerinde eşit olmayan sınıf dağılımları farklı maliyetlere yol açan iki tür yanlış tahmin hatası ile sonuçlanmaktadır. Bunlar, yanlış sınıflandırılan batık krediler için parasal kayıp ve yanlış sınıflandırılan kredisini ödeyecekler için kaçırılan fırsat maliyeti olarak faiz geliridir. Bu çalışma, belirtilen sorunları ele alarak kredi veri setlerinde maliyete duyarlı öğrenme ve dengesiz veri sınıflandırması asitmetrilerine yönelik borçluya özgü maliyet/risk parametrelerini çözebilen yeni bir yaklaşım önermektedir. Çalışmanın temel amacı, her kredi başvurucusunun verilerinde saklı olan bilgileri ortaya çıkararak risk seviyesini gösteren bir ağırlık oluşturmak ve kayıp fonksiyonlarını bu ağırlık ile güçlendirmek ve çoğunluk sınıfının baskınlığını kırmaktır. Kredi almak için başvuranların temerrüt olasılıkları, risk seviyeleri hakkında değerli bilgiler sağlar. Bu çalışmayla, sınıfların veri büyüklük oranları yerine temerrüt risk seviyelerine dayalı her bir borçluya özgü maliyet/risk parametreleri önerilmektedir. Kredi ödememe olasılıkları, örneklenmiş alt veri kümeleriyle tahmin edilmekte ve bu aşamadan önce, Simüle Edilerek Kuvvetlendirilmiş (Annealing) stokastik süreciyle örneklenmiş alt veri kümelerinin en uygun sınıf oranı belirlenmektedir. Krediye başvuranların borçlarını ödememe olasılıklarını tahmin etmek için, lojistik regresyonlar ve derin öğrenmeye dayalı Grafik Sinir Ağları ve Grafik Dikkat Ağları gibi doğrusal olmayan karmaşık modeller kullanılmaktadır. Üç adet maliyet/risk parametresi, sınıf bazındaki kayıpları yine sınıf bazında toplam risk seviyelerine dayalı eşitleme hedefiyle oluşturulmaktadır. AdaBoost, XGBoost ve ANN algoritmaları daha sonra bu yeni parametreleri içerecek şekilde değiştirilerek sekiz kredi veri seti üzerinde ampirik analiz gerçekleştirilmiştir. Bu algoritmaların başarısı, özellikle sınıf oranları giderek artan veri kümelerinin kategorizasyonunda daha belirgindir. Karşılaştımalı analizler, yeni maliyet duyarlı algoritmalarla parasal kayıplardaki azalmanın verilmiş Özgüllük değerlerinde % 33.7'ye ulaşabildiğini göstermektedir.