ÜRETKEN ÇEKİŞMELİ AĞ MODELLERİ KULLANARAK TABLO VERİSİNDE AZINLIK SINIF ARTIRIMI


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, İSTATİSTİK ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2023

Tezin Dili: İngilizce

Öğrenci: ESRANUR POLAT

Danışman: Fulya Gökalp Yavuz

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Hızla gelişen teknoloji ortamında, ilerleyen teknoloji ile verilerin katlanarak büyümesi arasındaki etkileşim, yapay zekanın ortaya çıkmasında bir tetikleyici olmuştur. Bu veriye dayalı geri bildirim döngüleri, sürekli özelleştirmeye olanak tanıyarak yapay zekanın gelişmesini sağlamış ve yeni bir teknolojik sıçramayı temsil etmiştir. Bununla birlikte, yapay zeka alanında birçok zorluk da ortaya çıkmaktadır. Etkili eğitim, büyük ve çeşitli veri kümeleri gerektiren önemli miktarda veri gerektirdiğinden, bu zorluklardan ilki, yapay zeka modelini beslemek için gereken verilerin kalitesi ve miktarıdır. Diğer bir konu da yapay zeka sistemlerinin sağlık, finans, havacılık ve savunma gibi alanlardaki gizli bilgileri içselleştirmesi nedeniyle veri gizliliği endişelerinin ortaya çıkmasıdır. Veri kümelerinde dengesiz sınıflara sahip olmak, özellikle sınıflandırma algoritmalarının adaletini ve doğruluğunu etkilediği için başka bir zorluktur. Bu zorlukların üstesinden gelmek için veri bilimi ve yapay zeka uzmanları, verileri sentezlemek ve/veya artırmak için çeşitli yöntemler geliştirmektedir. Bu çalışmalarda önemli rol oynayan Üretken Çekişmeli Ağlar ile farklı veri türlerinin üretilmesinde büyük bir başarı sağlanmıştır. Bu tez tablo verilerindeki azınlık sınıfını artırmaya odaklanmaktadır. Farklı hacimlere sahip çeşitli açık kaynaklı dengesiz sınıf veri kümelerini kullanan çalışma, azınlık sınıfını artırmak için çeşitli GAN modellerinden yararlanır. Orijinal ve artırılmış veri kümeleri daha sonra istatistiksel görselleştirmeler ve makine öğrenimi modeli performansları kullanılarak karşılaştırılır. Sonuç olarak bu araştırma, GAN'ların yapay zekadaki verilerle ilgili zorlukları ele almadaki önemli rolünü vurgulamakta ve gelişmiş model performansı için dengesiz veri kümelerini yeniden dengelemedeki etkinliğini göstermektedir.