A memetic algorithm for clustering with cluster based feature selection


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, Yöneylem Araştırması Anabilim Dalı, Türkiye

Tezin Onay Tarihi: 2022

Tezin Dili: İngilizce

Öğrenci: İLYAS ALPER ŞENER

Danışman: CEM İYİGÜN

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Kümeleme metodu benzer veri noktalarını aynı gruba, birbirine benzemeyen veri noktalarını ise ayrı gruplara yerleştirmeyi hedefleyen yaygın kullanılan bir güdümsüz öğrenme metodudur. Kümeleme metoduna bağlı olan veri noktaları çoğunlukla yüksek boyutlu verilerden oluşmaktadır ve bu veriler ayırt edici ve alakasız öznitelikler içermektedir. Bu nedenle, başarılı bir kümeleme yapabilmek adına ayırt edici özniteliklerin seçilmesi de önemli bir problem arz etmektedir. Bu çalışmada ayırt edici özelliklerin her bir küme için değişken olabileceği ve her bir küme gruplara ayrılırken farklı öznitelikleri kullanacağı öngörülmüştür. Dolayısıyla odaklamılan problem küme özgü öznitelik seçimi ile kümeleme problemi olarak adlandırılmıştır. Problemde kümelemerin bir merkez etrafında oluştuğu yaklaşımıyla, ayırt edici özniteliklerin seçilmesi, küme merkezlerinin belilenmesi ve veri noktalarının kümelere atanması görevleri bir arada değerlendirilmektedir. Bu problem kombinatoryal NP-hard bir problemdir ve matematiksel modeller büyük ölçekli problemleri çözmekte yetersiz kalmaktadır. Ayrıca, literatürde geliştirilmiş olan sezgisel metodlar yüksek değişkenliğe sahip sonuçlar elde etmektedir. Bu nedenle, problemin çözülmesi adına probleme odaklı geliştirilen bir metasezgisel yöntem izlenmiştir. Yüksek sayıda veri noktasına sahip veri setlerini kümelemek adına genetik algoritma ve komşuluk arama metodlarını içeren bir memetik algoritma önerilmiştir. Ayrıca, yüksek boyutlu veri setleri üzerinde başarılı sonuçlar elde etmek adına güncellenmiş bir memetik algoritma yaklaşımı geliştirilmiştir. Önerilen algoritmalar farklı problem büyüklüklerine ve boyutlarına sahip olan farklı veri örnekleri üzerinde test edilmiştir. Bu testler hem gerçek hem de yapay olarak oluşturulmuş veri setleri üzerinde uygulanmıştır. Yapılan testler sonucunda geliştirilen algoritmaların mevcut çalışmalardan üstün performans gösterdiği, ayrıca yüksek başarı ve düşük verimliliğe sahip sonuçlara ulaştığı gözlenmiştir.