Variable selection and classification for longitudinal binary data through three-step sparse boosting
Tezin Türü: Doktora
Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, İSTATİSTİK ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: İngilizce
Öğrenci: DENİZ ESİN EMER
Danışman: ÖZLEM İLK DAĞ
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Teknolojinin hızlı gelişimi ile tek bir deneyde binlerce genin gen ifade düzeylerini elde etmek artık mümkün. Bu deneylerde, numune boyutunun nispeten küçük olmasının yanında incelenen değişkenlerin sayısı son derece fazladır, buna karşın yalnızca az sayıda gen ifadesi, ilgilenilen sonuçla ilgili olabilmektedir. Bu nedenle, model tahmini ile birlikte neden ilişkisi olan değişkenlerin seçimine ihtiyaç artmıştır. Bu tezde biz, bireylerin ikili sınıflandırılması amacıyla, en önemli değişkenleri tespit etmek için sağlam ve aynı zamanda uzamsal ve zamansal korelasyonu göz önünde bulunduran, üç aşamalı seyrek bir yükseltme modeli öneriyoruz. Yue, Li and Cheng (2019) makalesindeki fikri takiben, ilk aşamada, gözlemlerin bağımsız olduğu varsayılır ve yükseltme metodu kullanılarak, ikili çapraz entropi kaybının doğrudan en aza indirilmesiyle lojistik regresyonun katsayılarının tahmini elde edilir. Daha sonra, ikinci aşamada, birinci aşamada yapılan hatalara dayalı olarak oluşturulan bir ağırlık matrisi yürütülerek zamansal korelasyon dikkate alınır. Son olarak üçüncü aşamada, korelasyon yapısı dikkate alınarak bir ağırlık matrisi aracılığıyla uzamsal korelasyon eklenir. Bir Monte Carlo Simülasyon Çalışması tasarlanmış ve paralel hesaplama yöntemleri kullanılarak dokuz farklı zamansal ve uzamsal korelasyon yapısı senaryosu çalıştırılmıştır. Önerilen model, anlamlı olan bütün değişkenleri doğru bir şekilde anlamlı olarak belirlerken, yanlışlıkla anlamlı olarak belirlenen değişkenlerin sayısını azaltmıştır. Sınıflandırma performansı ise uzamsal ve zamansal korelasyon yükseldikçe yükselmektedir. Ayrıca, Boruta (RF), Ridge Regresyon, Lasso Regresyon ve Elastic Net algoritmalarını içeren bir karşılaştırma çalışması yapılmış ve şu sonuçlar elde edilmiştir, i) diğer algoritmalar çok sayıda yanlışlıkla anlamlı olarak seçilmiş değişkenleri dikkate alırken, önerilen algoritma, sadece gerçek anlamlı değişkenleri tanımlamanın yanında, en fazla bir değişkeni yanlışlıkla anlamlı olarak seçmiştir , ii) Üç Aşamalı Seyrek Yükseltme algoritması, simülasyon çalışmasında özgüllük ve kesinlik metrikleri açısından en iyi performansı göstermiştir. Ayrıca algoritma, Tip 1 Diyabet Tahmin ve Önleme (DIPP) çalışmasının gerçek yaşam veri seti üzerinde hem dengeli hem de dengesiz kümeler kullanılarak uygulanmıştır. Algoritma, birkaç önemli geni anlamlı olarak tanımlamıştır, bu sayıda genin tanımlanması da zaman ve para açısından faydalı olabilecektir. Karşılaştırma sonuçları, Üç Aşamalı Seyrek Yükseltme algoritması değişken seçimi, parametre kestirimi ve sınıflandırma açısından iyi performans gösterdiğinin kabul edilebileceğini göstermiştir.