Context- and sentiment-aware machine learning models for sentiment analysis


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2023

Tezin Dili: İngilizce

Öğrenci: FİRDEVSİ AYÇA DENİZ KIZILÖZ

Asıl Danışman (Eş Danışmanlı Tezler İçin): Pelin Angin

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bilişim teknolojilerindeki gelişmelerle birlikte insanların görüşlerini ifade ettikleri web kaynaklarındaki mevcut veri miktarı sürekli olarak artmaktadır. Duygu analizi, karar merciilerin büyük veri yığınlarından içgörüler elde etmelerini destekler. Kamuoyunun takip edilmesi de dahil olmak üzere çok çeşitli alanlarda pratik bir araç olduğunu kanıtladığı için son zamanlarda çok ilgi görmüştür. Buna rağmen, duygu analizi araştırması hala bazı zorluklarla karşı karşıyadır. Ana zorluklardan biri, verilerdeki ilgisiz ve gereksiz özelliklerdir. Bu tür özellikler, yalnızca arama alanını büyük ölçüde artırmakla kalmaz, aynı zamanda modelin bağlam farkındalığını da bozar. Diğer bir temel zorluk, duygu analizi görevleri için etki alanından bağımsız modellerin bulunmamasıdır, çünkü mevcut bir model bağlam açısından başka bir alan için uygun olmayabilir. Derin öğrenme modelleri yüksek performanslı sonuçlar sağlasa da çok büyük miktarda etiketlenmiş veri gerektirirler. Bununla birlikte, yeterli miktarda etiketlenmiş veri elde etmek genellikle kolay bir süreç değildir. Bu tezde, yukarıda belirtilen dezavantajları gidermek için dört model öneriyoruz. İlk modelimiz, duygu analizi için verilerdeki en bilgilendirici özellikleri çıkarır. İkincisi, bağlamla rafine edilmiş bir kelime gömme modeli oluşturur. Üçüncü model, etiketlenmiş verilere ihtiyaç duymadan önceden eğitilmiş modellerdeki bilgiyi yeni bir alana aktarır. Sonuncusu, duygu analizi için çeşitli özelliklerden oluşan bir havuz oluşturan bir özellik topluluğu modelidir. Modellerimizin etkinliğini doğrulamak için üç adet tanınmış veri seti üzerinde kapsamlı deneyler yaptık. Ayrıca, binlerce cümle ve duygu sınıfı çiftinden oluşan iki yeni veri seti oluşturduk. Deney sonuçları, önerilen modellerin performans iyileştirmeleri sağladığını göstermiştir.