Exploiting cluster-skipping inverted index structure for semantic place retrieval
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: İngilizce
Öğrenci: ENES RECEP ÇINAR
Danışman: İSMAİL SENGÖR ALTINGÖVDE
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Anlamsal mekan getirimi, hem metin hem de konum bilgisini kullanarak bilgi grafları üzerinde arama yapmayı amaçlayan popüler bir araştırma problemidir. Bu tür sorguları ele alırken, kullanıcının bilgi gereksinimini karşılamak için, mekanların alakalılık düzeyini ve mekansal uzaklığını kullanıcının sorgusuna uygun şekilde dengelemek çok önemlidir. Ayrıca, modern kullanıcıların beklentileri göz önüne alındığında, sonuçların kısa sürede sağlanması ise kritiktir, bu da altta çalışan bilgi getirimi sistemlerinde gelişmiş indeks yapılarının kullanılması gerekliliğini beraberinde getirir. Bu çalışmada, anlamsal mekan getiriminin verimliliğini artırmaya yönelik iki yönlü katkımız bulunmaktadır. İlk olarak, bilgi grafında arama derinliğine bazı sezgisel kısıtlamalar uygulayarak, mekansal kelime sorgularını işlemek için önerilen ve coğrafi metin indeksleri olarak adlandırılan birkaç iyi bilinen indeks yapısını elimizdeki problem için kullanmanın mümkün olduğunu gösteriyoruz. İkinci olarak, anlamsal mekan edinimi sorununa özgün bir çözüm olarak, aslında konuya göre kümelenmiş metinler üzerinde bilgi getirme için önerilmiş bir yapı olan küme atlamalı ters çevrilmiş indeks (CS-IIS) fikrini uyarlıyoruz. Uyarlamamızda, işlenmekte olan mekansal bölgelerin metinsel ve mekansal skorlarına dayalı bir erken durdurma tekniği de kullanıyoruz. Kapsamlı deneylerimiz bir çok ilginç bulguya yol açıyor. Literatürdeki bilinen bazı mekansal metin indekslerinin bellek içi işlem süresi açısından yüksek verimlilik sağlarken, çok sayıda doğrudan disk erişimine neden olabileceğini gösteriyoruz. Buna karşılık, CS-IIS'ye dayalı yaklaşımımız, az sayıda doğrudan disk erişimi gerektirir (bu da sorgudaki terimlerin sayısına eşittir) ve bu nedenle, toplam sorgu işleme süresi açısından bahsedilen temel yaklaşımlardan önemli ölçüde daha iyi performans göstermektedir.