Reward shaping for efficient exploration and acceleration of learning in reinforcement learning
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Orta Doğu Teknik Üniversitesi, Fen Bilimleri Enstitüsü, Yöneylem Araştırması Anabilim Dalı, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: İngilizce
Öğrenci: MELİS İLAYDA BAL
Eş Danışman: FARUK POLAT
Danışman: CEM İYİGÜN
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bir Pekiştirmeli Öğrenme görevinde, öğrenen etmenin, görevi başarıyla tamamlamak için etkileşim süreci sırasında belirsiz çevresi hakkında yararlı bilgileri verimli bir şekilde çıkarması gerekir. Etmen, stratejik keşif sayesinde çevresi hakkında yeterli bilgiyi elde eder ve bu bilgiyi çevresi ile iletişime girerken akıllıca hareket etmek için davranışlarını ayarlamada kullanır. Bu nedenle, verimli keşif, Pekiştirmeli Öğrenme görevlerinin öğrenme verimliliğinde kilit bir rol oynar. Seyrek ödül yapısına sahip Pekiştirmeli Öğrenme ortamlarının gecikmeli geri bildirim doğasına sahip olması nedeniyle öğrenme için gereken zaman, öğrenme verimsizliğinin ana nedeni haline gelir. Bu sorun, özellikle büyük durum ve eylem uzaylarına sahip karmaşık görevlerde daha da şiddetlenir. Görevi ayrıştırmanın veya etmene sık geri bildirim sağlamak için ödül yapısını değiştirmenin öğrenmeyi hızlandırdığı gösterilmiştir. Bu tez, yukarıda bahsedilen sorunları ele almak için ödül şekillendirme mekanizmasına sahip iki yöntem önermektedir. Verimli keşif problemini ele almak için, tablosal Pekiştirmeli Öğrenme gösterimi kapsamında niteliklilik izlerini kullanan popülasyona dayalı itici ödül şekillendirme mekanizması adlı bir yapı önerilmiştir. Deney sonuçları, önerilen yapı kullanıldığında öğrenme ve durum uzayı keşfindeki iyileşmelerle birlikte verimli keşif elde edildiğini göstermiştir. Ayrıca, bu tez, öğrenmeyi hızlandırmak için bölümlenmiş Q-Cut algoritmasının genişletilmiş versiyonu ile durum-uzayı segmentasyonu kullanarak potansiyele dayalı ödül şekillendirme adlı bir yaklaşım önermektedir. Seyrek ödül yapısına sahip problemlerdeki deneysel sonuçları, önerilen yöntemin, hesaplama zamanından ödün vermeden etmenin öğrenmesini hızlandırdığını göstermiştir.