Overcoming Hard Exploration Problem in Markov Decision Process using Inverse Reinforcement Learning and Human Demonstrations


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2022

Tezin Dili: İngilizce

Öğrenci: WADHAH ZEYAD TAREQ TAREQ

Danışman: Mehmet Fatih Amasyalı

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu çalışmada, Derin Pekiştirmeli Öğrenme (Deep Reinforcement Learning, DRL) algoritmalarının zorlu keşif ortamlarında dışsal bir ödül sistemi kullanılarak performanslarının iyileştirilmesi önerilmiştir. Bunun için öncelikle insan gösterimleri dışsal bir ödül olarak kullanılmıştır. Algoritmanın insan performansını taklit etmesi ve dışsal ödüllerden yararlanması için insan gösterimlerini içeren bir eğitim aşamasını (Ön eğitim aşaması) tamamlaması gerekmektedir. Bunun ardından, algoritmanın daha iyi performans elde etmesi için ek bir eğitim aşamasında da (Etkileşim aşaması) Ters Pekiştirmeli Öğrenme (Inverse Reinforcement Learning, IRL) ilkeleri kullanılarak bir ödül fonksiyonu kurulmuştur. Bu tez, Ön eğitim aşaması için, dışsal ödüller kullanarak basit ve etkili bir Derin Pekiştirmeli Öğrenme algoritması eğitmeyi önermektedir. İnsan gösterimleri içeren eğitim kümesini oluştururken insan tarafından yapılan eylemler doğru diğer tüm olası eylemler yanlış olarak etiketlenmiştir. Bu veri kümesini eğitmek için Öncelikli Çift Derin Q-Ağları (Prioritized Double Deep Q-Networks, PDDQN) algoritması seçilmiştir. Eğitilen bu modelin zorlu keşif ortamlarında doğru eylemi tahmin etmesi mümkün hale gelmiştir. Buna ek olarak, algoritmanın performansını artırmak için önemli görülen örneklerin seçilme oranı optimize edilmiştir. Sonuç olarak, PDDQN algoritması zorlu keşif ortamlarında tüm temel algoritmalardan daha iyi performans göstermiştir. Bu tez, Etkileşim aşaması için, Ters Pekiştirmeli Öğrenme ilkelerini kullanan bir ödül fonksiyonu önermektedir. İnsan gösterimlerindeki dışsal ödüllerle ortam ödülleri arasındaki farkın etkileşim aşamasında algoritmanın verimliliğinde bir azalmaya yol açtığı belirlenmiştir. Bu sorunu çözmek için son yıllarda geliştirilen yaygın tekniklerden biri olan Ters Pekiştirmeli Öğrenme ile ödüller kullanarak insan/uzman davranışlarını tahmin eden bir ödül fonksiyonu oluşturulmuştur. Ödül fonksiyonu birinci aşama insan gösterimlerinden çıkarılan veriler kümesiyle eğitilmekte ve daha sonra tahmin ettiği ödüller gerçek ortam ödülleriyle birlikte kullanılabilmektedir. Bu özelliği sayesinde yapılan deneylerde, daha iyi performans sağladığı görülmüştür.