bi-TEZAT: biLSTM yöntemiyle türkçe şikayet metinlerinde zaman ifadelerinin tespit edilmesi
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Elektrik-Elektronik Fakültesi, Bilgisayar Mühendisliği, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: Türkçe
Öğrenci: ENSAR EMİRALİ
Danışman: Mine Elif Karsligil
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Metinlerde tarih, saat, süre ve tekrar belirten zaman ifadelerinin otomatik olarak tespit eden sistemler geliştirilmesi, Doğal Dil İşleme (NLP) araştırma alanının çalışma konularına girmektedir. Literatür incelendiğinde, ilk geliştirilen sistemlerin zaman ifadelerinin desen analizleri sonucu oluşturulan kural tabanlı sistemler olduğu gözlemlenmektedir. Daha sonrasında metinden ve kelimenin özelliklerinden çıkarılan öznitelikleri kullanarak makine öğrenmesi modelleri yardımıyla zaman ifadelerini tespit eden hibrit sistemler geliştirilmiştir. Araştırma alanındaki gelişim süreciyle birlikte, Yapay Sinir Ağları (ANN) tabanlı sistem geliştirilmesine yönelik çalışmalar son zamanlarda literatürde yer almıştır. Türkçe metinlerde yapılan çalışmalar incelendiğinde, Varlık İsmi Tanıma (NER) kapsamında tarih ve saat ifadelerinin tespit edilmesine yönelik olarak yapıldığı gözlemlenmektedir. Bu kapsamda NER kapsamına giren kişi, lokasyon ve organizasyon ifadeleriyle birlikte tarih ve saat ifadeleri tespit eden kural tabanlı, hibrit ve ANN tabanlı modeller geliştirilmiştir. Zaman ifadelerinin tespit edilmesi konu özelinde ilk çalışma, ifadelerin desenlerinin analiz edilmesidir. Daha sonrasında HeidelTime isimli sistem için Türkçe diline yönelik kural tanımlaması çalışması bulunmaktadır. Bu tezin amacı, İngilizce dilinde NER kapsamında başarılı olan modellerden esinlenerek Türkçe metinlerde zaman ifadelerini tespit edecek ANN tabanlı bir modelin geliştirilmesi ve gerçekleştirilmektir. Öncelikle veri toplama ve etiketleme çalışması yapılmıştır. Bu kapsamda daha sonraki çalışmalarda da faydalı olacağı düşünülerek bir etiketleme dokümanı hazırlanmıştır. Veri kümesinde yer alan metinler, ön işlemlerden geçirildikten sonra tokenize edilmiştir. Modelin girdisi olan kelime, karakter, ortografik karakter, morfolojik analiz sonucu tabanlı kelime vektörleri ile yazınsal öznitelik vektörleri oluşturulmuştur. Kelime vektörleri için daha önceden eğitilmiş vektörler kullanılmıştır, bu vektörler üzerinde ince ayar yapılmamıştır. Kelimelerin yazılışları üzerinden Evrişimli Sinir Ağları (CNN) yardımıyla karakter ve ortografik karakter tabanlı kelime vektörleri oluşturulmuştur. Morfolojik analiz sonuçları üzerinden Çift Yönlü Uzun Kısa Süreli Bellek (biLSTM) yardımıyla kelime vektörleri oluşturulmuştur. Her bir kelimenin 15 yazınsal özniteliği üzerinden vektörler oluşturulmuştur. Ayrıca, Transformatörlerden Çift Yönlü Kodlayıcı Gösterimleri (BERT) modelinden öznitelik çıkarma yöntemiyle kelime vektörleri elde edilmiştir. Tüm bu girdileri kullanarak metinlerdeki zaman ifadelerini tespit eden biLSTM modeli ve etiket sınıflandırıcı olacak CRF katmanı tasarlanarak Türkçe dilinde ilk ANN tabanlı sistem geliştirilmiş ve başarısı değerlendirilmiştir.