A COMPARATIVE STUDY ON DEEP LEARNING-BASED HANDWRITTEN TEXT RECOGNITION TECHNIQUES USING A BRAND-NEW TURKISH HANDWRITING DATASET


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2025

Tezin Dili: İngilizce

Öğrenci: OSMAN FURKAN KARAKUŞ

Danışman: Ali Can Karaca

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

El Yazısı Tanıma (HTR), belge analizinin önemli bir alanıdır ve tarihi belgelerin korunmasından yardımcı teknolojilerin geliştirilmesine kadar geniş bir uygulama yelpazesine sahiptir. Yaygın olarak kullanılan dillerde HTR konusunda önemli ilerlemeler kaydedilmiş olmasına rağmen, Türkçe gibi diller büyük ölçüde yeterli veri kümelerinin eksikliği ve dolayısıyla el yazısı problemlerinin özel çözümlerinin geliştirilememesi nedeniyle geri planda kalmıştır. Bu tez, Türkçe el yazılarının oluşturduğu özel zorlukları ele almak amacıyla yeni bir veri kümesi oluşturmayı ve en ileri seviye modelleri Türkçe el yazısının kendine özgü karakteristiğine uygun şekilde dönüştürmeyi hedeflemektedir. Tez, öncelikle Türkçe el yazısı belgelerinin ayrıntılı ve kamuya açık bir derlemesini oluşturarak başlamaktadır ve bu belgeleri titizlikle satır satır ek açıklamalarla zenginleştirilmiştir. 1.610 form, 6.941 satır ve 60.491 kelime içeren bu veri kümesi, HTR sistemlerinin kolayca eğitilmesi ve test edilmesi için tasarlanmıştır. Veri kümesinin hazırlanması; toplama, ön işleme, ek açıklama ekleme ve ardından veri artırma süreçlerini içermektedir. Bu süreçler, gerçek hayattaki çeşitliliği yansıtan yüksek kalitede ve geniş çeşitliliğe sahip örnekler üretmeyi amaçlamaktadır. Satır bölütleme için, Görü Dönüştürücüleri (ViTs) kullanılarak mevcut yöntemleri geride bırakan yeni bir üst düzey yaklaşım önerilmektedir. Genetik Algoritma, A* Yol Planlama ve BN-DRISHTI gibi geleneksel yaklaşımlardan daha iyi performans gösteren bu model, \%92,5'lik Birleşim Üzerinden Kesişim (IoU) skoru, \%85,01'lik algılama doğruluğu ve \%87,20'lik karakter doğruluğu ile karmaşık düzenlere ve el yazısı çeşitliliğine etkili bir şekilde uyum sağlamaktadır. Metin tanıma aşamasında ise, Dikey Dikkat Ağı (VAN) yapısına bir dönüştürücü katmanı eklenerek güçlendirilmiş ve bu sayede uzun vadeli bağımlılıkları ve bağlamsal ilişkileri daha iyi entegre eden bir model geliştirilmiştir. \%19,13'lük karakter hata oranı (CER) ve \%5,57'lik kelime hata oranı (WER) ile modelimiz, TrOCR, HTR-VT ve SimpleHTR gibi temel mimarileri geride bırakarak uzun vadeli bağımlılıkları ve bağlamsal ilişkileri başarıyla işleyebilen yüksek doğruluklu bir sistem sunmaktadır. Bu araştırmanın sonuçları, Görü Dönüştürücüler gibi modern mimarilerin ve hibrit LSTM-Dönüştürücü modellerinin el yazısı tanımada karşılaşılan zorlukları ele alma potansiyelini vurgulamaktadır. Güvenilir bir veri kümesi ve bu veri kümesi için yenilikçi çözümlerin sunulduğu bu tez çalışması, düşük kaynaklı diller için HTR alanına önemli bir katkıda bulunmakta ve gelecekteki araştırmalar ile pratik uygulamalar için bir temel oluşturmaktadır.