Video classification and retrieval with low data regime learning


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Elektrik-Elektronik Fakültesi, Bilgisayar Mühendisliği, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: İngilizce

Öğrenci: EROL ÇITAK

Danışman: Mine Elif Karsligil

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Video sınıflandırma, bir videonun içeri˘gini analiz ederek onu bir veya daha fazla önceden tanımlanmı¸s kategoriye atamayı gerektiren, bilgisayarlı görü alanında zorlu bir görevdir. Ancak, videolarda bulunan büyük miktardaki görsel veri nedeniyle, sınıflandırma süreci genellikle hesaplama açısından pahalıdır ve önemli miktarda etiketli veri gerektirir. Bu nedenlerden dolayı, az veri ile video sınıflandırma alanı, az örnekle ö˘grenme (few-shot learning) ve sıfır örnekle ö˘grenme (zero-shot learning) görevlerinden olu¸san, geleneksel video sınıflandırma ile ilgili zorlukları a¸smak için potansiyel bir çözüm olarak önerilmektedir. Az veri ile yapılan çalı¸smalar potansiyel çözümler olarak görülse de, mevcut veri setleri, ya çe¸sitli de˘gil ya da sıfır örnekle ö˘grenme için zorunlu olan yardımcı modalliklere sahip de˘gildir. Bu nedenle az örnekle ve sıfır örnekle ö˘grenme görevlerinin gereksinimlerini tam olarak kar¸sılamamaktadır. Bu bo¸slu˘gu gidermek için, bu çalı¸smada, çok modaliteli az veri ile video sınıflandırma problemi için büyük ölçekli, genel amaçlı bir veri kümesi öneriyoruz. veri kümesi, video içeri˘ginin birden çok yönünü yakalayan video ve öznitelik çiftlerini içermektedir. Böylece, yeni önerilen veri kümesi, az veri ile video sınıflandırma görevlerinin incelenmesini sa˘glarken, bu alandaki gelecekteki çalı¸smaların de˘gerlendirmelerinin kar¸sıla¸stırılmasında tutarlılık sa˘glayacaktır. Ayrıca, yeni önerilen veri kümesimizde gelecekteki çalı¸smaları de˘gerlendirmek ve bir temel olu¸sturmak için, farklı modallikler arasındaki içsel korelasyonu kullanarak daha bilgilendirici temsiller ö˘grenen varyasyonel otokodlayıcı tabanlı bir model sunuyoruz. Bunun yanı sıra, temel modelimizin az veri senaryolarında genelleme performansını artırmak için bir düzenleme tekni˘gi öneriyoruz. Deneysel sonuçlarımız, bu düzenleme tekni˘ginin yardımıyla, önerilen temel modelimizin, yalnızca tek bir etiketli örnekle temel modele kıyasla sınıflandırma do˘grulu˘gunda %12'den fazla bir iyile¸sme sa˘gladı˘gını ortaya koymaktadır. veri kümesimiz ve önerilen temel modelimiz, bu alanda ilk adım olarak gelecekteki çalı¸smalarda kullanılabilir. Sonuç olarak, gözetim, video özetleme ve içerik tabanlı video arama gibi geni¸s bir yelpazedeki video tabanlı uygulamalar bu vizyondan faydalanabilir.