Makine öğrenmesi yöntemleriyle demografik veriler üzerinden yabancı dil seviyesi tahmini


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Makine Fakültesi, Endüstri Müh.Bölümü, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: Türkçe

Öğrenci: GONCA GÜL DUMAN ORAL

Danışman: Selin Soner Kara

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu çalışmada Türkiye İstatistik Kurumu'ndan alınan Yetişkin Eğitimi Araştırması Mikro Veri Seti kullanılmıştır. Çalışmanın amacı bireylerin demografik verilerinin, yabancı dil bilgisinin tahmininde kullanılabileceğini paylaşmaktır. Çalışmaya literatür araştırması ile başlanmıştır. Ardından, veri setindeki tekil değişkenler ile hedef değişken olan yabancı dil seviyesi arasındaki ilişkiler incelenmiştir. Yer yer bağlantılar kurulabilmiş olsa da, çoğunlukla tekil incelemelerin yetersizliği öne çıkmıştır. Bu nedenle, bireylerin tüm bilgilerini sürece dahil edebilmek için makine öğrenmesi modellerinin kullanımına ihtiyaç doğmuştur. Öncelikle, veri seti makine öğrenmesi modellerinde kullanılabilir hale getirilmiştir. Varolan boş hücreler verisetinden kaldırılmıştır. Veride tahminlenecek sınıflar arasında dengesizlik tespit edilmiş olup, literatürde de sıkça kullanılan sentetik veri üretme yöntemi izlenerek bu dengesizlik giderilmiştir. Ardından tekil makine öğrenmesi ve topluluk öğrenmesi yöntemleri kullanılarak, değişkenler ve hedef değişken arasındaki ilişki kurulmuştur. Modellerin sonuçları doğruluk, kesinlik, F1 skoru gibi değerlendirme metrikleri ile karşılaştırılmış, ve en yüksek değeri veren modelin en başarılı olduğu kabul edilmiştir. Model başarı metrik değerleri oldukça yüksek olduğundan, çalışmanın bireylerin demografik verilerinin yabancı dil bilgisi ile ilişkili olduğu hipotezinin doğrulandığı söylenilebilir. Doğrulanmış hipotezden yola çıkılarak demografik veriler incelendiğinde, çalışmanın eğitim planlayıcılar için iyileştirme noktalarının tespiti açısından önemli bir kaynak olacağına inanılmaktadır.