Prediction of death on international stroke trial dataset with the comparison of different statistical methods


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Fen Bilimleri Enstitüsü, İstatistik, Türkiye

Tezin Onay Tarihi: 2022

Tezin Dili: İngilizce

Öğrenci: ALPER UMUT TOSUN

Danışman: Filiz Karaman

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu çalışmada, farklı ülkelerdeki akut inme hastalarının altıncı aydaki olay yaşama (mortalite) olasılıklarını tahmin etmek amacıyla regresyon modelleri ve makine öğrenmesi yöntemleri kullanılmıştır. Sonrasında, modellerin performans ölçütleri ile, iç ve dış coğrafi geçerlilikleri (validasyon) değerlendirmeye alınmıştır. Hastaların verisi (n=19435), eksik veriler çıkartıldıktan sonra (n=18408) üçe ayrılmıştır: Birleşik Krallık ve İrlanda hastaları (Britanya verisi, n=5817), Birleşik Krallık dışında bulunan Avrupa ülkeleri hastaları (Avrupa verisi, n=9955) ve Avrupa dışındaki dünya ülkeleri hastaları (Dünya verisi, n=2636). Britanya hastalarından elde edilen farklı sayılardaki örneklemler öğrenim veri setini oluştururken Avrupa ve Dünya verileri ayrı test veri setlerini oluşturmuştur. Lojistik regresyon, kısıtlı kübik spline (RCS) kullanılarak oluşturulmuş lojistik regresyon, cezalı regresyonlar (ridge, lasso, elastik-net), genelleştirilmiş toplamsal model, makine öğrenmesi yöntemleri (destek vektör makineleri, gradient boosting, rastgele orman, yapay sinir ağları ve XGB) ile öğrenim veri setinde tahmin modelleri geliştirilmiştir. Öğrenim veri seti içerisinde sırasıyla 50, 100, 150, 200, 250, 300, 350, 400, 450, 500, 600, 700, 800, 900, 1000, 1500, 2000, 2500 ve 3000 sayılı örneklemler oluşturularak farklı "değişken başına olay" değerlerine (EPV) ayrılmışlardır. Modeller hem birbirleri arasında hem de EPV değerlerine göre kıyaslanmıştır. Her bir modelin performansı, test veri setlerindeki geçerliliğine bakılarak değerlendirilmiştir. Performans ölçütleri için R2, Brier skoru, kalibrasyon (kalibrasyon kestirimi ve kalibrasyon eğimi) ve diskriminasyon ölçütleri (AUC veya C istatistiği) bulunmuş ve karşılaştırılmıştır. Sonuç olarak, makine öğrenme yöntemleri ve geleneksel regresyon yöntemleri kıyaslandığında, özellikle yüksek EPV değerlerinde regresyon modellerinin dış geçerlilik performansları makine öğrenme yöntemlerine göre daha iyi sonuçlar vermiştir. EPV<30 iken, tüm regresyon performanslarının makine öğrenme yöntemlerine kıyasla daha stabil olduğu gözlemlenmiştir.