Prediction of death on international stroke trial dataset with the comparison of different statistical methods
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Fen Bilimleri Enstitüsü, İstatistik, Türkiye
Tezin Onay Tarihi: 2022
Tezin Dili: İngilizce
Öğrenci: ALPER UMUT TOSUN
Danışman: Filiz Karaman
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bu çalışmada, farklı ülkelerdeki akut inme hastalarının altıncı aydaki olay yaşama (mortalite) olasılıklarını tahmin etmek amacıyla regresyon modelleri ve makine öğrenmesi yöntemleri kullanılmıştır. Sonrasında, modellerin performans ölçütleri ile, iç ve dış coğrafi geçerlilikleri (validasyon) değerlendirmeye alınmıştır. Hastaların verisi (n=19435), eksik veriler çıkartıldıktan sonra (n=18408) üçe ayrılmıştır: Birleşik Krallık ve İrlanda hastaları (Britanya verisi, n=5817), Birleşik Krallık dışında bulunan Avrupa ülkeleri hastaları (Avrupa verisi, n=9955) ve Avrupa dışındaki dünya ülkeleri hastaları (Dünya verisi, n=2636). Britanya hastalarından elde edilen farklı sayılardaki örneklemler öğrenim veri setini oluştururken Avrupa ve Dünya verileri ayrı test veri setlerini oluşturmuştur. Lojistik regresyon, kısıtlı kübik spline (RCS) kullanılarak oluşturulmuş lojistik regresyon, cezalı regresyonlar (ridge, lasso, elastik-net), genelleştirilmiş toplamsal model, makine öğrenmesi yöntemleri (destek vektör makineleri, gradient boosting, rastgele orman, yapay sinir ağları ve XGB) ile öğrenim veri setinde tahmin modelleri geliştirilmiştir. Öğrenim veri seti içerisinde sırasıyla 50, 100, 150, 200, 250, 300, 350, 400, 450, 500, 600, 700, 800, 900, 1000, 1500, 2000, 2500 ve 3000 sayılı örneklemler oluşturularak farklı "değişken başına olay" değerlerine (EPV) ayrılmışlardır. Modeller hem birbirleri arasında hem de EPV değerlerine göre kıyaslanmıştır. Her bir modelin performansı, test veri setlerindeki geçerliliğine bakılarak değerlendirilmiştir. Performans ölçütleri için R2, Brier skoru, kalibrasyon (kalibrasyon kestirimi ve kalibrasyon eğimi) ve diskriminasyon ölçütleri (AUC veya C istatistiği) bulunmuş ve karşılaştırılmıştır. Sonuç olarak, makine öğrenme yöntemleri ve geleneksel regresyon yöntemleri kıyaslandığında, özellikle yüksek EPV değerlerinde regresyon modellerinin dış geçerlilik performansları makine öğrenme yöntemlerine göre daha iyi sonuçlar vermiştir. EPV<30 iken, tüm regresyon performanslarının makine öğrenme yöntemlerine kıyasla daha stabil olduğu gözlemlenmiştir.