Veri Madenciliğinde Kümeleme Analizi ve Hibrit Verilerin Kümelenmesi Üzerine Bir Algoritma
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Fen Bilimleri Enstitüsü, Türkiye
Tezin Onay Tarihi: 2017
Tezin Dili: Türkçe
Öğrenci: Osman ÇÖREKCİ
Danışman: Ayla Şaylı
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Büyük verilerin kendi içinde benzer kümelere ayrılması veri madenciliğinin en temel problemlerinden biridir. Günümüzde büyük verilerin organize edilmiş bir biçimde depolanabilmesi, kümeleme işlemi için geliştirilen yöntemlerin, büyük veriler için etkili çalışabilmesi kriterinin önemi de arttırmıştır. Hiyerarşik kümeleme yöntemleri etkili sonuçlar verse de hesaplama karmaşıklığı nedeniyle büyük veriler ile çalışma konusunda yetersiz kalmaktadır. Hiyerarşik olmayan kümeleme yöntemleri ise maliyet fonksiyonunun kategorik veriler ile çalışamaması nedeniyle tüm veri tipleri için kullanılamamaktadır. Yalnızca kategorik veriler için ve hibrit veriler için bazı hiyerarşik olmayan kümeleme yöntemleri de son zamanlarda geliştirilmiştir. Bunun yanında verideki özelliklerin kümeleme işlemindeki ağırlıkları, verinin doğası gereği veya kümeleme sonucunda elde edilmek istenen sonuçlara bağlı olarak, farklı olabilir. Bu dokümanda, büyük hibrit verilerin etkili bir şekilde kümelenmesi ve bu kümeleme işlemine özelliklerin ağırlıklarının da dâhil edilebilmesi için geliştirilen bir algoritma tanıtacağız. Temel olarak K-Prototypes algoritmasına dayanan bu algoritmayı W-K-Prototypes olarak isimlendireceğiz.