Studying deep learning models for manipulated face detection


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Yıldız Teknik Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2021

Tezin Dili: Türkçe

Öğrenci: ILKIN HUSEYNLI

Danışman: Songül Varlı

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Deepfakes, kullanıcıların bir video veya görüntüdeki bir kişinin kimliğini değiştirmesine olanak tanır. Önceden, bu tür sahte videolar/görüntüler oluşturmak için özel donanım ve beceri gerekiyordu. Ancak GAN tabanlı tekniklerdeki iyileştirmelerle birlikte, daha gerçekçi ve algılaması zor manipüle edilmiş yüzler oluşturmak daha kolay hale geldi. Bu da bireyleri tehdit etmekte ve sosyal medya platformlarına olan güveni azaltmaktadır. Bu çalışmada amacımız, bugüne kadarki en büyük sahte yüz veri seti olan DFDC üzerinde sekiz farklı modelin öğrenme kabiliyetini rapor etmek ve bu modellerin genelleme kabiliyetini Celeb-DF-v2 veri kümesi ile test etmektir. Eğitim veri seti yüksek kaliteli videolardan oluştuğu için ilk olarak yüzleri tespit etmeye ve çıkarmaya başladık. Daha sonra, dengeli sınıflara sahip olmak, sınırlı kaynaklarla makul sürede eğitmek için verileri örnekledik. Veri kümesi yeterince büyük olduğundan ve yüzler zaten değiştirilmiş olduğundan, ekstra yapay artırmak olmadan eğitime başladık. Ardından, diğer çalışmalardan ilham alan varsayılan büyütme zincirimizi ekledik ve "Coarse Dropout" ve "Grid Mask" güçlendirmeleriyle gücü artırdık. Sonuçları değerlendirmek için DFDC veri setinden, görünmeyen yapay artırmak ve çeldiricilere sahip ayrı bir test seti ve tamamen farklı bir Celeb-DF-v2 veri seti kullanıldı. Eğitim veri setinden farklı olarak, test setleri için farklı yüz çıkarma akışları izledik. Videodakı yüzleri basit Birleşimlerin Kesişimi (Intersection over Union) yöntemi ile takip ederek, belirli miktardakı ardışık sahnelerde yer alan yüzlerden örnekleme yaptık. Test setindeki her video için örneklenen yüzlerin güvenirliğinin ortalaması alındı ve tek bir güven değeri üretildi. Video tabanlı log kaybı değerlerini hesaplamak için bu güven değerlerini kullandık. Celeb-DF-v2 veri setindeki sınıflar dengesiz olduğu için Duyarlılık ve Özgüllük değerlerini de hesapladık. Bu metrikler için, Eşit Hata Oranı kullanılarak optimal eşiğe karar verildi. Nispeten daha küçük boyutlu girdiye rağmen EfficientNet-B4 modelinin en iyi öğrenme ve genelleme yeteneğine sahip olduğu sonucuna vardık. Yarı hassas (half-precision) eğitim modelleri, çok az kayıpla eğitim süresini 2 kata kadar hızlandırabilir. Son olarak, Coarse Dropout, modellerin daha iyi genelleştirilmesine yardımcı oldu.