Improving web page classification with unlabeled data
Tezin Türü: Doktora
Tezin Yürütüldüğü Kurum: Çukurova Üniversitesi, Fen Bilimleri Enstitüsü, Elektrik-Elektronik Mühendisliği, Türkiye
Tezin Onay Tarihi: 2019
Tezin Dili: İngilizce
Öğrenci: HAVVA ESİN ÜNAL
Danışman: Selma Ayşe Özel
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Etiketlenmemiş verilerle birçok alanda sıklıkla karşılaşılmakta ve bu verileri kullanmak için de etkili yollara ihtiyaç duyulmaktadır. Etiketlenmemiş verilerden faydalı bilgiler elde etmek için yarı-denetimli öğrenme yöntemleri kullanılmaktadır. Bu tez çalışmasında Çapraz Doğrulamalı Artımlı Paralel Eğitim (APE-ÇD) ve Artımlı Seri Eğitim (ASE) olarak adlandırılan iki farklı yarı-denetimli öğrenme yöntemi önerilmiştir. Önerilen yarı-denetimli öğrenme yöntemleri etiketlenmemiş verileri verimli bir şekilde etiketlemek için denetimli sınıflandırıcıları ve veri kümelerinin farklı görünümlerini kullanmaktadır. Bu nedenle öncelikle önerilen yarı-denetimli sınıflandırıcılarda hangi sınıflandırıcıların ve özellik çıkarma algoritmalarının kullanılması gerektiğini belirlemek amacıyla denemeler yapılmıştır. Önerilen yöntemlerin etkinliğini değerlendirmek için, bilinen iki yarı-denetimli öğrenme yöntemi olan Eş-Eğitim ("Co-Training") ve Yinelemeli Çapraz Eğitim ("Iterative Cross Training") metotları seçilmiştir. Web üzerinde yüksek miktarda etiketlenmemiş veriye ulaşılabileceği için tez kapsamında yapılan denemeler bu alandan toplanmış veri kümeleri ile yapılmıştır. Tezde herkese açık "SyskillWebert", "WebKB" ve "Banksearch" ile elle toplanan Konferans veri kümelerinden elde edilen 13 adet iki sınıflı veri kümesi kullanılmıştır. Her bir veri kümesi için 30 adet rastgele seçilmiş etiketli başlangıç eğitim seti ile yöntemler karşılaştırılmış ve sonuçlar istatistiksel olarak analiz edilmiştir. Bu analizlere göre, önerilen iki yöntemin de performansının çok yüksek olduğu, özellikle APE-ÇD yönteminin tüm yöntemler arasında en yüksek sınıflandırma performansına sahip olduğu gösterilmiştir.