Effects of feature extraction techniques on classification of turkish texts


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Çukurova Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği, Türkiye

Tezin Onay Tarihi: 2018

Tezin Dili: İngilizce

Öğrenci: ÖZGE AKDOĞAN

Danışman: Selma Ayşe Özel

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu tezin amacı farklı türlerdeki Türkçe belgelerin sınıflandırılması için en etkin nitelik çıkarımı yöntemlerinin belirlenmesi ve etkili bir nitelik seçme yönteminin önerilmesidir. Çalışmada 1150 Haber, 3000 Tweet, Türkçe Email ve 25 Yazar veri kümeleri üzerinde deneyler yapılmıştır. En iyi terim ağırlıklandırma yöntemini belirlemek için 5 farklı yöntem (tf, tp, logtf, normtf, tf*idf) denenmiş ve bunların içerisinden en başarılı sonuçları veren tf ve tf*idf yöntemlerinin en başarılı olduğu belirlenmiştir. Sınıflandırma sonuçlarına olumlu bir etkisi olduğu için tüm metinlere durdurma kelimelerininin elenmesi önişlemi uygulanmıştır. Ağırlıklandırma yöntemini belirleme ve durdurma kelimelerinin etkisini ölçme deneyleri metinler içerisindeki terimlerin ham halleri kullanılarak yapılmıştır. Kelime kökü bulma algoritmalarının da sınıflandırılmaya etkisini araştırmak için metinlere Zemberek, Affix Stripping ve Fixed Prefix 3, 5, 7 olmak üzere 5 farklı kök bulma algoritması uygulanmıştır. Kelime kökü alınarak ve kelimelerin ham halleri ile yapılan sınıflandırma sonuçları karşılaştırılmış, kelimelerin ham halleri ile yapılan sınıflandırmanın daha başarılı sonuçlar verdiği gözlenmiştir. Nitelik çıkarımı yapmak için kelime n-gramı, nitelik seçimi için standart sapma tabanlı bir yöntem ile bilgi kazancı (information gain) ve ki kare algoritmaları uygulanmıştır. Terimlerin ham halleri kullanılarak kelime n-gram nitelik çıkarımı ve standart sapma nitelik seçimi en iyi sonucu vermiştir.