Using text representation and deep learning methods for turkish text classification


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Çukurova Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği, Türkiye

Tezin Onay Tarihi: 2019

Tezin Dili: İngilizce

Öğrenci: FUNDA GÜVEN

Danışman: Selma Ayşe Özel

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

İnternet kullanımının giderek yaygınlaşması, beraberinde dijital ortamlarda üretilen metin içeriği miktarında ciddi bir artışa neden olmuştur. Artan miktardaki metin verisini işlemek zorlaşmıştır ve bu ihtiyaca yönelik çözümler geliştirilmeye başlanmıştır. Geleneksel yöntemlere alternatif olarak daha büyük boyutlu verilerle çalışmayı mümkün kılan, derin öğrenme tabanlı sınıflayıcılar ve yapay sinir ağı tabanlı metin temsil yöntemleri geliştirilmiştir. Geliştirilen bu yöntemler kullanılarak yapılan çalışmaların büyük çoğunluğu İngilizce metinler ile yapılmıştır. Türkçe metinler için bu yöntemler son 2 ya da 3 yılda kullanılmaya başlanmıştır. Bu tezde yapay sinir ağı tabanlı kelime ve doküman temsil yöntemleri ile derin öğrenme tabanlı sınıflayıcıların farklı karakteristiklere sahip Türkçe metinlerdeki sınıflama performanslarını değerlendirmek amacıyla, duygu ve doküman sınıflama problemleri için kullanılmış, geleneksel metin temsil yöntemleri ve sınıflayıcılar ile karşılaştırılmıştır. Sınıflayıcıların bu iki problem için karşılaştırmasını yapmak amacıyla, derin öğrenme tabanlı evrişimli sinir ağları, uzun kısa süreli bellek ağları ve literatürde Türkçe metinler için sıklıkla uygulanan geleneksel sınıflayıcılar kullanılmıştır. Yapılan deneyler sonucunda yapay sinir ağı bazlı metin temsil yöntemlerinin, tf ve tf-idf ağırlıklandırma yöntemlerinin başarılarına yakın ve bazı durumlarda daha yüksek sınıflama başarısı elde ettiği gözlenmiştir. Derin öğrenme tabanlı sınıflayıcılar ise geleneksel sınıflayıcılara eşit veya daha yüksek sınıflama başarısına sahip olmuştur.