Identification of cyberbullying using machine learning techniques


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Çukurova Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: İngilizce

Öğrenci: ALI NAJIB

Danışman: Selma Ayşe Özel

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Sosyal medya platformlarının yaygın kullanımı, aralarında siber zorbalığın da önemli bir endişe kaynağı olduğu çok sayıda tehdidi beraberinde getirmiştir. Siber zorbalık, bir mağdura zarar vermek amacıyla ahlak dışı davranışlarda bulunmak için elektronik veya dijital medyanın tekrarlı kullanımı olarak tanımlanmaktadır. Hem Türkiye'de hem de dünyada siber zorbalık, depresyon, stres, anksiyete ve aşırı durumlarda intiharı da içerebilen derin duygusal ve psikolojik yansımaları nedeniyle acil dikkat gerektiren bir konu olarak kabul edilmektedir. Bu endişe için çok sayıda araştırmacı ve bilim insanı makine öğrenimi (ML), derin öğrenme (DL) ve doğal dil işleme (NLP) tekniklerinden yararlanarak çözümler geliştirmeye çalışmıştır. Bu çabalar, siber zorbalığı metinsel bağlamlar içinde tanımlayabilen modeller oluşturmayı ve nihai hedef olarak bu tür içeriği tespit edip kaldırmayı ya da yayılmasını önlemeyi amaçlamaktadır. Ancak, bu alandaki çalışmaların büyük çoğunluğu İngilizce dilinde yapılmış olup, Türkçe dilinde yapılan araştırma sayısı oldukça azdır. Dahası, mevcut çalışmalar analizlerini genellikle İngilizce ve Türkçe arasında ayırmakta ve potansiyel diller arası nüansları göz ardı etmektedir. Literatürdeki bu boşluklardan hareketle bu tez, hem İngilizce hem de Türkçe dillerinde siber zorbalığın tespitini ele almaya çalışmaktadır. İkili metin sınıflandırma problemi olarak çerçevelenen araştırma, birleşik bir yaklaşımın farklı dilsel bağlamlarda siber zorbalığı etkili bir şekilde tespit edip edemeyeceğini anlamayı amaçlayarak diller arasında standart tekniklerin etkinliğini incelemektedir. Bu amaca ulaşmak için ML, DL ve büyuk dil modelinin (LLM) karşılaştırmalı değerlendirmesi de dahil olmak üzere kapsamlı deneyler gerçekleştirilmiştir. Ayrıca, geleneksel özellik ağırlıkları ve kelime katıştırmaları da dahil olmak üzere bir dizi özellik çıkarma tekniği titizlikle değerlendirilmiştir. Ek olarak, LLM'ye uygulanan bir optimizasyon tekniği olan LoRA'nın etkinliği kapsamlı bir şekilde değerlendirilmiştir. Ayrıca, etiketli verilerin azlığının yarattığı zorluğun farkına varılarak, yeni bir yarı denetimli öğrenme tekniği önerilmiştir. Özellikle, kendi kendini eğiten büyük bir Dil Modeli uygulanmış, etiketli ve etiketsiz verilerin bir kombinasyonundan yararlanarak sınıflandırma performansını artırma potansiyeli gösterilmiş ve böylece manuel etiketleme işlemlerinin kaynak yoğun doğası hafifletilmiştir. Bu araştırma, siber zorbalık tespit yöntemlerinin geliştirilmesine katkıda bulunmakta ve dijital alanda siber zorbalıkla mücadele etmek için diller arasında daha kapsayıcı yaklaşımları teşvik etmektedir.