Diacritic restoration of Turkish sentences


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Galatasaray Üniversitesi, Fen Bilimleri Enstitüsü, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2021

Tezin Dili: İngilizce

Öğrenci: HÜSEYİN EKİCİ

Danışman: İsmail Burak Parlak

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu proje, Türkçe 'deki fonetik harflerin düzeltilmesine odaklanmaktadır. Mobil ve masaüstü cihazlarda sanal klavye kullanımının artmasıyla birlikte Türkçe harflerin olmaması veya yazım hatası nedeniyle Türkçe kelime hata oranı önemli ölçüde artmıştır. Metin bazlı çalışan birçok sisteme hizmet eden verilerdeki bu sorunu kaldırmak ve temiz bir veri tabanı inşa edebilmek için fonetik harf düzeltmeleri büyük önem arz etmektedir. Çünkü Türkçe de dâhil olmak üzere Rumence, Arapça ve Vietnamca gibi dillerde bu harflerin oldukça yoğun bir kullanımı bulunmakta ve bu harflerin varlığı anlam açısından da büyük farklılık ortaya koymaktadır. Türkçe 'de bu konuya ait benzer çalışmalar mevcut lâkin bu çalışmanın ayrıştığı en önemli noktalardan biri fonetik harfler kümesine "â" ve "î" harflerinin de eklenmesidir. Bu çalışmada, bahsedilen sorunun üstesinden gelmek için öncelikle Türkçe 'ye dair hem çok çeşitli kelimeler barındıran hem de yazım kurallarına uygun bir şekilde yazılmış yaklaşık 5000 adet kitap ile ham bir veri kümesi hazırlandı . Bu ham veri kümesi, birkaç temizleme adımından geçirilerek incelemeye ve oluşturulacak sistemi eğitmeye hazır hale getirildi. İlk olarak bu veri kümeleri ile N-Gram modelleri oluşturuldu. Oluşturulan modeller üzerinde Zipf ve Mandelbrot dağılımları gözlemdi ve ne kadar iyi bir dil modeli tasarlandığını değerlendirmek için "perplexity (karışıklık)" değerleri hesaplandı. Burada elde edilen yüksek uyumluluk değerleri sonrası bu veriler bir sonraki olan öğrenme ve değerlendirme adımlarında kullanıldı. Projenin son adımı olan, modelin eğitimi ve değerlendirmesinde, "seq2seq" temelli öğrenme modeli kullanılarak, harf bazlı sistem eğitimi yapıldı. Veri kümesinden ayrıştırılan kontrol parçaları üzerindeki kelimelerde fonetik ve fonetik harflerin Latin karşılıkları rastgele olarak değiştirilerek yeni bir yapay girdi kümesi oluşturuldu. Eğitilen model, oluşturulan bu kontrol setiyle değerlendirildi ve %90 üzerinden başarımlar elde edildi.