Managing genetic algorithm parameters to improve SegGen a thematic segmentation algorithm


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Galatasaray Üniversitesi, Mühendislik ve Teknoloji Fakültesi, Bilgisayar Mühendisligi, Türkiye

Tezin Onay Tarihi: 2013

Tezin Dili: İngilizce

Öğrenci: NESLİHAN ŞİRİN SAYGILI

Danışman: TANKUT ACARMAN

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Son yıllarda kullanılabilir metin veritabanı sayısında ciddi bir artış meydana gelmiştir. Buna bağlı olarak, bilgi edinme alanında etkili araştırma yöntemlerine duyulan ihtiyaç da artmıştır. Ayrıca ilgili bilgiye erişimde etkinlik ve kullanıcıların bilgi ihtiyacına doyurucu yanıtlar verilmesi günümüzde arama sistemi seçiminde önem kazanmaktadır. Anlamsal bölümleme, yazılı metni Salton?un yaptığı tanımda geçen kriterlere göre anlamlı homojen parçacıklara ayırma süreci olarak tanımlanabilir. Bu tanıma göre bir metnin anlamsal olarak bölümlenmesi onu parçalara ayırmak demektir. Bu işlemde bölümlerin iç bütünlüğü ve birbirine komşu bölümler arasındaki farklılıklar hat safhadadır. Bu tanıma göre otomatik metin bölümlenmesi, bu kriterlere uygun bir belge içerisinde sınırları belirleyerek belli başlı tematik ayrımların tayin edilmesi şeklinde anlaşılabilir. SegGen, SPEA'nın bir varyantı üzerine şekillendirilmiş bir anlamsal bölümleme algoritmasıdır. Bu algoritma ile hedeflenen, Salton'un bölümleme tanımına dair iki kriterin optimize edilmesidir. Kriterler ise bir bölümün ait olduğu metnin kendi içinde maksimum bütünlüğe sahip olması ve komşu bölümlerle arasında minimum benzerlik olması şeklindedir. Bu tez çalışmasında, elde edilen popülasyonların niteliğinin evrimine göre genetik algoritma parametrelerinin ayarlanması suretiyle SegGen yaklaşımı üzerinde uygulanan birtakım gelişmeler anlatılmaktadır. Parametre ayarları iki farklı nedene dayandırılmış ve uygulanmıştır. Birinci nedene göre; popülasyonun niteliğine ilişkin genel kriterlere göre değerlendirme yapılabileceğinden elde edilen popülasyonların genel niteliği, süreç ilerledikçe artar ve parametrelere değer koymak ve arama sürecinde gücü artırırken çeşitlilik faktörlerini azaltan yeni operatörler tanımlamak mantıklı görünmeye başlar. Diğer nedene göre ise; popülasyonlar içerisindeki öğeler makul metin bölümleri olduğundan mevcut bölümler içerisindeki cümlelere, optimizasyonu söz konusu iki kriterde gömülü cümleler arasındaki benzerliklerin analizi açısından, bağlı bulundukları sınırlara olan uzaklıklarına göre değer yüklemek gerekir.