scieee AI-readable full text Open interactive document viewer

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Nataliia Darchuk; Oksana Zuban; Valentyna Robeiko; Yuliia Tsyhvintseva; Victor Sorokin; Mykola Sazhok

Abstract

This paper presents the structure, algorithms, implementation, and experimental results of the automatic TextAttributor system developed by the authors of the paper for statistical Ukrainian-language text parameterisation using a multiparametric set of statistical indices, characterising the author’s text style and applicable to authorship attribution tasks. Based on the created linguistic resources and software, the system generates a linguistic analysis based on the calculated statistical indices and performs a comparative study of two texts. An additional criterion for statistical indexing is the text toxicity index, calculated through the method of verbal identification of toxic sentiment. Authorship and toxicity detection tasks are addressed using two methods: dictionary- and rule-based statistical calculations and machine learning. The current findings implemented in the beta version of TextAttributor are thoroughly examined.

Full text

NATALIIA DARCHUK Taras Şevçenko Kiev Ulusal Üniversitesi ORCID kimliği: orcid.org/0000-0001-8932-9301 Araştırma alanları: bilgisayar dilbilimi, derlem dilbilimi, nicel dilbilim, Ukrayna dilinin dil bilgisi ve anlambilimi. OKSANA ZUBAN Taras Şevçenko Kiev Ulusal Üniversitesi ORCID kimliği: orcid.org/0000-0002-2644-3892 Araştırma alanları: bilgisayar dilbilimi, dilbilimsel uzmanlık, nicel dilbilim, Ukrayna dilinin dil bilgisi ve anlambilimi. VALENTYNA ROBEIKO Taras Şevçenko Kiev Ulusal Üniversitesi ORCID kimliği: orcid.org/0000-0003-2266-7650 Araştırma alanları: konuşma analizi, tanıma ve sentez, fonetik, doğal dil işleme. YULIIA TSYHVINTSEVA Taras Şevçenko Kiev Ulusal Üniversitesi, Ukrayna Ulusal Bilimler Akademisi Ukrayna Dili Enstitüsü ORCID kimliği: orcid.org/0000-0002-9684-3840 Araştırma alanları: Ukraynaca neoloji, sözlükbilim ve sözlükçülük. VICTOR SOROKIN Taras Şevçenko Kiev Ulusal Üniversitesi ORCID kimliği: orcid.org/0000-0002-3637-0535 Araştırma alanları: otomatik sözdizimi analizi, otomatik anlamsal analiz, doğal dil işleme. Straipsniai / Articles 223 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK MYKOLA SAZHOK Ukrayna Ulusal Bilimler Akademisi Bilgi Teknolojileri ve Sistemleri Enstitüsü ORCID kimliği: orcid.org/0000-0003-1169-6851 Araştırma alanları: konuşma analizi, tanıma ve sentez, doğal dil işleme. DOI: doi.org/10.35321/all91-09 UKRAYNA MEDYA METİNLERİNİN OTOMATİK STİLOMETRİK ANALİZİ SİSTEMİ TEXTATTRIBUTOR 1.0 (YÖNTEMLER, ARAÇLAR, İŞLEVSELLİK) Ukrayna medya metinlerinin otomatik stilometrik analiz sistemi “TextAttributor 1.0” (yöntemler, araçlar, işlevsellik) ÖZET Bu makale, makalenin yazarları tarafından Ukraynaca metinlerin, yazarın metin üslubunu karakterize eden ve yazarlık atfı görevlerine uygulanabilen çok parametreli bir istatistiksel indeksler kümesi kullanılarak istatistiksel parametreleştirilmesi amacıyla geliştirilen otomatik TextAttributor sisteminin yapısını, algoritmalarını, uygulanmasını ve deneysel sonuçlarını sunmaktadır. Sistem, oluşturulan dilbilimsel kaynaklar ve yazılım temelinde, hesaplanan istatistiksel indekslere dayalı bir dilbilimsel analiz üretmekte ve iki metnin karşılaştırmalı incelemesini gerçekleştirmektedir. İstatistiksel indeksleme için ek bir ölçüt, toksik duygulanımın sözel olarak belirlenmesi yöntemiyle hesaplanan metin toksisite indeksidir. Yazarlık ve toksisite tespiti görevleri iki yöntem kullanılarak ele alınmaktadır: sözlük ve kural tabanlı istatistiksel hesaplamalar ile makine öğrenmesi. TextAttributor’ın beta sürümünde uygulanan güncel bulgular ayrıntılı olarak incelenmiştir. ANAHTAR KELİMELER: Hesaplamalı dilbilim, Ukrayna dili, duygu analizi, yazarlık atfı, stilometri, metin sınıflandırması. 224 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Ö Z E T Bu makalede, makale yazarları tarafından, yazarın metin üslubunu niteleyen ve yazarlık atfı görevlerinde uygulanabilen çok parametreli istatistiksel göstergeler kümesi kullanılarak Ukrayna dili metinlerinin istatistiksel parametreleştirilmesi amacıyla oluşturulan otomatik “TextAttributor” sisteminin yapısı, algoritmaları, uygulanması ve deneysel sonuçları sunulmaktadır. Oluşturulan dilbilimsel kaynaklar ve yazılım temelinde sistem, hesaplanan istatistiksel indekslere dayalı bir dilbilimsel analiz üretmekte ve iki metnin karşılaştırmalı analizini gerçekleştirmektedir. İstatistiksel indeksleme için ek ölçüt, olumsuz duygular uyandıran metin indeksidir; bu indeks, olumsuz duyguların sözlü olarak belirlenmesi yöntemiyle hesaplanmaktadır. Yazarlık ve öfke tespiti görevleri iki yöntemle çözülmektedir: sözlük ve kurallara dayalı istatistiksel hesaplamalar ile makine öğrenmesi. “TextAttributor”ın beta sürümü kullanılarak elde edilen mevcut sonuçlar ayrıntılı biçimde incelenmiştir. TEMEL KELİMELER: bilgisayarlı dilbilim, Ukrayna dili, duygu analizi, yazarlık atfı, stilometri, metin sınıflandırması. 1. GİRİŞ Metinbilimsel araştırmalar, bilgisayarlı dilbilim yöntemlerinin ilerlemesiyle yeni bir bilimsel önem kazanmış; bu gelişme, dijital metinbilim olarak değerlendirilebilecek yeni bir yönelimin oluşmasına katkıda bulunmuştur. Bu gelişmekte olan disiplin çerçevesinde dijital metinbilimi, nicel metin analizi için matematiksel modellerle birleştirilen otomatik derlem dilbilimi tekniklerinden yararlanma olarak kavramsallaştırıyoruz. Ekibimiz, çağdaş nicel dilbilim ve doğal dil işlemenin güncel görevlerinden hareketle, TextAttributor (TextAttributor 1.0 2024) adlı bir web uygulaması olarak uygulanmış, medya metinlerinin otomatik dilbilimsel-istatistiksel analizi için bir sistem geliştirmiştir. Sistem dört görevde çalışır: 1) istatistiksel metin parametreleştirmesi; 2) stilometri: idyolektin dilbilimsel-istatistiksel özelliklerinin belirlenmesi; 3) atıf: metinler arasındaki benzerlik derecesinin belirlenmesi; ve 4) duygu analizi: metinlerdeki olumsuz duygu söz varlığının belirlenmesi. Ayrıca sistem içinde, ikinci ve dördüncü görevlerin sonuçlarına dayanarak iki dilbilimsel uzman görüşü otomatik olarak oluşturulur. TextAttributor sisteminin çok işlevliliği, kullanıcıların çalışma ilkelerini öğrenmesini gerektirir. Bu makalenin amacı, akademik ve eğitimsel filoloji topluluğunu sistemin oluşturulma yöntemi, mimarisi ve işleyiş sonuçları hakkında bilgilendirerek, özellikle önem taşıyan işlevlerinin ve analitik yeteneklerinin açıkça anlaşılmasını sağlamaktır. Bu yaklaşım, büyük hacimli internet iletişimlerinin analiz edilmesi ve Straipsniai / Articles 225 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA RОBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK devam eden Rusya–Ukrayna savaşı sırasında bilgi savunma stratejilerinin güçlendirilmesi açısından özellikle önemlidir. Otomatik bir Ukraynaca metin atıf sistemi geliştirme düşüncesi, proje yazarlarının Ukrayna Dili Derlemi (KUM) araçlarını kullanarak yürüttüğü Ukrayna derlem dilbilimi alanındaki araştırmaların (Darčuk 2013) ve yazar üslubuna ilişkin istatistiksel çalışmaların (Darčuk et al. 2021; Darchuk, Sorokin 2022; Zuban 2019) incelenmesinden doğmuştur. TextAttributor sisteminin geliştirilmesi sırasında şu yöntemler kullanılmıştır: bileşen analizi, dağılımsal analiz ve içerik analizi. Metinden bilgi çıkarmaya yönelik nicel ve nitel bir yöntem olan içerik analizinde doğal dil işleme ve istatistiksel tekniklerden yararlanılmıştır. Niceleme ve duygu analizi de uygulanmıştır. Duygu analizi, hem duygusal renklendirmeye hem de yazarın olaylar veya nesnelere ilişkin değerlendirmesine dayanarak metnin tonunu otomatik biçimde belirler; bu işlem sözlük ve kural tabanlı istatistiksel hesaplamalar kullanılarak gerçekleştirilmiştir. Ayrıca derin öğrenme de dâhil olmak üzere makine öğrenmesi yöntemleri kullanılmıştır. Bir metnin nicel modeli olarak anlaşılan istatistiksel yapısı, onun işlevsel üslubunun, yazarlığının ve oluşturulma döneminin belirlenmesini sağlar. Bu çalışmada istatistiksel yapı bileşenleri, indeksleme teknikleri ve Öklid uzaklığı ölçütleri kullanılarak sözlüksel ve dilbilgisel istatistiksel özelliklerin analiz edilmesiyle çıkarılmıştır. İki nokta arasındaki uzaklığı n-boyutlu Öklid uzayında ölçen Öklid uzaklığı, stilometri ve yazarlık atfında küme analizi için dilbilimsel istatistikte en yaygın kullanılan ölçütlerden biridir. Sonuçların yeniliği, metin analizinde hesaplamalı dilbilim alanındaki ilk otomatik morfo-sentaktik-semantik stilometrik modelin uygulanmış olmasıdır; bu model, öncelikle metnin morfolojik, ayrıca sözdizimsel ve anlamsal yapısını parametreleştiren 15 istatistiksel indekse dayanmaktadır. Stilometrik model, bir metnin, bu metnin işlevsel üslubun stilometrik modeliyle karşılaştırmalı analizinin gerçekleştirildiği istatistiksel parametreler kümesidir (sözlüksel, morfolojik, sözdizimsel vb.). Bize göre, stilometrik modelin oluşturulmasında statik yöntemlerin kullanılmasıyla üsluplardaki, türlerdeki vb. ortak ve ayırt edici özelliklerden oluşan kesin, deterministik ve bilimsel açıdan temellendirilmiş bir sistem elde etmek mümkündür. Stilometrik modelde ilk kez, Rusya–Ukrayna savaşı sırasında medya metinlerini karakteristik biçimde tanımlayan toksisite indeksi parametresi sunulmuştur. Bu model, yalnızca bu tür sistemler için tipik olan metinlerin istatistiksel parametreleştirilmesi işlevinde değil, analiz edilen metnin Ukrayna dilinin medya üslubuyla karşılaştırılması işlevinde ve iki veya daha fazla metni içeren stilometrik ve atıf görevlerinde de uygulanmıştır. Kuramsal önem, metin toksisitesini ve 226 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Ukraynacada yazarlığı belirlemeye yönelik iki yöntemin doğrulanmasına uzanır: 1) sözlük ve kural tabanlı yaklaşımlar yoluyla ve 2) derin öğrenme de dâhil olmak üzere makine öğrenmesi yoluyla. 2. İLGİLİ ÇALIŞMALAR Çağdaş Ukrayna dilbiliminde Taras Şevçenko, Lesya Ukrainka, Vasyl Stus (Zuban’ 2019), Ivan Franko (Buk 2021), Roman Ivanychuk (Lototska 2022), Valerii Shevchuk (Volos, Levchenko 2023), Mariia Matios, Yurii Andrukhovych, Oksana Zabuzhko (Karasov, Levchenko 2024), Ivan Drach, Mykola Vingranovsky (Darchuk et al. 2024), Lina Kostenko (Zuban’ 2019; Darchuk et al. 2024) ve diğerleri dâhil olmak üzere Ukraynalı yazar ve şairlerin idyolektleri üzerine kapsamlı dilbilimsel-istatistiksel çalışmalar yürütülmüştür. Bu çalışmalar, çoğunlukla bir ya da birkaç (beşten fazla olmayan) istatistiksel parametre kullanılarak, temsili metin örnekleri (uzun metinler) üzerinde ve sıklıkla stilometrik karşılaştırma uygulanmadan gerçekleştirilmiştir. Ayrıca dilbilimsel-istatistiksel deneylerin yürütülmesinin zahmetli olması nedeniyle Ukrayna dilbilimi; kapsamlı istatistiksel parametreleştirmeyi, analiz edilen metinlerin işlevsel üslupların standart istatistiksel parametreleriyle karşılaştırılmasını, metin benzerliği derecesinin belirlenmesini ve kısa metinlerin stilometrik ve atıfsal analizini büyük ölçüde göz ardı etmiştir. Bu görevleri otomatik olarak yerine getirmeyi amaçlayan TextAttributor sisteminin dilbilimsel-istatistiksel araştırmalarda kullanılması, yalnızca dilbilimsel olguların sıklık özelliklerini sağlamakla kalmayacak, aynı zamanda uzman görüşüyle sonuçlanan etkili bir stilometrik analizi de mümkün kılacaktır. TextAttributor sistemi, küresel bilimdeki benzerlerine kıyasla avantajlara sahiptir. Mevcut sistem ve modellerin çoğu, bir ya da birkaç, çoğunlukla biçimsel (n-gramlar, en sık kullanılan sözcükler, harfler) metin parametresini belirlemek için bireysel dilbilimsel-istatistiksel modüllerin kullanımına odaklanmaktadır (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). Buna karşılık TextAttributor 1.0, metnin sözlüksel, morfolojik, sözdizimsel ve anlamsal yapısının 15 parametre üzerinden gerçek zamanlı, etkileşimli istatistiksel analizini içeren kapsamlı bir yaklaşım sunmaktadır. Metinlerin atıflandırılması yabancı metinbilim çalışmalarında etkin biçimde geliştirilmektedir; özellikle Burrows yöntemi (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) çeşitli üsluplardaki büyük hacimli metinsel veriler üzerinde yürütülen birçok çalışmada sınanmıştır; örneğin 20th. yüzyılın başlarındaki İngiliz düzyazısı (Hoover 2004); çağdaş İngiliz şiiri (Hoover 2005); Latince şiirsel eserler (Rybicki, Eder 2011); İngilizce, Fransızca, İtalyanca, Almanca, Lehçe ve Macarca ile Latince ve Arapçadaki başlıca türlere ait düzyazı eserler (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); İngilizcedeki siyasal metinler, bunlar arasında Straipsniai / Articles 227 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK Amerikan başkanlarının konuşmalarının atfı (Savoy 2015). “Linguistic Inquiry and Word Count” (LIWC) adlı bir başka otomatik dilbilimsel analiz yöntemi, ticari bir uygulama olarak uygulanmış ve çeşitli dillere uyarlanmıştır (Meier et al. 2019; LIWC-22). Son yıllarda otomatik metin atfı görevlerinde ağırlıklı olarak ya kural tabanlı stilometrik yöntemler ya da derin öğrenme yöntemleri kullanılmıştır (Eder 2015; Canhasi et al. 2022). Her iki yöntem de TextAttributor sisteminde uygulanmış; etkin biçimde çalışmakla birlikte farklı sonuçlar vermiştir: 1) Kural tabanlı yöntem, idyolekt ve metin toksisitesi hakkında dilbilimsel sonuçların oluşturulmasını otomatikleştirmeye olanak tanır; 2) Makine öğrenmesi yöntemi yalnızca toksisite derecesini ve metinlerin benzerliğini belirler ve metinsel içeriğin izlenmesine yönelik sınıflandırma görevlerinde kullanılabilir. Duygu analizi ve metin yazarlığının belirlenmesine yönelik güncel makine öğrenmesi yöntemleri, istatistiksel yaklaşımlara (TF-IDF, Latent Dirichlet Allocation) ve stilometrik yöntemlerle birlikte çeşitli mimarilere sahip derin öğrenme tekniklerine (CNN, LSTM, BERT) dayanmaktadır (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). Bildirilen sonuçlar; sınıf sayısına (toksisite türleri, yazarlar), türe, metnin uzunluğuna ve en önemlisi, eğitim işleminde kullanılan uygun biçimde açıklanmış metin derleminin hacmine son derece bağlıdır. Bu nedenle toksisite ve nefret söylemi tespiti görevlerinde yüksek doğruluk oranları, on binlerce belge içeren bir derlem kullanıldığında%90’ı aşmaktadır (Alkomah, Ma 2022). Örneğin, 1000 yazar arasındaki İngilizce edebî eserlerde yazarlık atfında%90’dan fazla doğruluk, 15 yazara ait 6000 belgeden oluşan bir derlem kullanılarak elde edilmiştir. Buna karşılık, 1500’den az belge içeren derlemlerde bildirilen doğruluk yaklaşık%70’tir (Khan et al. 2023). Ukrayna dili için metin yazarlığının belirlenmesi ve duygu/toksisite analizi yeterince araştırılmamış sorunlardır (Lupei et al. 2020); ayrıca bu tür sistemler dilbilimsel uzmanlık üretmemekte ve dilbilimsel araştırma araçları olarak kullanılamamaktadır. 3. TEXTATTRIBUTOR SİSTEMİNİN İŞLEYİŞİNE İLİŞKİN GENEL ÖZELLİKLER TextAttributor’ın geliştirilmesi sırasında şu görevler gerçekleştirilmiştir: 1) Kuramsal Dilbilim: biçimselleştirilmiş morfolojik, istatistiksel, stilometrik, atıfsal ve duygu analizleri için bir yöntem geliştirilmiştir; 2) Yazılım Mühendisliği: yukarıda anılan otomatik analizler için dilbilimsel veri tabanlarının ve yazılımın yapısı geliştirilmiştir; 3) Deneysel Dilbilim: sistem Ukrayna medya metinleri üzerinde sınanmış ve 228 Acta Linguistica Lithuanica XCI Ukrayna Medya Metinlerinin Otomatik Stilometrik Analizi Sistemi TextAttributor 1.0 (Yöntemler, Araçlar, İşlevsellik) otomatik stilometrik inceleme için bir analitik modül uygulanmıştır. Bir web uygulaması olarak uygulanan otomatik dilbilimsel sistem, kullanıcı tarafından girilen medya üslubundaki metinleri işleyerek metnin özelliklerini niteleyen istatistiksel parametreler için sayısal değerler üretir. Sistem, yapılandırılmış bir işlem dizisini izler: 1. Metin Tokenleştirme: Metni analiz için cümlelere ve sözcüklere ayırma. 2. Morfolojik Etiketleme: Sözcüklere dilbilgisel biçimlerine göre etiketler atama. 3. Bağlamsal Analiz: Morfolojik etiketleri bağlama göre güncelleme. 4. Sözdizimsel Analiz: Dilbilgisel yapılarını anlamak için cümlelerdeki sözcükler arasında ikili ilişkiler kurma. 5. Sözdizimsel İlişki Kurma: Önceden tanımlanmış kurallara dayalı sözdizimsel bağlantıları belirleme. 6. Duygusal Açıdan Olumsuz Söz Varlığı Eşleştirme: Önceden tanımlanmış bir olumsuz söz varlığı kümesindeki sözcükleri belirleme. 7. İstatistiksel Parametre Değerlendirmesi: Otomatik olarak derlenen sıklık söz varlıklarını kullanarak girdi metnine ilişkin istatistiksel parametreleri değerlendirme. 8. Sonuçların Görselleştirilmesi: İstatistiksel parametreleştirme sonuçlarını ampirik değerler ve güven aralıklarıyla birlikte grafiksel olarak sunma. 9. Sonuçların Karşılaştırılması: İki medya üslubundaki metin için istatistiksel parametreleştirme sonuçlarını görselleştirerek karşılaştırmayı kolaylaştırma. 10. Öklid Uzaklığı Değerlendirmesi: İki medya üslubundaki metin arasındaki farklılığı nicelleştirme. 11. Uzman Görüşü Oluşturma: Biri metin atfı, diğeri ise dilbilimsel inceleme yoluyla metin toksisitesi hakkında olmak üzere iki uzman görüşü oluşturma. 12. Toksisite Tespiti ve Yazarlık Belirleme: Toksisiteyi tespit etmek ve yazarları belirlemek için makine öğrenmesi tekniklerinden, özellikle sinir ağı modellerinden yararlanma. Sistemin sonuçları şu bölümlerde düzenlenmiştir: Metin Atfı İndeksi Grubu, Metin Atfı Uzman Görüşü, Metin Atfının Karşılaştırılması, Metin Toksisitesinin Dilbilimsel Uzmanlığı ve Sinir Ağı Görüşleri. Metin Atfı İndeksi Grubunda (Şek. 1) istatistiksel parametreler, girdi metnine göre düzenlenmiştir: 1. sütunda İndeks başlığı, 2. sütunda ampirik sayısal değer, 3. sütunda ise indeksin ampirik değerinin güven aralığıyla karşılaştırılması yoluyla görsel bir gösterim sunulur Straipsniai / Articles 229 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK Ukrayna medya üslubundaki metinlerden türetilen alt ve üst eşikler. Ampirik sayısal değer, ölçek üzerinde içi dolu ters üçgenle gösterilir. ŞEKİL 1: Metin atfı sonucunun bir bölümü Metin Atfı Uzman Görüşünde (Şek. 2), tahmin edilen her indeks için analiz edilen metinden çıkarılan tipik veya bireysel dilbilimsel-istatistiksel özelliklere ilişkin sonuçları sunuyoruz. Bu sonuçlar şu soruya verilen yanıtlardan elde edilir: İndeksin sayısal değeri Ukrayna dilinin medya üslubuna ait güven aralığı içinde midir? Sistem, sayısal değerlerin güven aralığının eşik değerleriyle karşılaştırılmasına dayanarak üç olası yanıt üretir (medya üslubunun tipik işaretleri, idyolekt işaretlerinin normal medya üslubundan düşük olması ve idyolekt işaretlerinin normal medya üslubundan yüksek olması). Metin Atfının Karşılaştırılmasında (Şek. 4, 4.2 alt bölümü), “Vektör Uzaklığını Hesapla” seçildiğinde tablo verileri derhâl şu şekilde güncellenir: 1. sütunda kullanıcı tarafından girilen metinler ve daha önce analiz edilmiş metin listelenir; 2. sütunda her metindeki cümle sayısı gösterilir; 3. sütunda sözcük sayısı verilir; 4. sütunda analiz edilen metin ile tablodaki her metin arasındaki Öklid uzaklığı sunulur; “Karşılaştır” olarak etiketlenen 5. sütun, analiz edilen metin ile seçilen metin arasındaki istatistiksel indekslerin otomatik karşılaştırmasını başlatır. İlgili “Karşılaştır” öğesi etkinleştirildiğinde, iki metin arasındaki istatistiksel karşılaştırmaya ilişkin kapsamlı bilgiler “Metin Atfı İndeksleri” grubunda (Şek. 3) sunulur. 230 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) ŞEKİL 2: Oluşturulan uzman görüşü örneği Metin Toksisitesinin Dilbilimsel Uzmanlığında (4.3 alt bölümü), hesaplanan toksisite indeksinin sözlüksel-anlamsal yorumu sunulmaktadır (Şek. 6). Sinir Ağı Görüşlerinde, metin toksisitesini 0’dan (toksik olmayan) 1’e (yüksek toksisite) kadar bir ölçekte nicelleştiren derin öğrenme modelimizin çıktısını sunuyoruz. Ayrıca, modelin eğitildiği yazarlara dayanarak, bilinen yazarlara göre metin benzerliğini 0’dan (hiç benzerlik yok) 1’e (yüksek benzerlik) kadar değişen değerlerle değerlendiriyoruz. Sonuçlar yalnızca benzerlik ölçüsü 0,1’i aşan testler için gösterilir. Mevcut sistemimiz, kullanıcı tarafından girilen metinle benzerliği ölçmek üzere sınırlı bir yazar metinleri derlemi kullanan demo modunda çalışmaktadır. 4. UKRAYNACA METİNLERİN ATFI: DENEYLER, SONUÇLAR VE TARTIŞMALAR 4.1. İstatistiksel Parametreleştirme İndeksleri Geliştirilen stilometrik model iki görevi çözmektedir: 1) Bir yazarın üslubunun bireysel özelliklerini belirlemek (stilometri); 2) Dilbilimsel ve istatistiksel parametrelere dayanarak iki metin arasındaki benzerliği değerlendirmek (atıf). Straipsniai / Articles 231 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK Kullanıcının girdiği metni istatistiksel olarak analiz etmek için 19 parametre kullanılmaktadır (Metin Atfı İndeksi Grubu için Şek. 1’e bakınız). İlk dört parametre temel nicel verileri kapsar: sözcük sayısı, işlenmemiş sözcükler, sözlük büyüklüğü ve cümle sayısı. Sözcük sayısı; diyalektizmler, Moskova kökenli kullanımlar, okajyonalizmler vb. gibi sistem tarafından işlenmeyen söz varlığını içermez. Kalan 15 parametre, skaler nicelikler üreten hesaplanabilir indekslerden oluşur. Stilometrik analiz için Hipotez 1’i doğrulayacağız. Bu hipoteze göre, Ukrayna medya üslubunun güven aralığı içinde ve dışında yer alan istatistiksel parametreleri kapsayan ampirik verilerin analiz edilmesiyle, belirli bir medya metnindeki özgün yazarsal özellikleri ayırt etmek mümkündür. Her dilbilimsel parametre için Ukrayna medya metni örneklerine dayanarak iki güven aralığı hesaplanmıştır: biri 1000 sözcükten uzun metinler için (örneklem büyüklüğü: 124,576 sözcük), diğeri 1000 sözcüğe kadar olan metinler için (örneklem büyüklüğü: 15,635 sözcük). Her istatistiksel parametre için güven aralığı, metin örneklemindeki İndeksin Ortalama Sayısal Değerinin (ANVI) standart sapması σ kullanılarak ANVI ± σ biçiminde belirlenmiştir. Standart sapma, istatistiksel indekslerin ampirik sayısal değerlerinin medya üslubundaki indeksin ortalama sayısal değerinden ne ölçüde sapabileceğini tahmin eder. Doğruluğu sağlamak amacıyla σ için güven aralığı, dilbilimsel ve istatistiksel bir deney yoluyla belirlenmiştir. Sonuç olarak sistem, Hipotez 1 sınanırken üç olası sonuç sunar: 1) indeksin sayısal değeri güven aralığı içindedir; 2) indeksin sayısal değeri aralığın alt eşiğinin altındadır; veya 3) indeksin sayısal değeri üst eşiği aşmaktadır. Blogger Oleksii Honcharenko tarafından kaleme alınan Metin 1’in parametreleştirilmesinden elde edilen sonuçları ele alalım (bkz. Şek. 1). Bu analiz, Şek. 2’de gösterilen oluşturulmuş uzman görüşünde somutlaştırılan istatistiksel parametrelere ve bunların sonraki yorumuna dayanmaktadır. Söz varlığı ve metin hacmine ilişkin istatistiksel ölçütler nicel bir ilişki ortaya koymaktadır. Metin 1’de tüm bu göstergeler medya üslubu için tipik aralık içindedir: 1) Çeşitlilik İndeksi (IB), benzersiz sözcüklerin toplam metin büyüklüğüne oranını ifade eder ve sözlüksel zenginliğin bir ölçüsü olarak işlev görür. 0,54’lük IB değeri%30–%60 aralığı içinde yer almakta ve orta düzeyde sözlüksel çeşitliliğe işaret etmektedir; 2) Metin Özgünlüğü İndeksi (IVT), metinde bir kez geçen hapax legomena sayısının metin hacmine oranını ifade eder. 0,36’lık IVT%20–%40 aralığı içinde yer almakta ve düşük sözlüksel özgünlüğe işaret etmektedir); 232 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 3) Söz Varlığı Özgünlüğü İndeksi (IVL), metinde yalnızca bir kez geçen hapax legomena sayısının toplam söz varlığı hacmine oranını ifade eder. 0,66’lık IVL%60–%76 aralığı içinde yer almakta ve yüksek derecede sözlüksel özgünlüğe işaret etmektedir. Şimdi Metin 1’deki sözlüksel ve dilbilgisel sözcük sınıflarının nicel korelasyonuna ilişkin istatistiksel parametreleri ele alalım: 1) İsimsel Öznitelikler İndeksi veya Epithetleştirme (IIO), isim sayısının sıfat sayısına oranını ifade eder. 1,07’lik IIO, medya üslubu normu olan 1,0’dan yüksektir; bu, metinde isimlerin sıfatlara baskın olduğunu ve bunun sonucunda daha az epitet bulunduğunu gösterir; 2) Fiil Öznitelikleri İndeksi (IDO), zarfların fiillere oranını ifade eder. 0,57’lik IDO, medya üslubu normu olan 0,56’dan yüksektir. Bu zarf oranı, metindeki fiil özniteliklerinin düşük derecede olduğunu gösterir; 3) İsimleştirme Derecesi (STN), isim sayısının fiil sayısına oranını ifade eder. 1,76’lık STN, medya üslubu normu olan 3,00’dan düşüktür. Bu indeksteki azalma, fiillerin isimlere baskın olduğunu ve metnin isimleştirme derecesinin düşük olduğunu gösterir; 4) Zamirleştirme İndeksi (IPRO), kişi zamiri sayısının metindeki sözcük kullanım hacmine oranını ifade eder. 0,09’luk IPRO, medya üslubu normundan yüksektir ve idiyostilin bir göstergesidir. Kişi zamirleri metnin%7’sinden fazlasını oluşturur; bu da metindeki bağlaşıklık derecesini gösterir; 5) Kiplik İndeksi (MOD), parçacık sayısının metindeki sözcük sayısına oranını ifade eder. 0,07’lik IMOD, medya üslubu normu olan%4’ten yüksektir ve idiyostilin bir göstergesidir. Parçacıklar metnin%4’ünden fazlasını oluşturur; bu da yazarın metinde olgulara ve durumlara yönelik çeşitli değerlendirmeleri ne ölçüde ifade ettiğini belirler; 6) Tözlülük İndeksi (ISUB), isim sayısının metindeki sözcük kullanım hacmine oranını ifade eder. 0,26’lık ISUB, medya üslubu normundan düşüktür. İsimler metnin%30’undan azını oluşturur; bu da metnin durağanlık derecesinin düşük olduğunu belirler. Text 1’deki öbeklerin ve cümlelerin nicel oranına ilişkin istatistiksel parametreleri açıklayalım: 1) Devingenlik İndeksi (IDYN), fiil öbeklerinin isim öbeklerine oranını ifade eder. 0,74’lük IDYN, medya üslubu normu olan 0,6’dan yüksektir ve idiyostilin bir göstergesidir. Fiil öbeklerinin isim öbeklerine baskın olması (IDYN’in 1,0’dan büyük olması), metnin anlamındaki olayların dinamik ve hızlı biçimde gelişmesini belirler; Straipsniai / Articles 233 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 2) Bağlaşıklık İndeksi (IZV), edat ve bağlaç sayısının metindeki cümle sayısına oranını ifade eder. 0,66’lık IZV, medya üslubu için 0,45 ile 0,90 arasındaki tipik aralıkta yer alır; bu, cümle sayısının edat ve bağlaç sayısına baskın olduğunu gösterir. Bu durum, Text 1’de betimlenen gerçeklikler, olgular ve durumlar arasındaki ortalama bağlaşıklık derecesini belirler. Text 1’de psikodilbilimsel istatistiksel parametrelere (Chuhunov 2009) özel dikkat gösterilecektir: 1) Trager katsayısı (KT), metindeki fiil sayısının sıfat sayısına oranını ifade eder ve konuşurun duygusal istikrarını/istikrarsızlığını gösterir. 0,61’lik KT, medya üslubu normu olan 0,5’ten yüksektir ve idiyostilin bir göstergesidir. Psikolojik yoruma göre bu, yazarın/konuşurun düşük duygusallığına, etkin pratik eylemlerde bulunma konusundaki kararsızlığına ve kaygısına işaret eder. 1,35 ± 0,05 aralığındaki değer, yazar için normal duygusal istikrarı ve düzenlemeyi belirler; 2) Eylem Kesinliği Katsayısı (KOD), metindeki fiil sayısının isim sayısına oranını ifade eder. Bu oran, yazarın toplumsallaşma derecesini ve ifadenin sözdizimsel bütünlüğünü gösterir. 0,57’lik KOD, medya üslubu için 0,30 ile 0,60 arasındaki tipik aralıkta yer alır ve nesneleştirilmiş eylem katsayısının düşük derecede olduğunu gösterir. Psikolojik yoruma göre bu, yazarın/konuşurun düşük duygusallığına, etkin pratik eylemler konusundaki kararsızlığına ve kaygısına işaret eder. 1,35 ± 0,05 aralığındaki bir değer, yazarın normal duygusal istikrarını ve duygu düzenlemesini belirler; bu da dilsel özelliklere dayanarak cümlelerde normal düzeyde sözdizimsel bütünlüğe ve doğru sözdizimsel yapıya işaret eder; 3) Saldırganlık Katsayısı (KA), fiil sayısı ile fiil kullanımının metindeki toplam sözcük sayısına oranını ifade eder ve psikodilbilimsel açıdan dilin saldırganlığını gösterir. 0,15’lik KA, medya üslubu normu olan%13’ten yüksektir ve idiyostilin bir göstergesidir. Psikolojik yoruma göre%60’ın altındaki değerler düşük saldırganlık derecesine, yazarın bastırılmış duygularına ve kararsızlığına işaret eder.%60’a yaklaşan değerler, yazarın normal saldırganlık ve duygusal istikrar derecesini belirlerken,%60’ın üzerindeki değerler yazarın yüksek saldırganlığına ve duygusal heyecanına işaret eder. Son olarak Text 1’in anlamsal istatistiksel parametresini ele alalım: Metin Toksisitesi İndeksi (ITOX), metindeki negatif söz varlığının sıklığından hesaplanır (ayrıntılar için bkz. bölüm 4.3). 0,36’lık ITOX değeri, medya üslubu için 0,1 ile 0,7 arasındaki tipik aralıkta yer alır. ITOX, negatif duygulara yönelik bilişsel ve pragmatik tutumları biçimlendirir. 234 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 4.2. İstatistiksel parametrelerle metin karşılaştırması İki metin arasındaki benzerlik derecesini değerlendirme görevi, Hipotez 2’nin sınanmasını içeriyordu. Bu hipotez, iki metnin istatistiksel parametreleştirilmesinden elde edilen ampirik veriler indislerin sayısal değerlerinde yalnızca küçük bir fark gösteriyorsa, bu metinlerin aynı yazara ait olduğunu ileri sürer. Bu hipotez sistem içinde iki şekilde sınanır: 1) iki metindeki her indeksin sayısal değerlerini karşılaştırarak; 2) iki metin arasındaki vektör uzaklığını belirleyerek. Bu işlemler Metin Atıflarının Karşılaştırılması bölümünde uygulanmıştır. İlk görev, metinlerin ampirik verilerinin medya üslubu güven aralığı ölçeğindeki indisler kullanılarak karşılaştırılmasını içerir (Fig. 3). Fig. 3’te gösterildiği üzere, her iki metnin parametrelerinin nicel özellikleri, kullanıcının kolaylığı için farklı renklerle gösterilir. Görselleştirme, her iki metnin indislerine ait ampirik değerleri, Ukrayna medya üslubu metinlerinden türetilen güven aralığı sınırlarıyla (alt ve üst) karşılaştırır. FIGURE 3: Metinlerin vektör uzaklığının karşılaştırılması İkinci görev, Öklid uzaklığı formülü kullanılarak iki metin arasındaki vektör uzaklığının hesaplanmasıdır. Bu işlem, iki metnin 15 istatistiksel parametresinin sayısal değerleri arasındaki farkların karelerinin toplanmasını içerir. Ardından bu toplamın karekökü hesaplanır. Sayısal değerler Straipsniai / Articles 235 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK vektör uzaklığının değerleri, metinler arasındaki istatistiksel farklılığın derecesini gösterir ve aralarındaki uzaklığın bir ölçüsünü sağlar. Medya metinleri için vektör uzaklığı değerindeki dalgalanmalar iyi bilinmemekle birlikte, özdeş metinler karşılaştırıldığında uzaklık 0 olabilir. Bu, vektör uzaklığı 0’dan büyükse metinlerin farklı olduğu anlamına gelir. Ayrıca vektör uzaklığının sayısal değeri ne kadar büyükse, metinler arasındaki dilsel ve istatistiksel farklılıklar da o kadar büyüktür. Öklid uzaklığı karşılaştırması tablo biçiminde sunulur. Fig. 4’ün 4. sütununda sayısal değerler Öklid uzaklıklarını temsil eder. Fig. 4, Oleksii Honcharenko’ya ait analiz edilen metin (Text 1) ile aynı yazarın diğer üç metni arasındaki karşılaştırmayı gösterir: Text 2 için 1. satır (uzaklık 0,44); Text 3 için 2. satır (uzaklık 0,56); Text 4 için 3. satır (uzaklık 0,77). Ampirik veriler, tek bir yazara ait metinler arasındaki benzerliğin 1’in altında kaldığını, diğer yazarlara ait metinlerin ise (4–10. satırlar) 1’den büyük uzaklıklar sergilediğini göstermektedir. FIGURE 4. Metinler arasındaki Öklid uzaklığının sistemleştirilmesi Metinlerin istatistiksel parametrelerinin karşılaştırılması, önerilen atıf metodolojisinin Ukraynaca metinlerin stilometrik bir modelini ortaya koyduğunu göstermektedir. Bu model, metnin yazarlığını belirlemek için de kullanılabilir. Bunu, Uniform Manifold Approximation and Projection (UMAP) yöntemi kullanılarak 15 istatistiksel parametreye göre üç farklı yazara ait 7 metnin atfının görsel sunumuyla doğrulayacağız (McInnes et al. 2020); algoritması da TextAttributor sisteminde uygulanmıştır. Bu 236 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) teknik, 15 boyutlu bir uzayı düzleme yansıtarak özellik uzayının boyutluluğunu azaltmayı sağlar. Fig. 5’te farklı şekillerdeki noktalar (Yazar 1 için P1–P7, Yazar 2 için F1–F7, Yazar 3 için M1–M7), farklı yazarlardan rastgele seçilmiş 7 metne karşılık gelir. Gördüğümüz gibi, boyutluluk azaltıldıktan sonra üç yazara ait metinlerin nokta eşlemeleri görünür biçimde ayrı alanlara ayrılabilir. Bu örnek, TextAttributor tarafından tanımlanan parametrelerin metinlerin üslup özelliklerini betimlemek ve metnin yazarlığını belirlemek için önemli olduğunu (indirgenmiş biçimde dahi) doğrular. FIGURE 5: UMAP yöntemi kullanılarak metin atfının grafiksel gösterimi 4.3. Metnin negatif duygulanımının indekslenmesi Metnin üslubunu ve yazarlığını belirlemek için bir istatistiksel parametreler sistemi geliştirirken, metin toksisitesinin bir atıf indeksi olarak işlev görebileceğini fark ettik. Bu nedenle TextAttributor’da toksisite indeksini otomatik olarak belirlemek üzere ayrı bir modül oluşturduk. Straispsniai / Articles 237 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK Günümüzde bilgi bileşeni hibrit savaşta özellikle önemli hâle gelmiştir. Bu nedenle çalışmamızın materyalini, 10 milyon sözcük hacmine sahip, siyasal söylemin çevrim içi medya metinlerinden oluşan bir araştırma derlemi oluşturmuştur. “Toksik metin” terimini geniş anlamda kullanıyoruz. Bu metinler taciz, tehdit, müstehcenlik, siber zorbalık, trolleme ve kimliğe dayalı nefret metinleriyle karakterize edilir; ayrıca bir kişide negatif duygulara yol açan olgular ve nesneler olan ifadeler içerir (örn. war, air raid, corruption). Bu projenin amacı, Ukraynaca metinlerde negatif duygulanımın gerçekleşme potansiyelini belirlemek ve toksik içeriği tanımlamak için otomatik bir sistem geliştirmekti. Bu görev art arda gelen iki alt görevden oluşuyordu: ilk olarak, sözlük çözümlemesi ve kural tabanlı yöntemlerle toksisite indislerini belirleyen bir toksik metin dilbilimsel inceleme sistemi geliştirmek; ikinci olarak, makine öğrenmesi amacıyla bir eğitim veri kümesi oluşturmak ve metin toksisitesi indislerini öngören bir sinir ağı geliştirmek. İlk görevin tamamlanışına bakalım. Bu görev, üç farklı sözlüğü barındıran bir leksikografik veri tabanının oluşturulmasını içeriyordu: 1) Emotiogen sözlüğü: −2 ölçeğinde derecelendirilmiş, negatif duygulanım tonlarına sahip (sözlüksel-anlambilimsel varyantların anlamlarına göre) 5000 sözcükten oluşan derleme. Örnekler arasında immoral, impunity, bribery ve steal bulunur; 2) Nefret Söylemi Sözlüğü: kişi adları (1620), müstehcen terimler (613) ve aşağılayıcı dil (787) dâhil 3000 sözcükten oluşur. Örnekler arasında westerner (западенець: Ukrayna’nın batı bölgelerinden gelen insanlar için aşağılayıcı bir ad) ve huckster bulunur; 3) Toksik Öbekler: negatif duyguları ifade eden 1500 deyimsel ifadeden oluşan derleme. Örnekler arasında grimaces like a monkey, kisses his arse and opens his mouth bulunur. Bu listelerdeki her madde anlamsal özelliklerle etiketlenmiştir; Nefret Söylemi Sözlüğü 18, Toksik Öbekler listesi ise 26 özelliğe sahiptir. Örneğin, Nefret Söylemi Sözlüğü’ndeki sözcükler cinsiyetçilik için ‘s’, ırkçılık için ‘r’ ve yaşçılık için ‘e’ gibi özelliklerle etiketlenmiştir. Çok parametreli bir sistem olan bu leksikografik veri tabanı, birimlere (sözcük veya öbeklere) anlamsal özellikler atar; bu özellikler, çözümlenen metinden elde edilen sıklık verileriyle birleştirildiğinde toksisite çözümlemesine olanak tanır. Metnin toksisite indeksi şu formül kullanılarak hesaplanır: Itox = (e + |K| (m + t)) / n * 10, Burada n metin hacmidir; e duygusal sözcüklerin sayısıdır; m nefret söylemi sözcüklerinin sayısıdır; t toksik öbeklerin sayısıdır; K −2’ye eşit bir katsayıdır; nefret söylemi sözcüklerini ve beş haneli bir ölçekte 238 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) (+2, +1, 0, −1, −2) −2’ye karşılık gelen toksik öbekleri vurgular. İndeks değerleri 0 ile +1 arasında değişir. Örneğin, “People with a red pen (Люди з червоною ручкою)” metninin (12 cümle, 129 sözcük) toksisite indeksi 1,01’dir; bu, kısa metinler için eşik 0,1 ile 0,7 arasında olduğundan yüksek toksisiteye işaret eder. Aynı zamanda sistem, metin toksisitesinin otomatik dilbilimsel incelemesinin sonuçlarını da üretir (bkz. Fig. 6); bu sonuçlar şunları içerir: 1) leksikografik listelerin sınıflandırma işaretlerine göre negatif söz varlığının anlamsal sınıflarının istatistiksel haritası (emotiyojenler – 5, vulgarizmler – 2, cinsiyetçilik – 2); 2) istatistiksel haritanın kategorilerini sözlü olarak gerçekleştiren, negatif duygulanıma sahip belirli sözcükleri içeren bir metin. İncelenen gerçek yaşam metninden bir alıntıya bakalım (Fig. 6): kırmızı kalemle dolaşıp hataları düzelten başkalarının gönderilerindeki: siz kimsiniz ki? Ne kadar sinir bozucu olduğunuzu biliyor musunuz? Profillerinizi özellikle inceliyorum; içinde bulunduğunuz dünya ilgimi çekiyor. Bu dünya korkutuyor beni çok. Gerçek hayatta hiçbir koşulda yollarımızın kesişmemesini içtenlikle umuyorum. (kırmızı kalemle dolaşıp başkalarının gönderilerindeki hataları düzeltenler: siz kimsiniz ki? Ne kadar sinir bozucu olduğunuzu biliyor musunuz? Profillerinizi özellikle inceliyorum; içinde bulunduğunuz dünya ilgimi çekiyor. Bu dünya beni çok korkutuyor. Gerçek hayatta hiçbir koşulda yollarımızın kesişmemesini içtenlikle umuyorum). Burada sistem, negatif bileşen taşıyan şu sözcükleri otomatik olarak kalın yazıyla vurgular: hatalar (помилки), başkalarının (чужих), sinir bozucu (бісите), korkutuyor (лякає). FIGURE 6: Metin toksisitesinin otomatik dilbilimsel incelemesinden bir kesit Straipsniai / Articles 239 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 5. MAKİNE ÖĞRENMESİ YAKLAŞIMLARI: DENEYLER, SONUÇLAR VE TARTIŞMALAR TextAttributor sisteminin makine öğrenmesi tekniklerine ayrılmış ikinci çalışma kipine odaklanalım. Model eğitimi girdisinde, her alt görevin amacına göre etiketlenmiş metin derlemlerimiz vardır: (a) toksisite tespiti için metinsel bilgi ve (b) yazarlık belirleme. Her derlem eğitim ve kontrol kümelerine, yeterince büyük derlemler için ayrıca bir doğrulama kümesine ayrılır. Seçilen problem çözme modelinin parametreleri eğitim kümesi üzerinde tahmin edilir. Modelin hiperparametreleri doğrulama kümesiyle ayarlanır. Modelin nihai performans göstergeleri, modelin çalışabilirliği için gerekli bilgi işlem kaynaklarının kullanılabilirliği dikkate alınarak bir kontrol kümesi üzerinde ölçülür. Her alt görev için bir derlem, TextAttributor makine öğrenmesi bileşeniyle eş zamanlı olarak geliştirilmiştir; bu nedenle mevcut modeller, Ukraynaca blogların, yorumların, makalelerin vb. kısa internet metinlerini içeren görece küçük veriler üzerinde eğitilmiştir. 5.1. Toksisite tespiti Bir dizi deneysel çalışmanın sonucunda, fastText yöntemi ve araçlarına (Joulin et al. 2016) dayalı, hesaplama açısından verimli bir mimari seçilmiştir. Bu yöntem, sözcük gömmeleri sağlar ve belgelerin önceden tanımlanmış sınıflara göre olasılık dağılımını tahmin eder. Sözcükler, sözlüğün açıklığını taklit eden, sözcüklerin parçalara (alt sözcüklere) otomatik olarak bölünmesine dayalı vektör biçiminde sunulur. Ukraynacanın oldukça çekimli olması ve görülmemiş sözcüklerin yanı sıra yazım hatalı sözcüklerin de kapsanması gerektiği için alt sözcük sunumu önemlidir. Kullanılan yaklaşımın etkililiği, sistemin çalışma teknik koşulları ve model eğitimi için mevcut metinsel kaynaklar tarafından da belirlenir. Toksik içeriği tespit etmek üzere ikili sınıflandırma için yaklaşık 12.000 metin belgesinden oluşan hazırlanmış bir derlem kullanılmıştır. Genelleştirilmiş metriğe göre en iyi sonuç (F1 =%79,4), şu hiperparametre ayarlarıyla elde edilmiştir: 56 sözcüklük vektör boyutu, 0,15 başlangıç öğrenme hızı, 500 eğitim epoku, bigramlarla temsil edilen sözlüksel bağlam, 2 ile 5 karakter arasında değişen alt sözcük uzunlukları ve 0,4 karar eşiği. Ayrıca model, yaklaşık%70 doğruluk elde ederken%85 duyarlılık göstermiştir. 240 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 5.2. Yazarlık belirleme Metin yazarlığını belirlemeye yönelik modellerin deneysel araştırması, belgenin yazarının belirlenebildiği, kamuya açık sosyo-politik metinler derleminin bir bölümü kullanılarak gerçekleştirilmiştir. 60 ile 1000 karakter arasında en fazla belge yayımlayan dört yazara ait toplam 702 metin seçilmiştir. Yazar başına en fazla yayın sayısı 304 (115 bin karakter), en az yayın sayısı ise 109’dur (49 bin karakter). Test için, seçilen her yazarın 25 metni rastgele örneklenmiştir. Geri kalan belgeler eğitim kümesini oluşturmuştur. Genelleştirilmiş metriğe göre en iyi sonuç (F1 =%81), şu hiperparametre değerleriyle elde edilmiştir: 50’lik sözcük gömme uzayı boyutu, 0,1 başlangıç öğrenme hızı, 50 eğitim epoku, bigramlarla temsil edilen sözlüksel bağlam, 2 ile 5 karakter arasında değişen alt sözcük uzunlukları ve 0,5 karar eşiği. Dikkat çekici biçimde, bazı model yapılandırmalarında veri kümesinde en fazla belgeye sahip yazara yönelik duyarlılık%100’e ulaşmış ve doğruluk%90’ı aşmıştır. Bu sonuçlar, eğitim kümesinde yeterince temsil edilen yazarların metinlerini doğru biçimde kapsayabilen etkili bir sistem geliştirmenin uygulanabilir olduğunu göstermektedir. Eğitilmiş sinir ağı modelleri TextAttributor sistemine “istemci-sunucu” mimarisiyle entegre edilmiştir; burada iki görevin sonuçları sunulur: (a) toksisite belirleme ve (b) yazarlık tespiti. “Ukrayna’nın Yükseköğretim Kanunu” metni üzerinde sistemin çalışmasının sonucu: Toksisite indeksi (metnin ne kadar toksik olduğuna ilişkin olasılık biçimindeki tahmin) – 0,04; yazarlarla benzerlik (sistem tarafından bilinen yazarlar için yazarlık olasılığı biçimindeki tahminler): I. Farion için 0,49, Oleksii Honcharenko için 0,30 ve Mariana Bezugla için 0,22. 6. SONUÇLAR TextAttributor sistemi şu anda Ukraynaca metinlerde atıf ve toksisite belirleme sorunlarını ele almak üzere test aşamalarından geçmektedir. Bu sistem çeşitli teknolojik çalışmalar için hem kullanışlı hem de etkilidir. TextAttributor web uygulaması 5 ay içinde 226 kullanıcı tarafından 784 Ukraynaca metni otomatik olarak analiz etmiştir. Bulgularımız, özellikle negatif duygusallık bakımından, sözlü unsurların biçimsel dilbilgisel ve anlamsal parametrelere dayalı olarak nicemlenmesini içeren yöntemimizin etkililiğini göstermektedir. Bu, makine öğrenmesiyle tamamlanan sözlük ve kural tabanlı yaklaşımların birleşimiyle gerçekleştirilir Straipsniai / Articles 241 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK teknikleri. Toksisite tespiti ve metne göre yazarlık belirleme üzerine yapılan deneysel makine öğrenmesi araştırması, diğer diller için bildirilen benzer model özelliklerine (belge ve yazar sayısı) sahip deneylerin sonuçlarıyla karşılaştırılabilir sonuçlar elde etmemizi sağladı. Alt sözcük modelleri, sözlüksel açıklığa ve metinsel hatalara karşı daha yüksek dayanıklılık gösterdi. Yürütülen araştırma, Ukraynaca için toksik içeriğin, nefret söyleminin ve yanlış bilginin tespit edilmesi ve izlenmesi, yazarlığın doğrulanması ve gizli yazarlığın açığa çıkarılması, yazar profilleme ve konuşmacı bölütleme, psikodilbilimsel profilleme, üslup modelleme ve sahte içeriğin kaynağının izlenmesi gibi sorunların çözümüne giden yolu açmaktadır. Geliştirilen metin çözümleme ve atıf şeması başka dillere de uygulanabilir. İleriye dönük olarak otomatik metin atfı ve toksisite tespit aracımızı anlambilimsel, sözdizimsel, psikodilbilimsel ve toplumdilbilimsel çözümlemeyle bütünleştirmeyi planlıyoruz. Bu bütünleştirme, okuyucu üzerindeki etkiyi daha derinlemesine anlamamızı sağlayacaktır. Sözcüksel taksonominin anlamsal çözümlemesini kullanarak metne özgü anlatı unsurlarını belirlemeyi ve böylece yazarlık belirleme işlemlerinde metin atfının güvenilirliğini artırmayı amaçlıyoruz. Ayrıca metin derlemlerimizi genişletmeyi ve sistemimizin yeteneklerini daha da geliştirmek için çok dilli büyük dil modellerinden yararlanmayı; bunun yanı sıra Ukrayna dilinin tüm üslupları için istatistiksel metin karşılaştırma araçları uygulamayı planlıyoruz. Teşekkürler Sistem, Kyiv’deki Britanya Büyükelçiliği tarafından desteklenen ve Taras Shevchenko Kyiv Ulusal Üniversitesi Ukrayna Dili ve Uygulamalı Dilbilim Kürsüsü eğitimcileri ile araştırmacılarından oluşan bir ekip tarafından yürütülen bir proje kapsamında oluşturulmuştur. Bu araştırma projesine verdikleri mali destek için Kyiv’deki Britanya Büyükelçiliğine içten teşekkürlerimizi sunarız. Proje boyunca rehberlikleri ve yardımları için Svitlana Yavorska ve Iryna Bezkorovayna’ya minnettarız. Projenin organizasyonu ve belgesel desteği için Kostiantyn Goncharenko’ya özel teşekkürlerimizi sunarız. Ayrıca Taras Shevchenko Kyiv Ulusal Üniversitesi’nin “Uygulamalı (Bilgisayar) Dilbilim ve İngiliz Dili” eğitim programı öğrencilerine minnettarız. Ukraynaca toksik metinler derleminin oluşturulmasına zamanlarını, uzmanlıklarını ve emeklerini kattılar. Lisans programımızdan mezun olan Oksana Tolochko’ya, negatif emotikonların leksikografik listesini derlemek için kullandığımız Ukraynaca ton sözlüğünü oluşturduğu için teşekkür ederiz. Ayrıca veri toplama sürecinde Mykola Kostikov’un gösterdiği çabaları derinden takdir ediyoruz. Bu çalışmaya tavsiye ve danışmanlıklarıyla katkıda bulunan araştırma topluluğunun tüm üyelerine içten minnettarlığımızı ifade etmek isteriz. 242 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) REFERENCES ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/. Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273. Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003. Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038. Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv]. Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267. Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146. Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100. Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka. Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265. Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of Straipsniai / Articles 243 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01. Darčuk Natalija 2013: Komp’juterne anotuvannja ukrajin’s’koho tekstu: rezul’taty i perspektyvyj, Kyiv: Osvita Ukrajiny. Darčuk Natalija, Vasyl’jeva Iryna, Vasyl’jev Oleksij 2021: Vektorna model’ analizu stylistyku tekstiv. – Ukrajins’kyj fizičnyj žurnal 66(5), 373–378. Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066. Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036. Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308. Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935. Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453. Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80. Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296. Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, Jégou Hervé, Mikolov Tomas 2016: FastText.zip: Compressing text classification models. – ArXiv e-prints 1612.03651. DOI: 10.48550/arXiv.1612.03651. 244 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264. Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565. Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf. KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx. LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app. Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500. Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041. McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426. Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt. Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031. Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047. Straipsniai / Articles 245 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts. Available at: ta.mova.info. Volos Yana, Levchenko Olena 2023: Statistical profile of Valerie Shevchuk’s idiostyle (morphological level). – Slobozhan Scientific Bulletin, Ser. Philology, 3, 32–36. DOI:10.32782/philspu/2023.3.6. Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15. Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas) SANTRAUKA Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą. 246 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Įteikta 2024 m. lapkričio 25 d. NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine [email protected] VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine [email protected] Straipsniai / Articles 247