scieee AI-readable full text Open interactive document viewer

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Nataliia Darchuk; Oksana Zuban; Valentyna Robeiko; Yuliia Tsyhvintseva; Victor Sorokin; Mykola Sazhok

Abstract

This paper presents the structure, algorithms, implementation, and experimental results of the automatic TextAttributor system developed by the authors of the paper for statistical Ukrainian-language text parameterisation using a multiparametric set of statistical indices, characterising the author’s text style and applicable to authorship attribution tasks. Based on the created linguistic resources and software, the system generates a linguistic analysis based on the calculated statistical indices and performs a comparative study of two texts. An additional criterion for statistical indexing is the text toxicity index, calculated through the method of verbal identification of toxic sentiment. Authorship and toxicity detection tasks are addressed using two methods: dictionary- and rule-based statistical calculations and machine learning. The current findings implemented in the beta version of TextAttributor are thoroughly examined.

Full text

NATALIIA DARCHUK Εθνικό Πανεπιστήμιο Taras Shevchenko του Kyiv Αναγνωριστικό ORCID: orcid.org/0000-0001-8932-9301 Πεδία έρευνας: υπολογιστική γλωσσολογία, γλωσσολογία σωμάτων κειμένων, ποσοτική γλωσσολογία, γραμματική και σημασιολογία της Ukrainian γλώσσας. OKSANA ZUBAN Εθνικό Πανεπιστήμιο Taras Shevchenko του Kyiv Αναγνωριστικό ORCID: orcid.org/0000-0002-2644-3892 Πεδία έρευνας: υπολογιστική γλωσσολογία, γλωσσική πραγματογνωμοσύνη, ποσοτική γλωσσολογία, γραμματική και σημασιολογία της Ukrainian γλώσσας. VALENTYNA ROBEIKO Εθνικό Πανεπιστήμιο Taras Shevchenko του Kyiv Αναγνωριστικό ORCID: orcid.org/0000-0003-2266-7650 Πεδία έρευνας: ανάλυση, αναγνώριση και σύνθεση ομιλίας, φωνητική, επεξεργασία φυσικής γλώσσας. YULIIA TSYHVINTSEVA Εθνικό Πανεπιστήμιο Taras Shevchenko του Kyiv, Ινστιτούτο της Ukrainian Γλώσσας της Εθνικής Ακαδημίας Επιστημών της Ukraine Αναγνωριστικό ORCID: orcid.org/0000-0002-9684-3840 Πεδία έρευνας: Ukrainian νεολογία, λεξικολογία και λεξικογραφία. VICTOR SOROKIN Εθνικό Πανεπιστήμιο Taras Shevchenko του Kyiv Αναγνωριστικό ORCID: orcid.org/0000-0002-3637-0535 Πεδία έρευνας: αυτόματη συντακτική ανάλυση, αυτόματη σημασιολογική ανάλυση, επεξεργασία φυσικής γλώσσας. Straipsniai / Articles 223 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK MYKOLA SAZHOK Ινστιτούτο τεχνολογιών και συστημάτων πληροφορικής της Εθνικής Ακαδημίας Επιστημών της Ukraine Αναγνωριστικό ORCID: orcid.org/0000-0003-1169-6851 Πεδία έρευνας: ανάλυση, αναγνώριση και σύνθεση ομιλίας, επεξεργασία φυσικής γλώσσας. DOI: doi.org/10.35321/all91-09 ΤΟ ΣΥΣΤΗΜΑ ΓΙΑ ΤΗΝ ΑΥΤΟΜΑΤΗ ΣΤΥΛΟΜΕΤΡΙΚΗ ΑΝΑΛΥΣΗ ΤΩΝ ΟΥΚΡΑΝΙΚΩΝ ΚΕΙΜΕΝΩΝ ΜΕΣΩΝ TextAttributor 1.0 (ΜΕΘΟΔΟΙ, ΜΕΣΑ, ΛΕΙΤΟΥΡΓΙΚΟΤΗΤΑ) Σύστημα αυτόματης στυλομετρικής ανάλυσης ουκρανικών κειμένων μέσων «TextAttributor 1.0» (μέθοδοι, μέσα, λειτουργικότητα) ΠΕΡΙΛΗΨΗ Η παρούσα μελέτη παρουσιάζει τη δομή, τους αλγορίθμους, την υλοποίηση και τα πειραματικά αποτελέσματα του αυτόματου συστήματος TextAttributor, το οποίο αναπτύχθηκε από τους συγγραφείς της μελέτης για τη στατιστική παραμετροποίηση κειμένων στην Ukrainian γλώσσα, με χρήση ενός πολυπαραμετρικού συνόλου στατιστικών δεικτών που χαρακτηρίζουν το υφολογικό πρότυπο του συγγραφέα και μπορούν να εφαρμοστούν σε εργασίες απόδοσης πατρότητας. Με βάση τους γλωσσικούς πόρους και το λογισμικό που δημιουργήθηκαν, το σύστημα παράγει γλωσσική ανάλυση βάσει των υπολογισμένων στατιστικών δεικτών και εκτελεί συγκριτική μελέτη δύο κειμένων. Πρόσθετο κριτήριο για τη στατιστική ευρετηρίαση αποτελεί ο δείκτης τοξικότητας του κειμένου, ο οποίος υπολογίζεται με τη μέθοδο της λεκτικής αναγνώρισης τοξικού συναισθήματος. Τα ζητήματα ανίχνευσης πατρότητας και τοξικότητας αντιμετωπίζονται με δύο μεθόδους: στατιστικούς υπολογισμούς βάσει λεξικού και κανόνων και μηχανική μάθηση. Τα τρέχοντα ευρήματα, τα οποία υλοποιήθηκαν στη beta έκδοση του TextAttributor, εξετάζονται διεξοδικά. ΛΕΞΕΙΣ-ΚΛΕΙΔΙΑ: Υπολογιστική γλωσσολογία, Ukrainian γλώσσα, ανάλυση συναισθήματος, απόδοση πατρότητας, στυλομετρία, ταξινόμηση κειμένου. 224 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Π Ε Ρ Ι Λ Η Ψ Η Στο παρόν άρθρο παρουσιάζονται η δομή, οι αλγόριθμοι, η υλοποίηση και τα πειραματικά αποτελέσματα του αυτόματου συστήματος «TextAttributor», το οποίο δημιουργήθηκε από τους συγγραφείς του άρθρου για τη στατιστική παραμετροποίηση κειμένων στην Ukrainian γλώσσα με τη χρήση ενός πολυπαραμετρικού συνόλου στατιστικών δεικτών που χαρακτηρίζουν το υφολογικό πρότυπο του συγγραφέα και εφαρμόζονται σε εργασίες απόδοσης πατρότητας. Με βάση τους γλωσσικούς πόρους και το λογισμικό που δημιουργήθηκαν, το σύστημα παράγει γλωσσική ανάλυση σύμφωνα με τους υπολογισμένους στατιστικούς δείκτες και εκτελεί συγκριτική ανάλυση δύο κειμένων. Πρόσθετο κριτήριο στατιστικής ευρετηρίασης αποτελεί ο δείκτης κειμένου που προκαλεί αρνητική διάθεση, ο οποίος υπολογίζεται με τη μέθοδο της λεκτικής αναγνώρισης αρνητικών διαθέσεων. Οι εργασίες προσδιορισμού πατρότητας και εντοπισμού κακεντρέχειας επιλύονται με δύο μεθόδους: στατιστικούς υπολογισμούς που βασίζονται σε λεξικό και κανόνες και μηχανική μάθηση. Τα τρέχοντα αποτελέσματα, τα οποία προέκυψαν με τη χρήση της beta έκδοσης του «TextAttributor», εξετάζονται διεξοδικά. ΒΑΣΙΚΕΣ ΛΕΞΕΙΣ: υπολογιστική γλωσσολογία, Ukrainian γλώσσα, ανάλυση συναισθήματος, απόδοση πατρότητας, στυλομετρία, ταξινόμηση κειμένου. 1. ΕΙΣΑΓΩΓΗ Η κειμενολογική έρευνα απέκτησε νέα επιστημονική σημασία με την πρόοδο των μεθόδων της υπολογιστικής γλωσσολογίας, οι οποίες συνέβαλαν στη διαμόρφωση μιας νέας κατεύθυνσης που μπορεί να θεωρηθεί ψηφιακή κειμενολογία. Στο πλαίσιο αυτού του αναδυόμενου κλάδου, εννοιολογούμε την ψηφιακή κειμενολογία ως αξιοποίηση αυτοματοποιημένων τεχνικών γλωσσολογίας σωμάτων κειμένων, σε συνδυασμό με μαθηματικά μοντέλα για την ποσοτική ανάλυση κειμένου. Καθοδηγούμενη από τα τρέχοντα ζητήματα της σύγχρονης ποσοτικής γλωσσολογίας και της επεξεργασίας φυσικής γλώσσας, η ομάδα μας ανέπτυξε ένα σύστημα αυτόματης γλωσσικής-στατιστικής ανάλυσης κειμένων μέσων, το οποίο υλοποιήθηκε ως διαδικτυακή εφαρμογή με την ονομασία TextAttributor (TextAttributor 1.0 2024). Το σύστημα λειτουργεί σε τέσσερις εργασίες: 1) στατιστική παραμετροποίηση κειμένου· 2) στυλομετρία: προσδιορισμός των γλωσσικών-στατιστικών χαρακτηριστικών του ιδιολέκτου· 3) απόδοση: προσδιορισμός του βαθμού ομοιότητας μεταξύ κειμένων· και 4) ανάλυση συναισθήματος: εντοπισμός λεξιλογίου αρνητικού συναισθήματος στα κείμενα. Επιπλέον, στο πλαίσιο του συστήματος παράγονται αυτόματα δύο συμπεράσματα γλωσσικής πραγματογνωμοσύνης με βάση τα αποτελέσματα της δεύτερης και της τέταρτης εργασίας. Η πολυλειτουργικότητα του συστήματος TextAttributor απαιτεί από τους χρήστες να εξοικειωθούν με τις αρχές λειτουργίας του. Σκοπός του άρθρου είναι να γνωρίσει στην ακαδημαϊκή και εκπαιδευτική φιλολογική κοινότητα τη μεθοδολογία δημιουργίας, την αρχιτεκτονική και τα λειτουργικά αποτελέσματα του συστήματος, ώστε να εξασφαλιστεί σαφής κατανόηση των λειτουργιών και των αναλυτικών δυνατοτήτων του, οι οποίες είναι ιδιαίτερα σημαντικές. Η προσέγγιση αυτή είναι ιδιαίτερα σημαντική για την ανάλυση μεγάλων όγκων διαδικτυακών επικοινωνιών και Straipsniai / Articles 225 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA RОBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK την ενίσχυση των στρατηγικών άμυνας της πληροφορίας κατά τη συνεχιζόμενη Ρωσο-Ουκρανική guerra. Η ιδέα ανάπτυξης ενός αυτόματου συστήματος απόδοσης κειμένων στην Ukrainian γλώσσα προέκυψε από την ανάλυση ερευνών στον τομέα της Ukrainian γλωσσολογίας σωμάτων κειμένων (Darčuk 2013) και στατιστικών μελετών του υφολογικού προτύπου του συγγραφέα (Darčuk et al. 2021; Darchuk, Sorokin 2022; Zuban 2019), οι οποίες πραγματοποιήθηκαν με τη χρήση των εργαλείων του Σώματος Ukrainian Γλώσσας (KUM) από τους συγγραφείς του έργου. Κατά την ανάπτυξη του συστήματος TextAttributor χρησιμοποιήθηκαν οι ακόλουθες μέθοδοι: ανάλυση συστατικών, κατανεμητική ανάλυση και ανάλυση περιεχομένου. Η ανάλυση περιεχομένου, μια ποσοτική και ποιοτική μέθοδος εξαγωγής πληροφοριών από το κείμενο, αξιοποίησε την επεξεργασία φυσικής γλώσσας και στατιστικές τεχνικές. Εφαρμόστηκαν επίσης η κβαντοποίηση και η ανάλυση συναισθήματος. Η ανάλυση συναισθήματος αναγνωρίζει αυτόματα την τονικότητα του κειμένου με βάση τόσο τον συναισθηματικό χρωματισμό όσο και την αξιολόγηση γεγονότων ή αντικειμένων από τον συγγραφέα, κάτι που επιτεύχθηκε με τη χρήση στατιστικών υπολογισμών βάσει λεξικού και κανόνων. Επιπλέον, ενσωματώθηκαν μέθοδοι μηχανικής μάθησης, συμπεριλαμβανομένης της βαθιάς μάθησης. Η στατιστική δομή ενός κειμένου, νοούμενη ως το ποσοτικό του μοντέλο, επιτρέπει τον προσδιορισμό του λειτουργικού του ύφους, της πατρότητας και της περιόδου δημιουργίας του. Στην παρούσα εργασία, τα συστατικά της στατιστικής δομής εξήχθησαν μέσω ανάλυσης λεξιλογικών και γραμματικών στατιστικών χαρακτηριστικών με τη χρήση τεχνικών ευρετηρίασης και μετρικών ευκλείδειας απόστασης. Η ευκλείδεια απόσταση, η οποία μετρά την απόσταση μεταξύ δύο σημείων σε έναν n-διάστατο ευκλείδειο χώρο, είναι μία από τις ευρύτερα χρησιμοποιούμενες μετρικές στη γλωσσοστατιστική για την ανάλυση συστάδων στη στυλομετρία και την απόδοση πατρότητας. Η καινοτομία των αποτελεσμάτων έγκειται στην πρώτη υλοποίηση στην υπολογιστική γλωσσολογία ενός αυτοματοποιημένου μορφοσυντακτικοσημασιολογικού στυλομετρικού μοντέλου για την ανάλυση κειμένου, βασισμένου σε 15 στατιστικούς δείκτες που παραμετροποιούν κυρίως τη μορφολογική, καθώς και τη συντακτική και σημασιολογική δομή του κειμένου. Ένα στυλομετρικό μοντέλο είναι ένα σύνολο στατιστικών παραμέτρων ενός κειμένου (λεξιλογικών, μορφολογικών, συντακτικών κ.λπ.), βάσει των οποίων πραγματοποιείται συγκριτική ανάλυση αυτού του κειμένου με το στυλομετρικό μοντέλο του λειτουργικού ύφους. Κατά τη γνώμη μας, με τη χρήση στατικών μεθόδων στην κατασκευή ενός στυλομετρικού μοντέλου είναι δυνατό να ληφθεί ένα αυστηρό, ντετερμινιστικό, επιστημονικά τεκμηριωμένο σύστημα κοινών και διακριτικών χαρακτηριστικών σε ύφη, είδη κ.λπ. Για πρώτη φορά, το στυλομετρικό μοντέλο εισάγει την παράμετρο του δείκτη τοξικότητας, η οποία χαρακτηρίζει τα κείμενα των μέσων κατά τη Ρωσο-Ουκρανική guerra. Το μοντέλο αυτό υλοποιείται όχι μόνο στη λειτουργία της στατιστικής παραμετροποίησης κειμένων, που είναι τυπική για συστήματα αυτού του τύπου, αλλά και στη λειτουργία σύγκρισης του αναλυόμενου κειμένου με το υφολογικό πρότυπο των μέσων της Ukrainian γλώσσας, καθώς και για στυλομετρικές εργασίες και εργασίες απόδοσης που αφορούν δύο ή περισσότερα κείμενα. Η θεωρητική σημασία επεκτείνεται στην επικύρωση δύο μεθόδων για τον προσδιορισμό της τοξικότητας κειμένου και 226 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) της πατρότητας στην Ukrainian: 1) μέσω προσεγγίσεων που βασίζονται σε λεξικό και κανόνες και 2) μέσω μηχανικής μάθησης, συμπεριλαμβανομένης της βαθιάς μάθησης. 2. ΣΧΕΤΙΚΕΣ ΕΡΓΑΣΙΕΣ Στη σύγχρονη ουκρανική γλωσσολογία έχουν διεξαχθεί εκτενείς γλωσσολογικές-στατιστικές μελέτες των ιδιολέκτων Ουκρανών συγγραφέων και ποιητών, μεταξύ άλλων των Taras Shevchenko, Lesya Ukrainka, Vasyl Stus (Zuban’ 2019), Ivan Franko (Buk 2021), Roman Ivanychuk (Lototska 2022), Valerii Shevchuk (Volos, Levchenko 2023), Mariia Matios, Yurii Andrukhovych, Oksana Zabuzhko (Karasov, Levchenko 2024), Ivan Drach, Mykola Vingranovsky (Darchuk et al. 2024), Lina Kostenko (Zuban’ 2019· Darchuk et al. 2024), μεταξύ άλλων. Οι μελέτες αυτές διεξήχθησαν σε αντιπροσωπευτικά δείγματα κειμένων (εκτενή κείμενα), χρησιμοποιώντας κυρίως μία ή λίγες (όχι περισσότερες από πέντε) στατιστικές παραμέτρους, συχνά χωρίς την εφαρμογή στυλομετρικής σύγκρισης. Επιπλέον, λόγω του επίπονου χαρακτήρα της διεξαγωγής γλωσσολογικών-στατιστικών πειραμάτων, η ουκρανική γλωσσολογία έχει σε μεγάλο βαθμό παραβλέψει την ολοκληρωμένη στατιστική παραμετροποίηση, τη σύγκριση των αναλυόμενων κειμένων με τυπικές στατιστικές παραμέτρους των λειτουργικών υφολογικών ποικιλιών, τον προσδιορισμό του βαθμού ομοιότητας των κειμένων, καθώς και τη στυλομετρική και συγγραφική ανάλυση σύντομων κειμένων. Η χρήση του συστήματος TextAttributor στη γλωσσολογική-στατιστική έρευνα, με στόχο την αυτόματη εκτέλεση αυτών των εργασιών, δεν θα παρέχει μόνο συχνoτικές χαρακτηριστικές των γλωσσικών φαινομένων, αλλά θα καταστήσει επίσης δυνατή την αποτελεσματική στυλομετρική ανάλυση, με αποτέλεσμα τη διατύπωση εμπειρογνωμοσύνης. Το σύστημα TextAttributor διαθέτει πλεονεκτήματα σε σύγκριση με τα αντίστοιχά του στην παγκόσμια επιστήμη. Τα περισσότερα υπάρχοντα συστήματα και μοντέλα επικεντρώνονται επίσης στη χρήση μεμονωμένων γλωσσικών-στατιστικών μονάδων για τον εντοπισμό μίας ή λίγων, κυρίως τυπικών (n-grams, συχνότερες λέξεις, γράμματα), παραμέτρων κειμένου (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). Αντίθετα, το TextAttributor 1.0 προσφέρει ολοκληρωμένη προσέγγιση, συμπεριλαμβανομένης της διαδραστικής στατιστικής ανάλυσης της λεξιλογικής, μορφολογικής, συντακτικής και σημασιολογικής δομής του κειμένου σε πραγματικό χρόνο, βάσει 15 παραμέτρων. Η απόδοση κειμένων αναπτύσσεται ενεργά στις ξένες κειμενολογικές μελέτες· ειδικότερα, η αποτελεσματικότητα της μεθόδου του Burrows (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) δοκιμάζεται σε πολλές μελέτες μεγάλων όγκων δεδομένων κειμένων διαφόρων υφολογικών ποικιλιών, όπως: αγγλική πεζογραφία των αρχών του 20thού αιώνα (Hoover 2004)· σύγχρονη αγγλική ποίηση (Hoover 2005)· ποιητικά έργα στα λατινικά (Rybicki, Eder 2011)· πεζογραφικά έργα σημαντικών ειδών στα αγγλικά, γαλλικά, ιταλικά, γερμανικά, πολωνικά, ουγγρικά, καθώς και στα λατινικά και αραβικά (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015)· πολιτικά κείμενα στα αγγλικά, συμπεριλαμβανομένης της Straipsniai / Articles 227 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK της απόδοσης των ομιλιών Αμερικανών προέδρων (Savoy 2015). Μία ακόμη αυτοματοποιημένη μέθοδος γλωσσικής ανάλυσης, η οποία ονομάζεται “Linguistic Inquiry and Word Count” (LIWC), υλοποιείται ως εμπορική εφαρμογή και έχει προσαρμοστεί σε διάφορες γλώσσες (Meier et al. 2019; LIWC-22). Τα τελευταία χρόνια, στις εργασίες αυτόματης απόδοσης κειμένων χρησιμοποιούνται κυρίως είτε στυλομετρικές μέθοδοι βασισμένες σε κανόνες είτε μέθοδοι βαθιάς μάθησης (Eder 2015; Canhasi et al. 2022). Και οι δύο μέθοδοι υλοποιήθηκαν στο σύστημα TextAttributor, λειτουργώντας αποτελεσματικά αλλά αποδίδοντας διαφορετικά αποτελέσματα: 1) Η μέθοδος που βασίζεται σε κανόνες επιτρέπει την αυτοματοποίηση της παραγωγής γλωσσικών συμπερασμάτων σχετικά με το ιδιόλεκτο και την τοξικότητα του κειμένου· 2) η μέθοδος μηχανικής μάθησης προσδιορίζει μόνο τον βαθμό τοξικότητας και την ομοιότητα των κειμένων και μπορεί να χρησιμοποιηθεί σε εργασίες ταξινόμησης για την παρακολούθηση περιεχομένου κειμένων. Οι πρόσφατες μέθοδοι μηχανικής μάθησης για την ανάλυση συναισθήματος και την αναγνώριση της πατρότητας κειμένων βασίζονται σε στατιστικές προσεγγίσεις (TF-IDF, Latent Dirichlet Allocation) και τεχνικές βαθιάς μάθησης με διάφορες αρχιτεκτονικές (CNN, LSTM, BERT) σε συνδυασμό με στυλομετρικές μεθόδους (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). Τα αναφερόμενα αποτελέσματα εξαρτώνται σε εξαιρετικά μεγάλο βαθμό από τον αριθμό των κλάσεων (τύποι τοξικότητας, συγγραφείς), το είδος, το μήκος του κειμένου και, κυρίως, τον όγκο του ορθά σχολιασμένου σώματος κειμένων που χρησιμοποιείται για τη διαδικασία εκπαίδευσης. Έτσι, υψηλά ποσοστά ακρίβειας στις εργασίες ανίχνευσης τοξικότητας και ρητορικής μίσους υπερβαίνουν το 90% με τη χρήση σώματος που περιέχει δεκάδες χιλιάδες έγγραφα (Alkomah, Ma 2022). Για παράδειγμα, επιτυγχάνεται ακρίβεια άνω του 90% στην απόδοση πατρότητας για λογοτεχνικά έργα στην αγγλική γλώσσα μεταξύ 1000 συγγραφέων, με τη χρήση σώματος 6000 εγγράφων για 15 συγγραφείς. Αντίθετα, για σώματα που περιέχουν λιγότερα από 1500 έγγραφα, η αναφερόμενη ακρίβεια είναι περίπου 70% (Khan et al. 2023). Για την Ukrainian γλώσσα, η αναγνώριση της πατρότητας κειμένων και η ανάλυση συναισθήματος/τοξικότητας αποτελούν υπομελετημένα ζητήματα (Lupei et al. 2020)· επιπλέον, τέτοια συστήματα δεν παράγουν γλωσσική πραγματογνωμοσύνη και δεν μπορούν να χρησιμοποιηθούν ως εργαλεία γλωσσολογικής έρευνας. 3. ΓΕΝΙΚΑ ΧΑΡΑΚΤΗΡΙΣΤΙΚΑ ΤΗΣ ΛΕΙΤΟΥΡΓΙΑΣ ΤΟΥ ΣΥΣΤΗΜΑΤΟΣ TEXTATTRIBUTOR Κατά την ανάπτυξη του TextAttributor ολοκληρώθηκαν οι ακόλουθες εργασίες: 1) Θεωρητική γλωσσολογία: αναπτύχθηκε μεθοδολογία για τυποποιημένες μορφολογικές, στατιστικές, στυλομετρικές, αποδοτικές και συναισθηματικές αναλύσεις· 2) Μηχανική λογισμικού: αναπτύχθηκαν η δομή των γλωσσικών βάσεων δεδομένων και το λογισμικό για τις προαναφερθείσες αυτόματες αναλύσεις· 3) Πειραματική γλωσσολογία: το σύστημα δοκιμάστηκε σε Ukrainian κείμενα μέσων και 228 Acta Linguistica Lithuanica XCI Το Σύστημα για την Αυτόματη Στυλομετρική Ανάλυση των Ukrainian Κειμένων Μέσων TextAttributor 1.0 (Μέθοδοι, Μέσα, Λειτουργικότητα) υλοποιήθηκε αναλυτική μονάδα για αυτόματη στυλομετρική εξέταση. Το αυτοματοποιημένο γλωσσικό σύστημα, υλοποιημένο ως διαδικτυακή εφαρμογή, επεξεργάζεται κείμενα υφολογικής ποικιλίας μέσων που εισάγει ο χρήστης, παράγοντας αριθμητικές τιμές για στατιστικές παραμέτρους που χαρακτηρίζουν τα γνωρίσματα του κειμένου. Το σύστημα ακολουθεί μια δομημένη ακολουθία λειτουργίας: 1. Κατάτμηση κειμένου: Διάσπαση του κειμένου σε προτάσεις και λέξεις για ανάλυση. 2. Μορφολογική επισήμανση: Ανάθεση επισημάνσεων στις λέξεις με βάση τους γραμματικούς τους τύπους. 3. Συμφραστική ανάλυση: Ενημέρωση των μορφολογικών επισημάνσεων σε σχέση με τα συμφραζόμενα. 4. Συντακτική ανάλυση: Καθιέρωση δυαδικών σχέσεων μεταξύ των λέξεων στις προτάσεις, ώστε να γίνει κατανοητή η γραμματική τους δομή. 5. Καθιέρωση συντακτικών σχέσεων: Προσδιορισμός συντακτικών συνδέσεων βάσει προκαθορισμένων κανόνων. 6. Αντιστοίχιση συναισθηματικά αρνητικού λεξιλογίου: Εντοπισμός λέξεων από προκαθορισμένο σύνολο αρνητικού λεξιλογίου. 7. Αξιολόγηση στατιστικών παραμέτρων: Αξιολόγηση στατιστικών παραμέτρων για το κείμενο εισόδου με χρήση αυτόματα καταρτιζόμενων λεξιλογίων συχνότητας. 8. Οπτικοποίηση αποτελεσμάτων: Γραφική παρουσίαση των αποτελεσμάτων της στατιστικής παραμετροποίησης, με εμπειρικές τιμές και διαστήματα εμπιστοσύνης. 9. Σύγκριση αποτελεσμάτων: Οπτικοποίηση των αποτελεσμάτων της στατιστικής παραμετροποίησης για δύο κείμενα υφολογικής ποικιλίας μέσων, διευκολύνοντας τη σύγκριση. 10. Αξιολόγηση ευκλείδειας απόστασης: Ποσοτικοποίηση της ανομοιότητας μεταξύ δύο κειμένων υφολογικής ποικιλίας μέσων. 11. Παραγωγή γνωμοδότησης πραγματογνώμονα: Παραγωγή δύο γνωμοδοτήσεων πραγματογνώμονα: μίας για την απόδοση του κειμένου και μίας ακόμη για την τοξικότητα του κειμένου μέσω γλωσσικής εξέτασης. 12. Ανίχνευση τοξικότητας και αναγνώριση πατρότητας: Αξιοποίηση τεχνικών μηχανικής μάθησης, ιδίως μοντέλων νευρωνικών δικτύων, για την ανίχνευση τοξικότητας και την αναγνώριση συγγραφέων. Τα αποτελέσματα του συστήματος οργανώνονται στις ακόλουθες ενότητες: Ομάδα Δεικτών Απόδοσης Κειμένου, Γνωμοδότηση Πραγματογνώμονα για την Απόδοση Κειμένου, Σύγκριση της Απόδοσης Κειμένων, Γλωσσική Πραγματογνωμοσύνη της Τοξικότητας Κειμένου και Γνωμοδοτήσεις Νευρωνικού Δικτύου. Στην Ομάδα Δεικτών Απόδοσης Κειμένου (Εικ. 1), οι στατιστικές παράμετροι οργανώνονται με βάση το κείμενο εισόδου: η στήλη 1 εμφανίζει τον τίτλο του Δείκτη, η στήλη 2 παρουσιάζει την εμπειρική αριθμητική τιμή και η στήλη 3 παρέχει οπτική αναφορά συγκρίνοντας την εμπειρική τιμή του δείκτη με το διάστημα εμπιστοσύνης Straipsniai / Articles 229 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK τα κατώτατα και ανώτατα όρια του οποίου προέκυψαν από κείμενα της Ukrainian υφολογικής ποικιλίας μέσων. Η εμπειρική αριθμητική τιμή αναπαρίσταται στην κλίμακα με ένα συμπαγές ανεστραμμένο τρίγωνο. ΕΙΚΟΝΑ 1: Απόσπασμα του αποτελέσματος απόδοσης κειμένου Στη Γνωμοδότηση Πραγματογνώμονα για την Απόδοση Κειμένου (Εικ. 2), παρουσιάζουμε συμπεράσματα σχετικά με τα τυπικά ή ατομικά γλωσσικά-στατιστικά χαρακτηριστικά που εξήχθησαν από το αναλυόμενο κείμενο για κάθε εκτιμώμενο δείκτη. Τα συμπεράσματα αυτά προκύπτουν από τις απαντήσεις στο ερώτημα: Εμπίπτει η αριθμητική τιμή του δείκτη στο διάστημα εμπιστοσύνης της υφολογικής ποικιλίας των μέσων της Ukrainian γλώσσας; Με βάση τη σύγκριση των αριθμητικών τιμών με τις οριακές τιμές του διαστήματος εμπιστοσύνης, το σύστημα παράγει τρεις πιθανές απαντήσεις (τυπικά γνωρίσματα υφολογικής ποικιλίας μέσων, γνωρίσματα ιδιολέκτου χαμηλότερα από την κανονική υφολογική ποικιλία μέσων και γνωρίσματα ιδιολέκτου υψηλότερα από την κανονική υφολογική ποικιλία μέσων). Στη Σύγκριση της Απόδοσης Κειμένων (Εικ. 4, υποενότητα 4.2), μετά την επιλογή «Υπολογισμός διανυσματικής απόστασης», τα δεδομένα σε μορφή πίνακα ενημερώνονται αμέσως ως εξής: Η στήλη 1 καταγράφει τα κείμενα που εισήγαγε ο χρήστης μαζί με το κείμενο που αναλύθηκε προηγουμένως· η στήλη 2 εμφανίζει τον αριθμό προτάσεων σε κάθε κείμενο· η στήλη 3 δείχνει το πλήθος λέξεων· η στήλη 4 παρουσιάζει την ευκλείδεια απόσταση μεταξύ του αναλυόμενου κειμένου και κάθε κειμένου του πίνακα· η στήλη 5, με την ένδειξη «Σύγκριση», εκκινεί την αυτόματη σύγκριση των στατιστικών δεικτών μεταξύ του αναλυόμενου κειμένου και του επιλεγμένου κειμένου. Με την ενεργοποίηση του αντίστοιχου στοιχείου «Σύγκριση», παρέχονται ολοκληρωμένες πληροφορίες σχετικά με τη στατιστική σύγκριση μεταξύ δύο κειμένων στην ομάδα «Δείκτες Απόδοσης Κειμένου» (Εικ. 3). 230 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) ΕΙΚΟΝΑ 2: Παράδειγμα παραγόμενης γνωμοδότησης πραγματογνώμονα Στη Γλωσσική Πραγματογνωμοσύνη της Τοξικότητας Κειμένου (υποενότητα 4.3), παρουσιάζεται μια λεξικοσημασιολογική ερμηνεία του υπολογισμένου δείκτη τοξικότητας (Εικ. 6). Στις Γνωμοδοτήσεις Νευρωνικού Δικτύου παρουσιάζουμε την έξοδο του μοντέλου βαθιάς μάθησης, το οποίο ποσοτικοποιεί την τοξικότητα του κειμένου σε κλίμακα από 0 (μη τοξικό) έως 1 (υψηλή τοξικότητα). Αξιολογούμε επίσης την ομοιότητα του κειμένου με γνωστούς συγγραφείς, με τιμές από 0 (καμία ομοιότητα) έως 1 (υψηλή ομοιότητα), με βάση τους συγγραφείς στους οποίους εκπαιδεύτηκε το μοντέλο. Τα αποτελέσματα εμφανίζονται μόνο για δοκιμές με μέτρο ομοιότητας που υπερβαίνει το 0.1. Το τρέχον σύστημά μας λειτουργεί σε δοκιμαστική λειτουργία, χρησιμοποιώντας περιορισμένο σώμα κειμένων συγγραφέων για την εκτίμηση της ομοιότητας με το κείμενο που εισάγει ο χρήστης. 4. ΑΠΟΔΟΣΗ ΚΕΙΜΕΝΩΝ ΣΤΗΝ UKRAINIAN ΓΛΩΣΣΑ: ΠΕΙΡΑΜΑΤΑ, ΑΠΟΤΕΛΕΣΜΑΤΑ ΚΑΙ ΣΥΖΗΤΗΣΕΙΣ 4.1. Δείκτες στατιστικής παραμετροποίησης Το αναπτυγμένο στυλομετρικό μοντέλο επιλύει δύο εργασίες: 1) τον εντοπισμό ατομικών χαρακτηριστικών του υφολογικού προτύπου ενός συγγραφέα (στυλομετρία)· 2) την αξιολόγηση της ομοιότητας μεταξύ δύο κειμένων βάσει γλωσσικών και στατιστικών παραμέτρων (απόδοση). Straipsniai / Articles 231 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK Χρησιμοποιούνται 19 παράμετροι για τη στατιστική ανάλυση του κειμένου εισόδου του χρήστη (βλ. Εικ. 1 για την Ομάδα Δεικτών Απόδοσης Κειμένου). Οι τέσσερις αρχικές παράμετροι περιλαμβάνουν βασικά ποσοτικά δεδομένα: πλήθος λέξεων, μη επεξεργασμένες λέξεις, μέγεθος λεξικού και πλήθος προτάσεων. Το πλήθος λέξεων δεν περιλαμβάνει λεξιλόγιο που δεν υποβλήθηκε σε επεξεργασία από το σύστημα, όπως διαλεκτισμούς, μοσχοβιτισμούς, περιστασιακούς νεολογισμούς κ.λπ. Οι υπόλοιπες 15 παράμετροι αποτελούνται από υπολογίσιμους δείκτες που αποδίδουν βαθμωτές ποσότητες. Για τη στυλομετρική ανάλυση, πρόκειται να επικυρώσουμε την Υπόθεση 1. Η υπόθεση αυτή αναφέρει ότι, μέσω της ανάλυσης εμπειρικών δεδομένων που περιλαμβάνουν στατιστικές παραμέτρους εντός και εκτός του διαστήματος εμπιστοσύνης της Ukrainian υφολογικής ποικιλίας μέσων, είναι δυνατό να διακριθούν μοναδικά συγγραφικά χαρακτηριστικά σε ένα δεδομένο κείμενο μέσων. Για κάθε γλωσσική παράμετρο υπολογίστηκαν δύο σύνολα διαστημάτων εμπιστοσύνης βάσει δειγμάτων Ukrainian κειμένων μέσων: ένα για κείμενα άνω των 1000 λέξεων (μέγεθος δείγματος: 124,576 λέξεις) και ένα για κείμενα έως 1000 λέξεις (μέγεθος δείγματος: 15,635 λέξεις). Το διάστημα εμπιστοσύνης για κάθε στατιστική παράμετρο καθορίστηκε με τη χρήση της τυπικής απόκλισης, σ, της Μέσης Αριθμητικής Τιμής του Δείκτη (ANVI) εντός του δείγματος κειμένων, η οποία συμβολίζεται ως ANVI ± σ. Η τυπική απόκλιση εκτιμά πόσο μπορεί να αποκλίνουν οι εμπειρικές αριθμητικές τιμές των στατιστικών δεικτών από τη μέση αριθμητική τιμή του δείκτη εντός της υφολογικής ποικιλίας των μέσων. Για τη διασφάλιση της ακρίβειας, το διάστημα εμπιστοσύνης για το σ προσδιορίστηκε μέσω γλωσσικού και στατιστικού πειράματος. Κατά συνέπεια, το σύστημα προσφέρει τρία πιθανά συμπεράσματα κατά τον έλεγχο της Υπόθεσης 1: 1) η αριθμητική τιμή του δείκτη εμπίπτει στο διάστημα εμπιστοσύνης· 2) η αριθμητική τιμή του δείκτη βρίσκεται κάτω από το κατώτατο όριο του διαστήματος· ή 3) η αριθμητική τιμή του δείκτη υπερβαίνει το ανώτατο όριο του διαστήματος. Ας εξετάσουμε τα αποτελέσματα που προέκυψαν από την παραμετροποίηση του Κειμένου 1, το οποίο συνέταξε ο blogger Oleksii Honcharenko (βλ. Εικ. 1). Η ανάλυση αυτή βασίζεται σε στατιστικές παραμέτρους και στην επακόλουθη ερμηνεία τους, η οποία αποτυπώνεται στη γνωμοδότηση πραγματογνώμονα που παρουσιάζεται στην Εικ. 2. Οι στατιστικές μετρήσεις σχετικά με το λεξιλόγιο και τον όγκο του κειμένου αποκαλύπτουν μια ποσοτική σχέση. Στο Κείμενο 1, όλοι αυτοί οι δείκτες βρίσκονται εντός του τυπικού εύρους για την υφολογική ποικιλία των μέσων: 1) Ο Δείκτης Ποικιλίας (IB) εκφράζει την αναλογία των μοναδικών λέξεων προς το συνολικό μέγεθος του κειμένου και λειτουργεί ως μέτρο του λεξιλογικού πλούτου. Η τιμή IB 0.54 εμπίπτει στο εύρος 30%–60%, υποδεικνύοντας μέτριο επίπεδο λεξιλογικής ποικιλίας· 2) Ο Δείκτης Αποκλειστικότητας Κειμένου (IVT) εκφράζει την αναλογία του αριθμού των hapax legomena που εμφανίζονται μία φορά στο κείμενο προς τον όγκο του κειμένου. Ο IVT ίσος με 0.36 εμπίπτει στο εύρος 20%–40%, υποδεικνύοντας χαμηλή λεξιλογική αποκλειστικότητα·) 232 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 3) Ο Δείκτης Αποκλειστικότητας Λεξιλογίου (IVL) εκφράζει την αναλογία του αριθμού των hapax legomena που εμφανίζονται μόνο μία φορά στο κείμενο προς τον συνολικό όγκο του λεξιλογίου. Ο IVL ίσος με 0.66 εμπίπτει στο εύρος 60%–76%, υποδεικνύοντας υψηλό βαθμό λεξιλογικής αποκλειστικότητας. Στη συνέχεια, ας εξετάσουμε τις στατιστικές παραμέτρους της ποσοτικής συσχέτισης των λεξιλογικών και γραμματικών κατηγοριών λέξεων στο Κείμενο 1: 1) Ο Δείκτης Ονοματικών Χαρακτηριστικών, ή Επιθετοποίηση, (IIO) εκφράζει την αναλογία του αριθμού των ουσιαστικών προς τον αριθμό των επιθέτων. Το IIO του 1.07 είναι υψηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους, που είναι 1.0, γεγονός που υποδηλώνει υπεροχή των ουσιαστικών έναντι των επιθέτων και συνεπώς λιγότερα επίθετα-χαρακτηρισμοί στο κείμενο· 2) Ο Δείκτης Ρηματικών Χαρακτηριστικών (IDO) εκφράζει την αναλογία του αριθμού των επιρρημάτων προς τον αριθμό των ρημάτων. Το IDO του 0.57 είναι υψηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους, που είναι 0.56. Αυτή η αναλογία επιρρημάτων υποδηλώνει χαμηλό βαθμό ρηματικών χαρακτηρισμών στο κείμενο· 3) Ο Βαθμός Ονοματικοποίησης (STN) εκφράζει την αναλογία του αριθμού των ουσιαστικών προς τον αριθμό των ρημάτων. Το STN του 1.76 είναι χαμηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους, που είναι 3.00. Η μείωση αυτού του δείκτη υποδηλώνει υπεροχή των ρημάτων έναντι των ουσιαστικών και χαμηλό βαθμό ονοματικοποίησης του κειμένου· 4) Ο Δείκτης Αντωνυμοποίησης (IPRO) εκφράζει την αναλογία του αριθμού των προσωπικών αντωνυμιών προς την έκταση της χρήσης λέξεων στο κείμενο. Το IPRO του 0.09 είναι υψηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους και αποτελεί ένδειξη του ιδιούφους. Οι προσωπικές αντωνυμίες καλύπτουν περισσότερο από το 7% του κειμένου, υποδεικνύοντας τον βαθμό συνοχής του κειμένου· 5) Ο Δείκτης Τροπικότητας (MOD) εκφράζει την αναλογία του αριθμού των μορίων προς τον αριθμό των λέξεων στο κείμενο. Το IMOD του 0.07 είναι υψηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους, που είναι 4%, και αποτελεί ένδειξη του ιδιούφους. Τα μόρια καλύπτουν περισσότερο από το 4% του κειμένου, γεγονός που καθορίζει τον βαθμό στον οποίο ο συγγραφέας εκφράζει διάφορες αξιολογήσεις φαινομένων και καταστάσεων στο κείμενο· 6) Ο Δείκτης Ουσιαστικότητας (ISUB) εκφράζει την αναλογία του αριθμού των ουσιαστικών προς την έκταση της χρήσης λέξεων στο κείμενο. Το ISUB του 0.26 είναι χαμηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους. Τα ουσιαστικά καλύπτουν λιγότερο από το 30% του κειμένου, γεγονός που καθορίζει τον χαμηλό βαθμό στατικότητας του κειμένου. Ας εξηγήσουμε τις στατιστικές παραμέτρους της ποσοτικής αναλογίας φράσεων και προτάσεων στο Κείμενο 1: 1) Ο Δείκτης Δυναμισμού (IDYN) εκφράζει την αναλογία του αριθμού των ρηματικών φράσεων προς τον αριθμό των ονοματικών φράσεων. Το IDYN του 0.74 είναι υψηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους, που είναι 0.6, και αποτελεί ένδειξη του ιδιούφους. Η υπεροχή των ρηματικών φράσεων έναντι των ονοματικών φράσεων (IDYN μεγαλύτερο από 1.0) καθορίζει τη δυναμική και ταχεία εξέλιξη των γεγονότων στο νόημα του κειμένου· Straipsniai / Articles 233 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 2) Ο Δείκτης Συνοχής (IZV) εκφράζει την αναλογία του αριθμού των προθέσεων και των συνδέσμων προς τον αριθμό των προτάσεων στο κείμενο. Το IZV του 0.66 εμπίπτει στο τυπικό εύρος 0.45 έως 0.90 για το δημοσιογραφικό ύφος, υποδεικνύοντας υπεροχή του αριθμού των προτάσεων έναντι του αριθμού των προθέσεων και των συνδέσμων. Αυτό καθορίζει τον μέσο βαθμό συνοχής μεταξύ των πραγματικοτήτων, των φαινομένων και των καταστάσεων που περιγράφονται στο Κείμενο 1. Ιδιαίτερη προσοχή θα δοθεί στις ψυχογλωσσικές στατιστικές παραμέτρους (Chuhunov 2009) στο Κείμενο 1: 1) Ο συντελεστής Trager (KT) εκφράζει την αναλογία του αριθμού των ρημάτων προς τον αριθμό των επιθέτων στο κείμενο, υποδεικνύοντας τη συναισθηματική σταθερότητα/αστάθεια του ομιλητή. Το KT του 0.61 είναι υψηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους, που είναι 0.5, και αποτελεί ένδειξη του ιδιούφους. Σύμφωνα με την ψυχολογική ερμηνεία, αυτό υποδηλώνει τη χαμηλή συναισθηματικότητα του συγγραφέα/ομιλητή, την αναποφασιστικότητα για ανάληψη ενεργών πρακτικών δράσεων και το άγχος. Η τιμή στο εύρος 1.35 ± 0.05 καθορίζει τη φυσιολογική συναισθηματική σταθερότητα και ρύθμιση για τον συγγραφέα· 2) Ο Συντελεστής Βεβαιότητας της Δράσης (KOD) εκφράζει την αναλογία του αριθμού των ρημάτων προς τον αριθμό των ουσιαστικών στο κείμενο. Αυτή η αναλογία υποδεικνύει τον βαθμό κοινωνικοποίησης του συγγραφέα και τη συντακτική πληρότητα της διατύπωσης. Το KOD του 0.57 εμπίπτει στο τυπικό εύρος 0.30 έως 0.60 για το δημοσιογραφικό ύφος, υποδεικνύοντας χαμηλό βαθμό συντελεστή αντικειμενοποιημένης δράσης. Σύμφωνα με την ψυχολογική ερμηνεία, αυτό υποδηλώνει χαμηλό επίπεδο συναισθηματικότητας του συγγραφέα/ομιλητή, αναποφασιστικότητα ως προς τις ενεργές πρακτικές δράσεις και άγχος. Μια τιμή στο εύρος 1.35 ± 0.05 καθορίζει τη φυσιολογική συναισθηματική σταθερότητα και τη ρύθμιση των συναισθημάτων από τον συγγραφέα, γεγονός που, με βάση τα γλωσσικά χαρακτηριστικά, υποδεικνύει φυσιολογικό βαθμό συντακτικής πληρότητας στις προτάσεις και ορθή συντακτική δομή· 3) Ο Συντελεστής Επιθετικότητας (KA) εκφράζει την αναλογία του αριθμού των ρημάτων και της χρήσης ρημάτων προς τον συνολικό αριθμό των λέξεων στο κείμενο, η οποία χαρακτηρίζει την επιθετικότητα της γλώσσας από ψυχογλωσσική άποψη. Το KA του 0.15 είναι υψηλότερο από τον μέσο όρο του δημοσιογραφικού ύφους, που είναι 13%, και αποτελεί ένδειξη ιδιούφους. Σύμφωνα με την ψυχολογική ερμηνεία, τιμές κάτω από 60% υποδεικνύουν χαμηλό βαθμό επιθετικότητας, καταπιεσμένα συναισθήματα του συγγραφέα και αναποφασιστικότητα. Η προσέγγιση του 60% καθορίζει τον φυσιολογικό βαθμό επιθετικότητας και συναισθηματικής σταθερότητας του συγγραφέα, ενώ τιμές άνω του 60% υποδεικνύουν υψηλή επιθετικότητα του συγγραφέα και συναισθηματική διέγερση. Τέλος, ας εξετάσουμε τη σημασιολογική στατιστική παράμετρο του Κειμένου 1: Ο Δείκτης Τοξικότητας του Κειμένου (ITOX) υπολογίζεται από τη συχνότητα του αρνητικού λεξιλογίου στο κείμενο (για περισσότερες λεπτομέρειες, βλ. ενότητα 4.3). Η τιμή ITOX του 0.36 εμπίπτει στο τυπικό εύρος 0.1 έως 0.7 για το δημοσιογραφικό ύφος. Το ITOX διαμορφώνει γνωστικές και πραγματολογικές στάσεις απέναντι στα αρνητικά συναισθήματα. 234 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 4.2. Σύγκριση κειμένων βάσει στατιστικών παραμέτρων Το έργο αξιολόγησης του βαθμού ομοιότητας μεταξύ δύο κειμένων περιλάμβανε τον έλεγχο της Υπόθεσης 2. Η υπόθεση αυτή αναφέρει ότι, αν τα εμπειρικά δεδομένα που προκύπτουν από τη στατιστική παραμετροποίηση δύο κειμένων παρουσιάζουν μόνο μικρή διαφορά στις αριθμητικές τιμές των δεικτών, τότε τα κείμενα αυτά ανήκουν στον ίδιο συγγραφέα. Η υπόθεση ελέγχεται στο σύστημα με δύο τρόπους: 1) με σύγκριση των αριθμητικών τιμών κάθε δείκτη στα δύο κείμενα· 2) με προσδιορισμό της διανυσματικής απόστασης μεταξύ των δύο κειμένων. Τα προβλήματα αυτά υλοποιούνται στην ενότητα Comparison of Text Attribution. Η πρώτη εργασία περιλαμβάνει τη σύγκριση των εμπειρικών δεδομένων των κειμένων με χρήση δεικτών στην κλίμακα του διαστήματος εμπιστοσύνης του δημοσιογραφικού ύφους (Fig. 3). Όπως απεικονίζεται στο Fig. 3, τα ποσοτικά χαρακτηριστικά των παραμέτρων και των δύο κειμένων εμφανίζονται με διαφορετικά χρώματα για τη διευκόλυνση του χρήστη. Η οπτικοποίηση συγκρίνει τις εμπειρικές τιμές των δεικτών και των δύο κειμένων με τα κατώφλια του διαστήματος εμπιστοσύνης (κατώτερο και ανώτερο), τα οποία προέρχονται από ουκρανικά κείμενα δημοσιογραφικού ύφους. ΕΙΚΟΝΑ 3: Σύγκριση της διανυσματικής απόστασης των κειμένων Η δεύτερη εργασία είναι ο υπολογισμός της διανυσματικής απόστασης μεταξύ δύο κειμένων με χρήση του τύπου της Ευκλείδειας απόστασης. Αυτό περιλαμβάνει την άθροιση των τετραγώνων των διαφορών μεταξύ των αριθμητικών τιμών 15 στατιστικών παραμέτρων των δύο κειμένων. Στη συνέχεια υπολογίζεται η τετραγωνική ρίζα αυτού του αθροίσματος. Οι αριθμητικές τιμές Straipsniai / Articles 235 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK της διανυσματικής απόστασης υποδεικνύουν τον βαθμό στατιστικής ανομοιότητας μεταξύ των κειμένων και παρέχουν ένα μέτρο της απόστασης μεταξύ τους. Ενώ οι διακυμάνσεις στην τιμή της διανυσματικής απόστασης για δημοσιογραφικά κείμενα δεν είναι επαρκώς γνωστές, η απόσταση μπορεί να είναι 0 κατά τη σύγκριση πανομοιότυπων κειμένων. Αυτό συνεπάγεται ότι τα κείμενα είναι διαφορετικά αν η διανυσματική απόσταση είναι μεγαλύτερη από 0. Επιπλέον, όσο μεγαλύτερη είναι η αριθμητική τιμή της διανυσματικής απόστασης, τόσο μεγαλύτερες είναι οι γλωσσικές και στατιστικές διαφορές μεταξύ των κειμένων. Η σύγκριση με βάση την Ευκλείδεια απόσταση παρουσιάζεται σε μορφή πίνακα. Στη Στήλη 4 του Fig. 4, οι αριθμητικές τιμές αντιπροσωπεύουν τις Ευκλείδειες αποστάσεις. Το Fig. 4 παρουσιάζει τη σύγκριση του κειμένου που αναλύθηκε, του Oleksii Honcharenko (Κείμενο 1), με τρία άλλα κείμενα του ίδιου συγγραφέα: η γραμμή 1 για το Κείμενο 2 (απόσταση 0.44)· η γραμμή 2 για το Κείμενο 3 (απόσταση 0.56)· η γραμμή 3 για το Κείμενο 4 (απόσταση 0.77). Τα εμπειρικά δεδομένα καταδεικνύουν ότι η ομοιότητα μεταξύ κειμένων ενός συγγραφέα παραμένει εντός του 1, ενώ τα κείμενα άλλων συγγραφέων (γραμμές 4–10) παρουσιάζουν αποστάσεις μεγαλύτερες του 1. ΕΙΚΟΝΑ 4. Συστηματοποίηση της Ευκλείδειας απόστασης μεταξύ κειμένων Η σύγκριση των στατιστικών παραμέτρων των κειμένων μάς πείθει ότι η προτεινόμενη μεθοδολογία απόδοσης συγγραφέα αποκαλύπτει ένα υφομετρικό μοντέλο ουκρανόγλωσσων κειμένων. Το μοντέλο αυτό μπορεί επίσης να χρησιμοποιηθεί για τον προσδιορισμό της πατρότητας του κειμένου. Θα το επιβεβαιώσουμε με μια οπτική παρουσίαση της απόδοσης συγγραφέα 7 κειμένων από τρεις διαφορετικούς συγγραφείς σύμφωνα με 15 στατιστικές παραμέτρους, χρησιμοποιώντας τη μέθοδο Uniform Manifold Approximation and Projection (UMAP) (McInnes et al. 2020), ο αλγόριθμος της οποίας έχει επίσης υλοποιηθεί στο σύστημα TextAttributor. Αυτό 236 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) η τεχνική επιτρέπει τη μείωση της διαστατικότητας του χώρου χαρακτηριστικών με προβολή ενός 15-διάστατου χώρου στο επίπεδο. Στο Fig. 5, σημεία διαφορετικών σχημάτων (P1–P7 για τον Συγγραφέα 1, F1–F7 για τον Συγγραφέα 2, M1–M7 για τον Συγγραφέα 3) αντιστοιχούν σε 7 τυχαία επιλεγμένα κείμενα διαφορετικών συγγραφέων. Όπως μπορούμε να δούμε, μετά τη μείωση της διαστατικότητας, οι απεικονίσεις των σημείων των κειμένων των τριών συγγραφέων μπορούν να διαχωριστούν ορατά σε διακριτές περιοχές. Το παράδειγμα αυτό επιβεβαιώνει ότι οι παράμετροι που ορίζονται από το TextAttributor είναι σημαντικές για την περιγραφή των υφολογικών χαρακτηριστικών των κειμένων και για τον προσδιορισμό της πατρότητας του κειμένου (ακόμη και σε μειωμένη μορφή). ΕΙΚΟΝΑ 5: Γραφική αναπαράσταση της απόδοσης συγγραφέα κειμένων με χρήση της μεθόδου UMAP 4.3. Ευρετηρίαση του αρνητικού συναισθήματος του κειμένου Κατά την ανάπτυξη ενός συστήματος στατιστικών παραμέτρων για τον προσδιορισμό του ύφους και της πατρότητας του κειμένου, αναγνωρίσαμε ότι η τοξικότητα του κειμένου θα μπορούσε να λειτουργήσει ως δείκτης απόδοσης συγγραφέα. Ως εκ τούτου, δημιουργήσαμε ξεχωριστή μονάδα για τον αυτόματο προσδιορισμό του δείκτη τοξικότητας στο TextAttributor. Straispsniai / Articles 237 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK Σήμερα, η πληροφοριακή συνιστώσα έχει καταστεί ιδιαίτερα σημαντική στον υβριδικό πόλεμο. Ως εκ τούτου, το υλικό της μελέτης μας ήταν ένα ερευνητικό σώμα διαδικτυακών δημοσιογραφικών κειμένων πολιτικού λόγου, έκτασης 10 εκατομμυρίων λέξεων. Χρησιμοποιούμε τον όρο «τοξικό κείμενο» με ευρεία έννοια. Τα κείμενα αυτά χαρακτηρίζονται από παρενόχληση, απειλές, αισχρολογία, κυβερνοεκφοβισμό, τρολάρισμα και κείμενα μίσους που βασίζονται στην ταυτότητα, ενώ περιέχουν και emoticons, δηλαδή φαινόμενα και αντικείμενα που προκαλούν αρνητικά συναισθήματα σε ένα άτομο (π.χ. war, air raid, corruption). Στόχος του έργου ήταν να προσδιοριστεί η δυνατότητα εκδήλωσης αρνητικού συναισθήματος σε ουκρανικά κείμενα και να αναπτυχθεί ένα αυτοματοποιημένο σύστημα για τον εντοπισμό τοξικού περιεχομένου. Το έργο αυτό περιλάμβανε δύο διαδοχικές υποεργασίες: πρώτον, την ανάπτυξη συστήματος γλωσσικής εξέτασης τοξικών κειμένων με προσδιορισμό των δεικτών τοξικότητας μέσω λεξικογραφικής ανάλυσης και μεθόδων βασισμένων σε κανόνες· δεύτερον, την κατασκευή συνόλου δεδομένων εκπαίδευσης για σκοπούς μηχανικής μάθησης και την ανάπτυξη νευρωνικού δικτύου για την πρόβλεψη των δεικτών τοξικότητας του κειμένου. Ας εξετάσουμε την ολοκλήρωση της πρώτης εργασίας. Αυτή περιλάμβανε την κατασκευή λεξικογραφικής βάσης δεδομένων που φιλοξενούσε τρία διακριτά λεξικά: 1) Λεξικό Emotiogen: Συλλογή 5000 λέξεων (σύμφωνα με τις σημασίες των λεξικοσημασιολογικών παραλλαγών) με τόνους αρνητικού συναισθήματος, αξιολογημένες σε κλίμακα −2. Παραδείγματα περιλαμβάνουν immoral, impunity, bribery και steal· 2) Λεξικό Ρητορικής Μίσους: Περιλαμβάνει 3000 λέξεις, συμπεριλαμβανομένων ονομάτων ατόμων (1620), αισχρών όρων (613) και υβριστικού λεξιλογίου (787). Παραδείγματα περιλαμβάνουν westerner (западенець: υποτιμητική ονομασία για ανθρώπους από τις δυτικές περιοχές της Ουκρανίας) και huckster· 3) Τοξικές Φράσεις: Συλλογή 1500 ιδιωματικών εκφράσεων που μεταδίδουν αρνητικά συναισθήματα. Παραδείγματα περιλαμβάνουν grimaces like a monkey, kisses his arse and opens his mouth. Κάθε καταχώριση σε αυτούς τους καταλόγους σχολιάστηκε με σημασιολογικά χαρακτηριστικά, με το Λεξικό Ρητορικής Μίσους να διαθέτει 18 χαρακτηριστικά και τον κατάλογο Τοξικών Φράσεων 26. Για παράδειγμα, οι λέξεις στο Λεξικό Ρητορικής Μίσους επισημάνθηκαν με χαρακτηριστικά όπως ‘s’ για σεξισμό, ‘r’ για ρατσισμό και ‘e’ για ηλικιακές διακρίσεις. Αυτή η λεξικογραφική βάση δεδομένων, ένα πολυπαραμετρικό σύστημα, αποδίδει σημασιολογικά χαρακτηριστικά σε μονάδες (λέξεις ή φράσεις), τα οποία, σε συνδυασμό με δεδομένα συχνότητας από το αναλυμένο κείμενο, επιτρέπουν την ανάλυση της τοξικότητας. Ο δείκτης τοξικότητας του κειμένου υπολογίζεται με τον τύπο: Itox = (e + |K| (m + t)) / n * 10, Εδώ, n είναι η έκταση του κειμένου· e είναι ο αριθμός των συναισθηματικών λέξεων· m είναι ο αριθμός των λέξεων ρητορικής μίσους· t είναι ο αριθμός των τοξικών φράσεων· K είναι ένας συντελεστής ίσος με −2· τονίζει τις λέξεις ρητορικής μίσους και τις τοξικές φράσεις, οι οποίες σε κλίμακα 238 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) πέντε ψηφίων (+2, +1, 0, −1, −2) αντιστοιχούν στο −2. Οι τιμές του δείκτη κυμαίνονται από 0 έως +1. Για παράδειγμα, ο δείκτης τοξικότητας του κειμένου «Άνθρωποι με κόκκινο στυλό (Люди з червоною ручкою)» (12 προτάσεις, 129 λέξεις) είναι 1.01, γεγονός που υποδεικνύει την υψηλή τοξικότητά του, καθώς το κατώφλι για τόσο σύντομα κείμενα κυμαίνεται από 0.1 έως 0.7. Παράλληλα, το σύστημα παράγει τα αποτελέσματα αυτόματης γλωσσικής εξέτασης της τοξικότητας του κειμένου (βλ. Fig. 6), τα οποία περιλαμβάνουν: 1) στατιστικό χάρτη των σημασιολογικών τάξεων του αρνητικού λεξιλογίου σύμφωνα με τους ταξινομητικούς δείκτες των λεξικογραφικών καταλόγων (emotiogens – 5, vulgarisms – 2, sexism – 2)· 2) κείμενο με συγκεκριμένες λέξεις αρνητικού συναισθήματος, οι οποίες λεκτικοποιούν τις κατηγορίες του στατιστικού χάρτη. Ας εξετάσουμε ένα απόσπασμα του αναλυμένου κειμένου από την πραγματική ζωή (Fig. 6): εκείνοι οι άνθρωποι που κυκλοφορούν με κόκκινο στυλό και διορθώνουν λάθη σε αναρτήσεις άλλων ανθρώπων: ποιοι είστε επιτέλους; Έχετε ιδέα πόσο ενοχλητικοί είστε; Μελετώ επίτηδες τα προφίλ σας, με ενδιαφέρει ο κόσμος στον οποίο υπάρχετε. Αυτός ο κόσμος με τρομάζει πολύ. Ειλικρινά ελπίζω ότι στην πραγματική ζωή δεν θα διασταυρωθούν οι δρόμοι μας υπό οποιεσδήποτε συνθήκες. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересі­чемося ні за яких обставин). Εδώ, το σύστημα επισημαίνει αυτόματα με έντονα γράμματα τις ακόλουθες λέξεις με αρνητική συνιστώσα: λάθη (помилки), αναρτήσεις άλλων ανθρώπων (чужих), ενοχλητικοί (бісите), με τρομάζει (лякає). ΕΙΚΟΝΑ 6: Απόσπασμα αυτόματης γλωσσικής εξέτασης της τοξικότητας του κειμένου Straipsniai / Articles 239 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 5. ΠΡΟΣΕΓΓΙΣΕΙΣ ΜΗΧΑΝΙΚΗΣ ΜΑΘΗΣΗΣ: ΠΕΙΡΑΜΑΤΑ, ΑΠΟΤΕΛΕΣΜΑΤΑ ΚΑΙ ΣΥΖΗΤΗΣΕΙΣ Ας εστιάσουμε στον δεύτερο τρόπο λειτουργίας του συστήματος TextAttributor, ο οποίος είναι αφιερωμένος στις τεχνικές μηχανικής μάθησης. Ως είσοδο για την εκπαίδευση του μοντέλου διαθέτουμε σώματα κειμένων επισημασμένα σύμφωνα με τον στόχο κάθε υποεργασίας: (a) πληροφορίες κειμένου για την ανίχνευση τοξικότητας και (b) αναγνώριση πατρότητας. Κάθε σώμα διαιρείται σε σύνολα εκπαίδευσης και ελέγχου, καθώς και, για επαρκώς μεγάλο σώμα, σε σύνολο επικύρωσης. Οι παράμετροι του επιλεγμένου μοντέλου επίλυσης του προβλήματος εκτιμώνται στο σύνολο εκπαίδευσης. Οι υπερπαράμετροι του μοντέλου ρυθμίζονται με το σύνολο επικύρωσης. Οι τελικοί δείκτες απόδοσης του μοντέλου μετρώνται σε σύνολο ελέγχου, λαμβάνοντας υπόψη τη διαθεσιμότητα υπολογιστικών πόρων που είναι απαραίτητοι για τη λειτουργία του μοντέλου. Ένα σώμα για κάθε υποεργασία αναπτύχθηκε παράλληλα με το στοιχείο μηχανικής μάθησης του TextAttributor, επομένως τα τρέχοντα μοντέλα εκπαιδεύτηκαν σε σχετικά μικρά δεδομένα, συμπεριλαμβανομένων σύντομων διαδικτυακών κειμένων από ιστολόγια, σχόλια, άρθρα κ.ά. στην ουκρανική γλώσσα. 5.1. Ανίχνευση τοξικότητας Ως αποτέλεσμα σειράς πειραματικών μελετών, επιλέχθηκε μια υπολογιστικά αποδοτική αρχιτεκτονική που βασίζεται στη μέθοδο fastText και στα εργαλεία της (Joulin et al. 2016). Η μέθοδος αυτή παρέχει διανυσματικές αναπαραστάσεις λέξεων και εκτιμά την κατανομή πιθανότητας των εγγράφων σύμφωνα με προκαθορισμένες τάξεις. Οι λέξεις παρουσιάζονται σε διανυσματική μορφή με βάση την αυτόματη διάσπαση των λέξεων σε μέρη (υπολέξεις), γεγονός που προσομοιώνει το ανοικτό λεξικό. Η αναπαράσταση με υπολέξεις είναι σημαντική, επειδή η ουκρανική γλώσσα είναι ιδιαίτερα κλιτή και πρέπει να καλυφθούν πολλές λέξεις που δεν έχουν εμφανιστεί προηγουμένως, καθώς και λέξεις με ορθογραφικά σφάλματα. Η αποτελεσματικότητα της χρησιμοποιούμενης προσέγγισης καθορίζεται επίσης από τις τεχνικές συνθήκες λειτουργίας του συστήματος και τους διαθέσιμους κειμενικούς πόρους για την εκπαίδευση του μοντέλου. Ένα προετοιμασμένο σώμα περίπου 12,000 εγγράφων κειμένου χρησιμοποιήθηκε για δυαδική ταξινόμηση με σκοπό την ανίχνευση τοξικού περιεχομένου. Το καλύτερο αποτέλεσμα, βάσει της γενικευμένης μετρικής (F1 = 79.4%), επιτεύχθηκε με τις ακόλουθες ρυθμίσεις υπερπαραμέτρων: διαστατικότητα διανύσματος λέξης 56, αρχικός ρυθμός μάθησης 0.15, 500 εποχές εκπαίδευσης, λεξικό περιβάλλον που αναπαρίσταται με διγράμματα, μήκη υπολέξεων από 2 έως 5 χαρακτήρες και κατώφλι απόφασης 0.4. Επιπλέον, το μοντέλο παρουσίασε ευαισθησία 85%, επιτυγχάνοντας παράλληλα ακρίβεια περίπου 70%. 240 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 5.2. Αναγνώριση πατρότητας Η πειραματική έρευνα μοντέλων για την αναγνώριση της πατρότητας κειμένων πραγματοποιήθηκε χρησιμοποιώντας μέρος ενός σώματος δημοσίως διαθέσιμων κοινωνικοπολιτικών κειμένων, στα οποία είναι δυνατό να προσδιοριστεί το πρόσωπο που είναι ο συγγραφέας του εγγράφου. Επιλέχθηκαν συνολικά 702 κείμενα από τέσσερις συγγραφείς που είχαν δημοσιεύσει τον μεγαλύτερο αριθμό εγγράφων, έκτασης μεταξύ 60 και 1000 χαρακτήρων. Ο μεγαλύτερος αριθμός δημοσιεύσεων ενός συγγραφέα είναι 304 (115 χιλιάδες χαρακτήρες), ενώ ο μικρότερος 109 (49 χιλιάδες χαρακτήρες). Για τη δοκιμή επιλέχθηκαν τυχαία 25 κείμενα για κάθε επιλεγμένο συγγραφέα. Τα υπόλοιπα έγγραφα αποτέλεσαν το σύνολο εκπαίδευσης. Το καλύτερο αποτέλεσμα, σύμφωνα με τη γενικευμένη μετρική (F1 = 81%), επιτεύχθηκε με τις ακόλουθες τιμές υπερπαραμέτρων: διάσταση του χώρου ενσωμάτωσης λέξεων 50, αρχικός ρυθμός μάθησης 0.1, 50 εποχές εκπαίδευσης, λεξικό περιβάλλον που αναπαρίσταται με διγράμματα, μήκη υπολέξεων από 2 έως 5 χαρακτήρες και κατώφλι λήψης απόφασης 0.5. Αξιοσημείωτα, για ορισμένες διαμορφώσεις του μοντέλου, η ευαισθησία στον συγγραφέα με τον μεγαλύτερο αριθμό εγγράφων στο σύνολο δεδομένων έφτασε το 100%, με ακρίβεια που υπερέβαινε το 90%. Τα αποτελέσματα αυτά καταδεικνύουν τη δυνατότητα ανάπτυξης ενός αποτελεσματικού συστήματος ικανού να καλύπτει με ακρίβεια κείμενα συγγραφέων που εκπροσωπούνται επαρκώς στο σύνολο εκπαίδευσης. Τα εκπαιδευμένα μοντέλα νευρωνικών δικτύων ενσωματώθηκαν στο σύστημα TextAttributor σε αρχιτεκτονική «πελάτη-διακομιστή», όπου παρουσιάζονται τα αποτελέσματα δύο εργασιών: (a) προσδιορισμός τοξικότητας και (b) ανίχνευση πατρότητας. Το αποτέλεσμα της λειτουργίας του συστήματος στο κείμενο «Νόμος της Ουκρανίας για την Ανώτατη Εκπαίδευση»: Δείκτης τοξικότητας (εκτίμηση με τη μορφή πιθανότητας: πόσο τοξικό είναι το κείμενο) – 0.04, ομοιότητα με συγγραφείς (εκτιμήσεις με τη μορφή πιθανότητας πατρότητας για συγγραφείς γνωστούς στο σύστημα): 0.49 για την I. Farion, 0.30 για τον Oleksii Honcharenko και 0.22 για τη Mariana Bezugla. 6. ΣΥΜΠΕΡΑΣΜΑΤΑ Το σύστημα TextAttributor βρίσκεται επί του παρόντος σε φάση δοκιμών για την αντιμετώπιση ζητημάτων απόδοσης συγγραφέα και προσδιορισμού τοξικότητας σε ουκρανόγλωσσα κείμενα. Το σύστημα αυτό είναι τόσο εύχρηστο όσο και αποτελεσματικό για διάφορες τεχνολογικές μελέτες. Σε διάστημα 5 μηνών, η διαδικτυακή εφαρμογή TextAttributor ανέλυσε αυτόματα 784 ουκρανικά κείμενα από 226 χρήστες. Τα ευρήματά μας καταδεικνύουν την αποτελεσματικότητα της μεθόδου μας, η οποία περιλαμβάνει την ποσοτικοποίηση λεκτικών στοιχείων με βάση τυπικές γραμματικές και σημασιολογικές παραμέτρους, ιδιαίτερα για την αρνητική συναισθηματικότητα. Αυτό επιτυγχάνεται μέσω συνδυασμού λεξικογραφικών και βασισμένων σε κανόνες προσεγγίσεων, συμπληρωμένων από μηχανική μάθηση Straipsniai / Articles 241 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK τεχνικές. Η πειραματική έρευνα μηχανικής μάθησης για την ανίχνευση τοξικότητας και την αναγνώριση πατρότητας βάσει κειμένου μάς επέτρεψε να αποκτήσουμε αποτελέσματα συγκρίσιμα με τα αποτελέσματα πειραμάτων με παρόμοια χαρακτηριστικά μοντέλων (αριθμός εγγράφων και συγγραφέων) που έχουν αναφερθεί για άλλες γλώσσες. Τα μοντέλα υπολέξεων παρουσίασαν ενισχυμένη ανθεκτικότητα απέναντι στην ανοικτότητα του λεξιλογίου και στα κειμενικά σφάλματα. Η διεξαχθείσα έρευνα ανοίγει τον δρόμο για την επίλυση, στην ουκρανική γλώσσα, προβλημάτων όπως η ανίχνευση και παρακολούθηση τοξικού περιεχομένου, ρητορικής μίσους και παραπληροφόρησης, η επαλήθευση πατρότητας και η αποσυσκότιση, η δημιουργία προφίλ συγγραφέων και η διαριοποίηση, η ψυχογλωσσική δημιουργία προφίλ, η μοντελοποίηση ύφους και η ανίχνευση της πηγής ψευδούς περιεχομένου κ.ά. Το ανεπτυγμένο σχήμα ανάλυσης και απόδοσης κειμένων μπορεί επίσης να εφαρμοστεί σε άλλες γλώσσες. Προχωρώντας, σχεδιάζουμε να ενσωματώσουμε το εργαλείο αυτόματης απόδοσης κειμένων και ανίχνευσης τοξικότητας με σημασιολογική, συντακτική, ψυχογλωσσική και κοινωνιογλωσσική ανάλυση. Η ενσωμάτωση αυτή θα μας προσφέρει βαθύτερη κατανόηση της επίδρασης στον αναγνώστη. Χρησιμοποιώντας σημασιολογική ανάλυση της λεξιλογικής ταξινομίας, επιδιώκουμε να εντοπίσουμε αφηγηματικά στοιχεία εγγενή στο κείμενο, αυξάνοντας έτσι την αξιοπιστία της απόδοσης κειμένων στις διαδικασίες αναγνώρισης πατρότητας. Επιπλέον, σχεδιάζουμε να επεκτείνουμε τα σώματα κειμένων μας και να αξιοποιήσουμε πολυγλωσσικά μεγάλα γλωσσικά μοντέλα, ώστε να διευρύνουμε περαιτέρω τις δυνατότητες του συστήματός μας, καθώς και να υλοποιήσουμε εργαλεία για στατιστική σύγκριση κειμένων σε όλα τα υφολογικά είδη της ουκρανικής γλώσσας. Ευχαριστίες Το σύστημα δημιουργήθηκε στο πλαίσιο έργου που υποστηρίχθηκε από τη Βρετανική Πρεσβεία στο Kyiv και υλοποιήθηκε από ομάδα εκπαιδευτικών και ερευνητών της Έδρας Ουκρανικής Γλώσσας και Εφαρμοσμένης Γλωσσολογίας του Taras Shevchenko National University of Kyiv. Θα θέλαμε να εκφράσουμε την ειλικρινή μας εκτίμηση προς τη Βρετανική Πρεσβεία στο Kyiv για την οικονομική υποστήριξη αυτού του ερευνητικού έργου. Είμαστε ευγνώμονες στη Svitlana Yavorska και την Iryna Bezkorovayna για την καθοδήγηση και τη βοήθειά τους καθ’ όλη τη διάρκεια του έργου. Ιδιαίτερες ευχαριστίες στον Kostiantyn Goncharenko για την οργάνωση και τη διοικητική υποστήριξη του έργου. Επιπλέον, ευχαριστούμε τους φοιτητές του εκπαιδευτικού προγράμματος «Εφαρμοσμένη (Υπολογιστική) Γλωσσολογία και Αγγλική Γλώσσα» του Taras Shevchenko National University of Kyiv. Συνέβαλαν με τον χρόνο, την εμπειρογνωμοσύνη και τις προσπάθειές τους στη διαμόρφωση του σώματος ουκρανικών τοξικών κειμένων. Ευχαριστούμε την Oksana Tolochko, απόφοιτη του προπτυχιακού μας προγράμματος, για τη δημιουργία τονικού λεξικού της ουκρανικής γλώσσας, το οποίο χρησιμοποιήσαμε για την κατάρτιση λεξικογραφικού καταλόγου αρνητικών emoticons. Επιπλέον, εκτιμούμε βαθύτατα τις προσπάθειες του Mykola Kostikov στη διαδικασία συλλογής δεδομένων. Θα θέλαμε να εκφράσουμε την ειλικρινή μας ευγνωμοσύνη σε όλα τα μέλη της ερευνητικής κοινότητας που συνέβαλαν σε αυτή τη μελέτη με τις συμβουλές και τις διαβουλεύσεις τους. 242 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) REFERENCES ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/. Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273. Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003. Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038. Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv]. Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267. Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146. Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100. Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka. Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265. Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of Straipsniai / Articles 243 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01. Darčuk Natalija 2013: Komp’juterne anotuvannja ukrajin’s’koho tekstu: rezul’taty i perspektyvyj, Kyiv: Osvita Ukrajiny. Darčuk Natalija, Vasyl’jeva Iryna, Vasyl’jev Oleksij 2021: Vektorna model’ analizu stylistyku tekstiv. – Ukrajins’kyj fizičnyj žurnal 66(5), 373–378. Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066. Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036. Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308. Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935. Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453. Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80. Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296. Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, Jégou Hervé, Mikolov Tomas 2016: FastText.zip: Compressing text classification models. – ArXiv e-prints 1612.03651. DOI: 10.48550/arXiv.1612.03651. 244 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264. Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565. Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf. KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx. LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app. Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500. Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041. McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426. Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt. Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031. Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047. Straipsniai / Articles 245 NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts. Available at: ta.mova.info. Volos Yana, Levchenko Olena 2023: Statistical profile of Valerie Shevchuk’s idiostyle (morphological level). – Slobozhan Scientific Bulletin, Ser. Philology, 3, 32–36. DOI:10.32782/philspu/2023.3.6. Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15. Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas) SANTRAUKA Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą. 246 Acta Linguistica Lithuanica XCI The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Įteikta 2024 m. lapkričio 25 d. NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine [email protected] VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected] MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine [email protected] Straipsniai / Articles 247