scieee.
EN original LT DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

NATALIIA DARCHUK

Taras Shevchenko Nationale Universiteit van Kyiv

ORCID-id: orcid.org/0000-0001-8932-9301

Onderzoeksgebieden: computerlinguïstiek, corpuslinguïstiek, kwantitatieve linguïstiek, grammatica en semantiek van de Oekraïense taal.

OKSANA ZUBAN

Taras Shevchenko Nationale Universiteit van Kyiv

ORCID-id: orcid.org/0000-0002-2644-3892

Onderzoeksgebieden: computerlinguïstiek, linguïstische expertise, kwantitatieve linguïstiek, grammatica en semantiek van de Oekraïense taal.

VALENTYNA ROBEIKO

Taras Shevchenko Nationale Universiteit van Kyiv

ORCID-id: orcid.org/0000-0003-2266-7650

Onderzoeksgebieden: spraakanalyse, -herkenning en -synthese, fonetiek, natuurlijke taalverwerking.

YULIIA TSYHVINTSEVA

Taras Shevchenko Nationale Universiteit van Kyiv, Instituut voor de Oekraïense Taal van de Nationale Academie van Wetenschappen van Oekraïne

ORCID-id: orcid.org/0000-0002-9684-3840

Onderzoeksgebieden: Oekraïense neologie, lexicologie en lexicografie.

VICTOR SOROKIN

Taras Shevchenko Nationale Universiteit van Kyiv

ORCID-id: orcid.org/0000-0002-3637-0535

Onderzoeksgebieden: automatische syntaxisanalyse, automatische semantische analyse, natuurlijke taalverwerking.

Straipsniai / Articles

223

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

MYKOLA SAZHOK

Instituut voor informatietechnologieën en systemen van de Nationale Academie van Wetenschappen van Oekraïne

ORCID-id: orcid.org/0000-0003-1169-6851

Onderzoeksgebieden: spraakanalyse, -herkenning en -synthese, natuurlijke taalverwerking.

DOI: doi.org/10.35321/all91-09

HET SYSTEEM VOOR AUTOMATISCHE STYLOMETRISCHE ANALYSE VAN OEKRAÏENSE MEDIATEKSTEN TEXTATTRIBUTOR 1.0 (METHODEN, MIDDELEN, FUNCTIONALITEIT)

Het systeem voor automatische stylometrische analyse van Oekraïense mediateksten „TextAttributor 1.0“ (methoden, middelen, functionaliteit)

ANNOTATIE

Dit artikel presenteert de structuur, algoritmen, implementatie en experimentele resultaten van het automatische TextAttributor-systeem, ontwikkeld door de auteurs van het artikel voor de statistische parametrisering van Oekraïenstalige teksten met behulp van een multiparametrische reeks statistische indices, die de tekststijl van de auteur karakteriseren en toepasbaar zijn op taken voor auteurschapstoeschrijving. Op basis van de gecreëerde linguïstische bronnen en software genereert het systeem een linguïstische analyse op basis van de berekende statistische indices en voert het een vergelijkende studie van twee teksten uit. Een aanvullend criterium voor statistische indexering is de toxiciteitsindex van de tekst, berekend volgens de methode van verbale identificatie van toxisch sentiment. Taken voor het vaststellen van auteurschap en toxiciteit worden aangepakt met behulp van twee methoden: woordenboek- en regelgebaseerde statistische berekeningen en machinaal leren. De huidige bevindingen die in de bètaversie van TextAttributor zijn geïmplementeerd, worden grondig onderzocht.

TREFWOORDEN: Computationele linguïstiek, Oekraïense taal, sentimentanalyse, auteurschapstoeschrijving, stylometrie, tekstclassificatie.

224

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

A N O T A C I J A

Dit artikel presenteert de structuur, algoritmen, implementatie en experimentele resultaten van het door de auteurs van het artikel ontwikkelde automatische systeem „TextAttributor“, bedoeld voor de statistische parametrisering van Oekraïenstalige teksten met behulp van een multiparametrische reeks statistische indices die de tekststijl van de auteur karakteriseren en worden toegepast bij taken voor auteurschapstoeschrijving. Op basis van de gecreëerde linguïstische bronnen en software genereert het systeem een linguïstische analyse volgens de berekende statistische indices en voert het een vergelijkende analyse van twee teksten uit. Een aanvullend criterium voor statistische indexering is de index van tekst die negatieve stemmingen oproept, berekend met behulp van de methode van verbale identificatie van negatieve stemmingen. De taken van auteurschaps- en vijandigheidsdetectie worden opgelost met twee methoden: woordenboek- en regelgebaseerde statistische berekeningen en machinaal leren. De huidige resultaten die met de bètaversie van „TextAttributor“ zijn verkregen, worden uitvoerig onderzocht.

BELANGRIJKSTE WOORDEN: computationele linguïstiek, Oekraïense taal, sentimentanalyse, auteurschapstoeschrijving, stylometrie, tekstclassificatie.

1. INLEIDING

Tekstologisch onderzoek kreeg een nieuw wetenschappelijk belang door de vooruitgang van methoden uit de computationele linguïstiek, die bijdroeg aan de vorming van een nieuwe richting die als digitale tekstologie kan worden beschouwd. Binnen deze opkomende discipline conceptualiseren wij digitale tekstologie als het benutten van geautomatiseerde corpuslinguïstische technieken, gekoppeld aan mathematische modellen voor kwantitatieve tekstanalyse. Geleid door de huidige taken van de moderne kwantitatieve linguïstiek en natuurlijke taalverwerking heeft ons team een systeem voor automatische linguïstisch-statistische analyse van mediateksten ontwikkeld, dat is geïmplementeerd als een webapplicatie met de naam TextAttributor (TextAttributor 1.0 2024). Het systeem voert vier taken uit: 1) statistische tekstparametrisering; 2) stylometrie: het bepalen van de linguïstisch-statistische kenmerken van het idiolect; 3) attributie: het bepalen van de mate van overeenkomst tussen teksten; en 4) sentimentanalyse: het identificeren van lexicon met negatieve sentimenten in teksten. Daarnaast worden binnen het systeem automatisch twee linguïstische expertconclusies gegenereerd op basis van de resultaten van de tweede en vierde taak. De multifunctionaliteit van het TextAttributor-systeem vereist dat gebruikers zich vertrouwd maken met de werkingsprincipes ervan. Het doel van dit artikel is de academische en educatieve filologische gemeenschap kennis te laten maken met de ontwikkelingsmethodologie, architectuur en operationele resultaten van het systeem, om een duidelijk inzicht te verschaffen in de functies en analysemogelijkheden ervan, die bijzonder relevant zijn. Deze aanpak is vooral relevant voor het analyseren van grote hoeveelheden internetcommunicatie en

Straipsniai / Articles

225

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA RОBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

het versterken van informatiebeveiligingsstrategieën tijdens de voortdurende Russisch-Oekraïense oorlog. Het concept voor de ontwikkeling van een automatisch systeem voor Oekraïenstalige tekstattributie ontstond uit de analyse van onderzoek op het gebied van de Oekraïense corpuslinguïstiek (Darčuk 2013) en statistische studies naar de stijl van de auteur (Darčuk et al. 2021; Darchuk, Sorokin 2022; Zuban 2019), uitgevoerd met behulp van de instrumenten van het Corpus van de Oekraïense Taal (KUM) door de auteurs van het project.

Tijdens de ontwikkeling van het TextAttributor-systeem werden de volgende methoden toegepast: componentanalyse, distributieve analyse en inhoudsanalyse. Inhoudsanalyse, een kwantitatieve en kwalitatieve methode om informatie uit tekst te extraheren, maakte gebruik van natuurlijke taalverwerking en statistische technieken. Ook werden kwantisering en sentimentanalyse toegepast. Sentimentanalyse identificeert automatisch de tonaliteit van tekst op basis van zowel de emotionele kleuring als de beoordeling van gebeurtenissen of objecten door de auteur; dit werd bereikt met behulp van woordenboek- en regelgebaseerde statistische berekeningen.

Daarnaast werden methoden voor machinaal leren, waaronder deep learning, opgenomen. De statistische structuur van een tekst, opgevat als het kwantitatieve model ervan, maakt het mogelijk de functionele stijl, het auteurschap en de ontstaansperiode ervan vast te stellen. In dit werk werden de componenten van de statistische structuur geëxtraheerd door lexicale en grammaticale statistische kenmerken te analyseren met behulp van indexeringstechnieken en Euclidische afstandsmaten. De Euclidische afstand, die de afstand tussen twee punten in een n-dimensionale Euclidische ruimte meet, is een van de meest gebruikte maten in de linguïstiekstatistiek voor clusteranalyse in stylometrie en auteurschapstoeschrijving.

De nieuwheid van de resultaten bestaat uit de eerste implementatie in de computationele linguïstiek van een geautomatiseerd morfosyntactisch-semantisch stylometrisch model voor tekstanalyse, gebaseerd op 15 statistische indices die primair de morfologische en daarnaast de syntactische en semantische structuur van de tekst parametriseren. Een stylometrisch model is een reeks statistische parameters van een tekst (lexicale, morfologische, syntactische enzovoort), op basis waarvan een vergelijkende analyse van deze tekst wordt uitgevoerd met het stylometrische model van de functionele stijl. Naar onze mening is het mogelijk om door het gebruik van statische methoden bij de constructie van een stylometrisch model een strikt, deterministisch en wetenschappelijk onderbouwd systeem van gemeenschappelijke en onderscheidende kenmerken in stijlen, genres enzovoort te verkrijgen. Voor het eerst introduceert het stylometrische model de toxiciteitsindex als parameter, die mediateksten tijdens de Russisch-Oekraïense oorlog kenmerkend definieert. Dit model is niet alleen geïmplementeerd voor de functie van statistische parametrisering van teksten, die typisch is voor systemen van dit type, maar ook voor de functie van het vergelijken van de geanalyseerde tekst met de mediale stijl van de Oekraïense taal, en voor stylometrische en attributietaken waarbij twee of meer teksten betrokken zijn. De theoretische betekenis strekt zich uit tot de validering van twee methoden voor het bepalen van teksttoxiciteit en

226

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

auteurschap in het Oekraïens: 1) via woordenboek- en regelgebaseerde benaderingen, en 2) via machinaal leren, waaronder deep learning.

2. GERELATEERD ONDERZOEK

In de moderne Oekraïense linguïstiek zijn omvangrijke linguïstisch-statistische studies uitgevoerd naar de idiolecten van Oekraïense schrijvers en dichters, onder wie Taras Shevchenko, Lesya Ukrainka, Vasyl Stus (Zuban’ 2019), Ivan Franko (Buk 2021), Roman Ivanychuk (Lototska 2022), Valerii Shevchuk (Volos, Levchenko 2023), Mariia Matios, Yurii Andrukhovych, Oksana Zabuzhko (Karasov, Levchenko 2024), Ivan Drach, Mykola Vingranovsky (Darchuk et al. 2024), Lina Kostenko (Zuban’ 2019; Darchuk et al. 2024), onder anderen. Deze studies werden uitgevoerd op representatieve tekstmonsters (lange teksten), waarbij hoofdzakelijk één of enkele (niet meer dan vijf) statistische parameters werden gebruikt, vaak zonder stylometrische vergelijking. Bovendien heeft de Oekraïense linguïstiek, vanwege het arbeidsintensieve karakter van het uitvoeren van linguïstisch-statistische experimenten, uitgebreide statistische parametrisering, vergelijking van geanalyseerde teksten met standaardstatistische parameters van functionele stijlen, bepaling van de mate van tekstreeks, evenals stylometrische en attributieanalyse van korte teksten grotendeels buiten beschouwing gelaten. Het gebruik van het TextAttributor-systeem in linguïstisch-statistisch onderzoek, gericht op het automatisch uitvoeren van deze taken, zal niet alleen frequentiekenmerken van linguïstische verschijnselen opleveren, maar ook efficiënte stylometrische analyse mogelijk maken die resulteert in een deskundigenoordeel.

Het TextAttributor-systeem heeft voordelen ten opzichte van zijn tegenhangers in de mondiale wetenschap. De meeste bestaande systemen en modellen richten zich eveneens op het gebruik van afzonderlijke linguïstisch-statistische modules om één of enkele, voornamelijk formele tekstparameters (n-grammen, meest frequente woorden, letters) te identificeren (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). TextAttributor 1.0 biedt daarentegen een alomvattende aanpak, met interactieve statistische analyse van de lexicale, morfologische, syntactische en semantische structuur van de tekst in real time aan de hand van 15 parameters.

Tekstattributie wordt actief ontwikkeld in buitenlandse tekststudies; in het bijzonder wordt de doeltreffendheid van de methode van Burrows (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) getest in talrijke studies naar grote hoeveelheden tekstgegevens in verschillende stijlen, zoals: Engels proza uit het begin van de 20the eeuw (Hoover 2004); moderne Engelse poëzie (Hoover 2005); poëtische werken in het Latijn (Rybicki, Eder 2011); prozawerken van belangrijke genres in het Engels, Frans, Italiaans, Duits, Pools en Hongaars, evenals in het Latijn en Arabisch (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); politieke teksten in het Engels, waaronder

Straipsniai / Articles

227

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

de attributie van toespraken van Amerikaanse presidenten (Savoy 2015). Een andere geautomatiseerde methode voor linguïstische analyse, genaamd “Linguistic Inquiry and Word Count” (LIWC), is geïmplementeerd als commerciële toepassing en aangepast aan verschillende talen (Meier et al. 2019; LIWC-22).

De afgelopen jaren maakten de taken van automatische tekstattributie voornamelijk gebruik van regelgebaseerde stylometrische methoden of deep-learningmethoden (Eder 2015; Canhasi et al. 2022). Beide methoden zijn geïmplementeerd in het TextAttributor-systeem; ze functioneren doeltreffend, maar leveren verschillende resultaten op: 1) met de regelgebaseerde methode kan het genereren van linguïstische conclusies over idiolect en teksttoxiciteit worden geautomatiseerd; 2) de methode voor machinaal leren bepaalt alleen de mate van toxiciteit en de overeenkomst tussen teksten en kan worden gebruikt bij classificatietaken voor het monitoren van tekstuele inhoud.

De recente methoden voor machinaal leren voor sentimentanalyse en identificatie van tekstschrijvers zijn gebaseerd op statistische benaderingen (TF-IDF, Latent Dirichlet Allocation) en deep-learningtechnieken met verschillende architecturen (CNN, LSTM, BERT), gecombineerd met stylometrische methoden (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). De gerapporteerde resultaten zijn in sterke mate afhankelijk van het aantal klassen (typen toxiciteit, auteurs), het genre, de lengte van de tekst en, het belangrijkst, de omvang van het correct geannoteerde tekstcorpus dat voor de trainingsprocedure wordt gebruikt. Zo overschrijden hoge nauwkeurigheidspercentages bij het detecteren van toxiciteit en haatdragende taal 90% bij gebruik van een corpus met tienduizenden documenten (Alkomah, Ma 2022). Zo wordt bijvoorbeeld bij auteurschapstoeschrijving voor Engelstalige literaire werken van 1000 auteurs een nauwkeurigheid van meer dan 90% bereikt met een corpus van 6000 documenten voor 15 auteurs. Voor corpora met minder dan 1500 documenten bedraagt de gerapporteerde nauwkeurigheid daarentegen ongeveer 70% (Khan et al. 2023). Voor de Oekraïense taal zijn identificatie van tekstschrijvers en sentiment-/toxiciteitsanalyse onvoldoende onderzochte problemen (Lupei et al. 2020); bovendien leveren dergelijke systemen geen linguïstische expertise en kunnen ze niet worden gebruikt als instrumenten voor linguïstisch onderzoek.

3. ALGEMENE KENMERKEN VAN DE WERKING VAN HET TEXTATTRIBUTOR-SYSTEEM

Tijdens de ontwikkeling van TextAttributor werden de volgende taken voltooid: 1) Theoretische linguïstiek: er werd een methodologie ontwikkeld voor geformaliseerde morfologische, statistische, stylometrische, attributionele en sentimentanalyses; 2) Software-engineering: de structuur van linguïstische databases en de software voor de bovengenoemde automatische analyses werden ontwikkeld; 3) Experimentele linguïstiek: het systeem werd getest op Oekraïense mediateksten, en

228

Acta Linguistica Lithuanica XCI

Het systeem voor automatische stylometrische analyse van Oekraïense mediateksten TextAttributor 1.0 (methoden, middelen, functionaliteit)

een analytische module voor automatisch stylometrisch onderzoek werd geïmplementeerd. Het geautomatiseerde linguïstische systeem, geïmplementeerd als webapplicatie, verwerkt door gebruikers ingevoerde teksten in mediale stijl en genereert numerieke waarden voor statistische parameters die de kenmerken van de tekst karakteriseren. Het systeem volgt een gestructureerde werkvolgorde:

1. Teksttokenisatie: de tekst in zinnen en woorden opsplitsen voor analyse.

2. Morfologische labeling: labels aan woorden toekennen op basis van hun grammaticale vormen.

3. Contextuele analyse: de morfologische labels aanpassen aan de context.

4. Syntactische analyse: binaire relaties tussen woorden in zinnen vaststellen om hun grammaticale structuur te begrijpen.

5. Vaststelling van syntactische relaties: syntactische verbindingen bepalen op basis van vooraf vastgelegde regels.

6. Matching van emotioneel negatieve woordenschat: woorden identificeren uit een vooraf bepaalde verzameling negatieve woordenschat.

7. Evaluatie van statistische parameters: statistische parameters voor de invoertekst beoordelen met behulp van automatisch samengestelde frequentiewoordenboeken.

8. Visualisatie van resultaten: resultaten van de statistische parametrisering grafisch weergeven, met empirische waarden en betrouwbaarheidsintervallen.

9. Vergelijking van resultaten: resultaten van de statistische parametrisering voor twee teksten in mediale stijl visualiseren, zodat vergelijking mogelijk wordt.

10. Evaluatie van Euclidische afstand: de ongelijkheid tussen twee teksten in mediale stijl kwantificeren.

11. Generatie van een deskundigenoordeel: twee deskundigenoordelen genereren: één over tekstattributie en één over teksttoxiciteit via linguïstisch onderzoek.

12. Detectie van toxiciteit en identificatie van auteurs: technieken voor machinaal leren, met name neurale-netwerkmodellen, inzetten voor het detecteren van toxiciteit en het identificeren van auteurs.

De resultaten van het systeem zijn georganiseerd in de volgende onderdelen: de groep Tekstattributie-indices, het Deskundigenoordeel over tekstattributie, Vergelijking van tekstattributie, Linguïstische expertise van teksttoxiciteit en Oordelen van neurale netwerken.

In de groep Tekstattributie-indices (Fig. 1) zijn de statistische parameters georganiseerd op basis van de invoertekst: kolom 1 toont de titel van de index, kolom 2 geeft de empirische numerieke waarde weer en kolom 3 biedt een visuele referentie door de empirische waarde van de index te vergelijken met de betrouwbaarheidsinterval

Straipsniai / Articles

229

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

drempels (ondergrens en bovengrens) die zijn afgeleid uit Oekraïenstalige mediateksten. De empirische numerieke waarde wordt op de schaal weergegeven door een gevulde omgekeerde driehoek.

FIGUUR 1: Een fragment van het resultaat van de tekstattributie

In Deskundigenoordeel over tekstattributie (Fig. 2) presenteren wij conclusies over de typische of individuele linguïstisch-statistische kenmerken die voor elke geschatte index uit de geanalyseerde tekst zijn geëxtraheerd. Deze conclusies zijn afgeleid uit antwoorden op de vraag: valt de numerieke waarde van de index binnen het betrouwbaarheidsinterval van de mediale stijl van de Oekraïense taal? Op basis van een vergelijking van numerieke waarden met de drempelwaarden van het betrouwbaarheidsinterval genereert het systeem drie mogelijke antwoorden (typische kenmerken van de mediale stijl, kenmerken van het idiostijl die lager zijn dan de normale mediale stijl en kenmerken van het idiostijl die hoger zijn dan de normale mediale stijl).

In Vergelijking van tekstattributie (Fig. 4, subsectie 4.2) wordt de tabel met gegevens na het selecteren van „Calculate Vector Distance“ onmiddellijk als volgt bijgewerkt: kolom 1 vermeldt de door de gebruiker ingevoerde teksten samen met de eerder geanalyseerde tekst; kolom 2 toont het aantal zinnen in elke tekst; kolom 3 toont het aantal woorden; kolom 4 geeft de Euclidische afstand tussen de geanalyseerde tekst en elke tekst in de tabel weer; kolom 5, met het label „Compare“, start een automatische vergelijking van statistische indices tussen de geanalyseerde tekst en de geselecteerde tekst. Na het activeren van het overeenkomstige element „Compare“ wordt uitgebreide informatie over de statistische vergelijking tussen twee teksten verstrekt in de groep „Tekstattributie-indices“ (Fig. 3).

230

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

FIGUUR 2: Een voorbeeld van een gegenereerd deskundigenoordeel

In Linguïstische expertise van teksttoxiciteit (subsectie 4.3) wordt een lexicaal-semantische interpretatie van de berekende toxiciteitsindex gepresenteerd (Fig. 6).

In Oordelen van neurale netwerken presenteren wij de uitvoer van ons deep-learningmodel, dat de toxiciteit van tekst kwantificeert op een schaal van 0 (niet-toxisch) tot 1 (hoge toxiciteit). We beoordelen ook de overeenkomst van teksten met bekende auteurs, met waarden van 0 (geen overeenkomst) tot 1 (grote overeenkomst), op basis van de auteurs waarop het model is getraind. Resultaten worden alleen weergegeven voor tests met een overeenkomstmaat van meer dan 0,1. Ons huidige systeem werkt in demomodus en gebruikt een beperkt corpus van auteursteksten om de overeenkomst met door gebruikers ingevoerde tekst te meten.

4. ATTRIBUTIE VAN OEKRAÏENSTALIGE TEKSTEN: EXPERIMENTEN, RESULTATEN EN BESPREKINGEN

4.1. Statistische parametriseringsindices

Het ontwikkelde stylometrische model lost twee taken op: 1) het identificeren van individuele kenmerken van de stijl van een auteur (stylometrie); 2) het beoordelen van de overeenkomst tussen twee teksten op basis van linguïstische en statistische parameters (attributie).

Straipsniai / Articles

231

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

Er worden 19 parameters gebruikt om de door de gebruiker ingevoerde tekst statistisch te analyseren (zie Fig. 1 voor de groep Tekstattributie-indices). De eerste vier parameters omvatten elementaire kwantitatieve gegevens: aantal woorden, onverwerkte woorden, omvang van het woordenboek en aantal zinnen. Het aantal woorden omvat geen woordenschat die niet door het systeem is verwerkt, zoals dialectismen, moskovitismen, occasionele woorden enzovoort. De overige 15 parameters bestaan uit berekenbare indices die scalaire grootheden opleveren.

Voor de stylometrische analyse zullen wij Hypothese 1 valideren. Deze hypothese stelt dat het door de analyse van empirische gegevens met statistische parameters binnen en buiten het betrouwbaarheidsinterval van de Oekraïense mediale stijl mogelijk is unieke auteurskenmerken in een bepaalde mediatekst te onderscheiden. Voor elke linguïstische parameter werden op basis van Oekraïense mediatekstmonsters twee reeksen betrouwbaarheidsintervallen berekend: één voor teksten van meer dan 1000 woorden (steekproefomvang: 124,576 woorden) en één voor teksten tot 1000 woorden (steekproefomvang: 15,635 woorden).

Het betrouwbaarheidsinterval voor elke statistische parameter werd vastgesteld met behulp van de standaarddeviatie, σ, van de Gemiddelde Numerieke Waarde van de Index (ANVI) binnen het tekstmonster, aangeduid als ANVI ± σ. De standaarddeviatie schat in hoeverre de empirische numerieke waarden van statistische indices kunnen afwijken van de gemiddelde numerieke waarde van de index binnen de mediale stijl. Om nauwkeurigheid te waarborgen werd het betrouwbaarheidsinterval voor σ bepaald via een linguïstisch en statistisch experiment. Bijgevolg biedt het systeem drie mogelijke conclusies bij het toetsen van Hypothese 1: 1) de numerieke waarde van de index valt binnen het betrouwbaarheidsinterval; 2) de numerieke waarde van de index ligt onder de ondergrens van het interval; of 3) de numerieke waarde van de index overschrijdt de bovengrens van het interval.

Laten we de resultaten bekijken die zijn verkregen uit de parametrisering van Tekst 1, geschreven door blogger Oleksii Honcharenko (zie Fig. 1). Deze analyse is gebaseerd op statistische parameters en de daaropvolgende interpretatie ervan, vastgelegd in het gegenereerde deskundigenoordeel zoals weergegeven in Fig. 2.

De statistische maatstaven met betrekking tot woordenschat en tekstomvang onthullen een kwantitatieve relatie. In Tekst 1 vallen al deze indicatoren binnen het typische bereik voor de mediale stijl:

1) De variatie-index (IB) vertegenwoordigt de verhouding tussen unieke woorden en de totale tekstomvang en dient als maatstaf voor lexicale rijkdom. De IB-waarde van 0.54 valt binnen het bereik van 30%–60%, wat wijst op een gematigde mate van lexicale diversiteit;

2) De exclusiviteitsindex van de tekst (IVT) drukt de verhouding uit tussen het aantal hapax legomena die eenmaal in de tekst voorkomen en de tekstomvang. IVT van 0.36 valt binnen het bereik van 20%–40%, wat wijst op een lage lexicale exclusiviteit);

232

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

3) De exclusiviteitsindex van de woordenschat (IVL) drukt de verhouding uit tussen het aantal hapax legomena die slechts eenmaal in de tekst voorkomen en de totale omvang van de woordenschat. Een IVL van 0.66 valt binnen het bereik van 60%–76%, wat wijst op een hoge mate van lexicale exclusiviteit.

Laten we vervolgens de statistische parameters van de kwantitatieve correlatie tussen lexicale en grammaticale woordklassen in Tekst 1 bekijken:

1) De index van nominale attributen, of epithetonisering, (IIO) drukt de verhouding uit tussen het aantal zelfstandige naamwoorden en het aantal bijvoeglijke naamwoorden. Een IIO van 1.07 is hoger dan de norm van 1.0 voor de mediale stijl, wat wijst op een overwicht van zelfstandige naamwoorden boven bijvoeglijke naamwoorden, waardoor er minder epitheta in de tekst voorkomen;

2) De index van verbale attributen (IDO) drukt de verhouding uit tussen het aantal bijwoorden en het aantal werkwoorden. Een IDO van 0.57 is hoger dan de norm van 0.56 voor de mediale stijl. Deze verhouding van bijwoorden wijst op een lage graad van verbale attributen in de tekst;

3) De nominalisatiegraad (STN) drukt de verhouding uit tussen het aantal zelfstandige naamwoorden en het aantal werkwoorden. Een STN van 1.76 is lager dan de norm van 3.00 voor de mediale stijl. Een daling van deze index wijst op een overwicht van werkwoorden boven zelfstandige naamwoorden en op een lage graad van nominalisatie van de tekst;

4) De pronominalisatie-index (IPRO) drukt de verhouding uit tussen het aantal persoonlijke voornaamwoorden en de omvang van het woordgebruik in de tekst. Een IPRO van 0.09 is hoger dan de norm voor de mediale stijl en is een teken van de idiolectische stijl. Persoonlijke voornaamwoorden beslaan meer dan 7% van de tekst, wat de mate van samenhang in de tekst aangeeft;

5) De modaliteitsindex (MOD) drukt de verhouding uit tussen het aantal partikels en het aantal woorden in de tekst. IMOD van 0.07 is hoger dan de norm van 4% voor de mediale stijl en is een teken van de idiolectische stijl. Partikels beslaan meer dan 4% van de tekst, wat bepaalt in welke mate de auteur verschillende beoordelingen van verschijnselen en situaties in de tekst uitdrukt;

6) De substantiviteitsindex (ISUB) drukt de verhouding uit tussen het aantal zelfstandige naamwoorden en de omvang van het woordgebruik in de tekst. Een ISUB van 0.26 is lager dan de norm voor de mediale stijl. Zelfstandige naamwoorden beslaan minder dan 30% van de tekst, wat de lage graad van statische tekst bepaalt.

Laten we de statistische parameters van de kwantitatieve verhouding tussen woordgroepen en zinnen in Tekst 1 toelichten:

1) De dynamiekindex (IDYN) drukt de verhouding uit tussen het aantal werkwoordgroepen en het aantal nominale groepen. Een IDYN van 0.74 is hoger dan de norm van 0.6 voor de mediale stijl en is een teken van de idiolectische stijl. Het overwicht van werkwoordgroepen boven nominale groepen (IDYN groter dan 1.0) bepaalt de dynamische en snelle ontplooiing van gebeurtenissen in de betekenis van de tekst;

Straipsniai / Articles

233

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

2) De coherentie-index (IZV) drukt de verhouding uit tussen het aantal voorzetsels en voegwoorden en het aantal zinnen in de tekst. Een IZV van 0.66 valt binnen het typische bereik van 0.45 tot 0.90 voor de mediale stijl, wat wijst op een overwicht van het aantal zinnen boven het aantal voorzetsels en voegwoorden. Dit bepaalt de gemiddelde mate van samenhang tussen de werkelijkheden, verschijnselen en situaties die in Tekst 1 worden beschreven.

Bijzondere aandacht zal worden besteed aan psycholinguïstische statistische parameters (Chuhunov 2009) in Tekst 1:

1) De Trager-coëfficiënt (KT) drukt de verhouding uit tussen het aantal werkwoorden en het aantal bijvoeglijke naamwoorden in de tekst en geeft de emotionele stabiliteit/instabiliteit van de spreker aan. Een KT van 0.61 is hoger dan de norm van 0.5 voor de mediale stijl en is een teken van de idiolectische stijl. Volgens de psychologische interpretatie wijst dit op de geringe emotionaliteit van de auteur/spreker, besluiteloosheid om actieve praktische handelingen te ondernemen en angst. Een waarde binnen het bereik van 1.35 ± 0.05 bepaalt een normale emotionele stabiliteit en regulatie bij de auteur;

2) De coëfficiënt van handelingszekerheid (KOD) drukt de verhouding uit tussen het aantal werkwoorden en het aantal zelfstandige naamwoorden in de tekst. Deze verhouding geeft de mate van socialisatie van de auteur en de syntactische volledigheid van de uitspraak aan. Een KOD van 0.57 valt binnen het typische bereik van 0.30 tot 0.60 voor de mediale stijl, wat wijst op een lage graad van de coëfficiënt van geobjectiveerde handeling. Volgens de psychologische interpretatie wijst dit op een laag emotionaliteitsniveau bij de auteur/spreker, besluiteloosheid met betrekking tot actieve praktische handelingen en angst. Een waarde binnen het bereik van 1.35 ± 0.05 bepaalt een normale emotionele stabiliteit en regulatie van emoties door de auteur, wat op basis van taalkundige kenmerken wijst op een normale graad van syntactische volledigheid in zinnen en een correcte syntactische structuur;

3) De agressiviteitscoëfficiënt (KA) drukt de verhouding uit tussen het aantal werkwoorden en het werkwoordgebruik en het totale aantal woorden in de tekst, wat de agressiviteit van de taal vanuit psycholinguïstisch perspectief markeert. Een KA van 0.15 is hoger dan de norm van 13% voor de mediale stijl en is een teken van de idiolectische stijl. Volgens de psychologische interpretatie wijzen waarden onder 60% op een lage graad van agressiviteit, onderdrukte emoties van de auteur en diens besluiteloosheid. Een waarde die 60% nadert, bepaalt de normale graad van agressiviteit en emotionele stabiliteit van de auteur, terwijl waarden boven 60% wijzen op hoge agressiviteit van de auteur en emotionele opwinding.

Tot slot beschouwen we de semantische statistische parameter van Tekst 1: de teksttoxiciteitsindex (ITOX) wordt berekend op basis van de frequentie van negatieve woordenschat in de tekst (zie voor meer bijzonderheden sectie 4.3). Een ITOX-waarde van 0.36 valt binnen het typische bereik van 0.1 tot 0.7 voor de mediale stijl. ITOX vormt cognitieve en pragmatische houdingen ten opzichte van negatieve emoties.

234

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

4.2. Tekstvergelijking op basis van statistische parameters

Bij de taak om de mate van overeenkomst tussen twee teksten te beoordelen, werd Hypothese 2 getest. Deze hypothese stelt dat, indien de empirische gegevens die voortkomen uit de statistische parametrisering van twee teksten slechts een klein verschil in de numerieke waarden van de indices laten zien, deze teksten van dezelfde auteur zijn. Deze hypothese wordt binnen het systeem op twee manieren getest: 1) door de numerieke waarden van elke index in de twee teksten te vergelijken; 2) door de vectordafstand tussen de twee teksten te bepalen. Deze problemen zijn geïmplementeerd in de sectie Vergelijking van tekstauteurschap. De eerste taak omvat het vergelijken van empirische tekstgegevens met behulp van indices op de schaal van het betrouwbaarheidsinterval van de mediale stijl (Fig. 3). Zoals weergegeven in Fig. 3 worden de kwantitatieve kenmerken van de parameters van beide teksten voor het gemak van de gebruiker in verschillende kleuren weergegeven. De visualisatie vergelijkt de empirische waarden van de indices van beide teksten met de drempelwaarden van het betrouwbaarheidsinterval (ondergrens en bovengrens), afgeleid uit Oekraïense teksten in mediale stijl.

FIGUUR 3: Vergelijking van de vectordafstand van teksten

De tweede taak bestaat uit het berekenen van de vectordafstand tussen twee teksten met behulp van de Euclidische-afstandsformule. Dit houdt in dat de kwadraten van de verschillen tussen de numerieke waarden van 15 statistische parameters van de twee teksten worden opgeteld. Vervolgens wordt de vierkantswortel van deze som berekend. De numerieke waarden

Straipsniai / Articles

235

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

van de vectordafstand geven de mate van statistische ongelijkheid tussen de teksten aan en bieden een maat voor de afstand ertussen. Hoewel de schommelingen in de waarde van de vectordafstand voor mediateksten niet goed bekend zijn, kan de afstand 0 zijn bij het vergelijken van identieke teksten. Dit houdt in dat de teksten verschillend zijn als de vectordafstand groter is dan 0. Bovendien geldt: hoe groter de numerieke waarde van de vectordafstand, hoe groter de linguïstische en statistische verschillen tussen de teksten. De vergelijking van de Euclidische afstand wordt in tabelvorm weergegeven. In Kolom 4 van Fig. 4 stellen numerieke waarden de Euclidische afstanden voor. Fig. 4 toont de vergelijking van de door Oleksii Honcharenko geanalyseerde tekst (Tekst 1) met drie andere teksten van dezelfde auteur: regel 1 voor Tekst 2 (afstand 0.44); regel 2 voor Tekst 3 (afstand 0.56); regel 3 voor Tekst 4 (afstand 0.77). De empirische gegevens tonen aan dat de overeenkomst tussen teksten van één auteur binnen 1 blijft, terwijl teksten van andere auteurs (regels 4–10) afstanden groter dan 1 vertonen.

FIGUUR 4. Systematisering van de Euclidische afstand tussen teksten

Een vergelijking van de statistische parameters van de teksten overtuigt ons ervan dat de voorgestelde attributiemethodologie een stylometrisch model van Oekraïenstalige teksten onthult. Dit model kan ook worden gebruikt om het auteurschap van de tekst te bepalen. We zullen dit bevestigen met een visuele voorstelling van de attributie van 7 teksten van drie verschillende auteurs volgens 15 statistische parameters met behulp van de methode Uniform Manifold Approximation and Projection (UMAP) (McInnes et al. 2020), waarvan het algoritme eveneens in het TextAttributor-systeem is geïmplementeerd. Dit

236

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

de techniek maakt het mogelijk de dimensionaliteit van de kenmerkruimte te reduceren door een 15-dimensionale ruimte op het vlak te projecteren. In Fig. 5 corresponderen punten met verschillende vormen (P1–P7 voor Auteur 1, F1–F7 voor Auteur 2, M1–M7 voor Auteur 3) met 7 willekeurig geselecteerde teksten van verschillende auteurs.

Zoals we kunnen zien, kunnen de puntprojecties van de teksten van de drie auteurs na dimensiereductie zichtbaar in afzonderlijke gebieden worden gescheiden. Dit voorbeeld bevestigt dat de door TextAttributor gedefinieerde parameters belangrijk zijn voor het beschrijven van de stilistische kenmerken van teksten en voor het bepalen van het auteurschap van de tekst (zelfs in gereduceerde vorm).

FIGUUR 5: Grafische voorstelling van tekstattributie met behulp van de UMAP-methode

4.3. Indexering van het negatieve sentiment van de tekst

Bij de ontwikkeling van een systeem van statistische parameters om de stijl en het auteurschap van de tekst te bepalen, erkenden we dat teksttoxiciteit als attributie-index kon dienen. Daarom hebben we in TextAttributor een afzonderlijke module ontwikkeld om de toxiciteitsindex automatisch te bepalen.

Straispsniai / Articles

237

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

Vandaag de dag is de informatiecomponent bijzonder belangrijk geworden in hybride oorlogsvoering. Daarom bestond het materiaal van onze studie uit een onderzoekscorpus van onlinemediateksten uit het politieke discours, met een omvang van 10 miljoen woorden. Wij gebruiken de term “toxische tekst” in brede zin. Deze teksten worden gekenmerkt door intimidatie, bedreigingen, obsceniteit, cyberpesten, trolling en identiteitsgebonden haatteksten, en bevatten emoticons; het gaat om fenomenen en objecten die negatieve emoties bij een persoon veroorzaken (bijv. oorlog, luchtalarm, corruptie).

Dit project had tot doel het potentieel voor de realisatie van negatief sentiment in Oekraïense teksten te bepalen en een geautomatiseerd systeem voor het identificeren van toxische inhoud te ontwikkelen. Deze taak bestond uit twee opeenvolgende subtaken: ten eerste het ontwikkelen van een systeem voor taalkundig onderzoek van toxische teksten, met bepaling van de toxiciteitsindices door middel van woordenboekanalyse en regelgebaseerde methoden; ten tweede het samenstellen van een trainingsdataset voor machinaal leren en het ontwikkelen van een neuraal netwerk voor het voorspellen van toxiciteitsindices van teksten.

Laten we de uitvoering van de eerste taak bekijken. Dit omvatte de constructie van een lexicografische database met drie afzonderlijke woordenboeken:

1) Emotiogenisch woordenboek: een verzameling van 5000 woorden (volgens de betekenissen van lexicaal-semantische varianten) met negatieve sentimentnuances, beoordeeld op een schaal van −2. Voorbeelden zijn immoreel, straffeloosheid, omkoping en stelen;

2) Woordenboek van haatzaaiende taal: bestaande uit 3000 woorden, waaronder namen van personen (1620), obscene termen (613) en beledigende taal (787). Voorbeelden zijn westerling (западенець: een denigrerende benaming voor mensen uit de westelijke regio’s van Oekraïne) en p כker;

3) Toxische uitdrukkingen: een verzameling van 1500 idiomatische uitdrukkingen die negatieve emoties uitdrukken. Voorbeelden zijn grimassen als een aap, zijn reet kussen en zijn mond opendoen.

Elke vermelding in deze lijsten werd geannoteerd met semantische kenmerken; het woordenboek van haatzaaiende taal bevatte 18 kenmerken en de lijst van toxische uitdrukkingen 26. Zo kregen woorden in het woordenboek van haatzaaiende taal kenmerken toegewezen zoals ‘s’ voor seksisme, ‘r’ voor racisme en ‘e’ voor ageïsme. Deze lexicografische database, een multiparametrisch systeem, kent semantische kenmerken toe aan eenheden (woorden of uitdrukkingen) die, gecombineerd met frequentiegegevens uit de geanalyseerde tekst, toxiciteitsanalyse mogelijk maken.

De toxiciteitsindex van de tekst wordt berekend met de formule:

Itox = (e + |K| (m + t)) / n * 10,

Hierbij is n de tekstomvang; e is het aantal emotionele woorden; m is het aantal woorden uit haatzaaiende taal; t is het aantal toxische uitdrukkingen; K is een coëfficiënt gelijk aan −2; deze benadrukt woorden uit haatzaaiende taal en toxische uitdrukkingen, die op een schaal van

238

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

vijf cijfers (+2, +1, 0, −1, −2) overeenkomen met −2. Indexwaarden variëren van 0 tot +1.

Zo bedraagt de toxiciteitsindex van de tekst “Mensen met een rode pen (Люди з червоною ручкою)” (12 zinnen, 129 woorden) 1.01, wat wijst op een hoge toxiciteit, aangezien de drempel voor zulke korte teksten varieert van 0.1 tot 0.7. Tegelijkertijd genereert het systeem de resultaten van een automatisch taalkundig onderzoek van de teksttoxiciteit (zie Fig. 6), bestaande uit: 1) een statistische kaart van de semantische klassen van de negatieve woordenschat volgens de classificatiemarkeringen van de lexicografische lijsten (emotiogenen – 5, vulgarismen – 2, seksisme – 2); 2) een tekst met specifieke woorden met negatief sentiment die de categorieën van de statistische kaart verwoorden. Laten we een fragment bekijken van de geanalyseerde tekst uit de praktijk (Fig. 6):

die mensen die rondlopen met een rode pen en fouten corrigeren in andermans berichten: wie zijn jullie eigenlijk? Hebben jullie enig idee hoe vervelend jullie zijn? Ik bestudeer jullie profielen expres; ik ben benieuwd naar de wereld waarin jullie bestaan. Deze wereld maakt me bang. Ik hoop oprecht dat we elkaar in het echte leven onder geen enkele omstandigheid zullen tegenkomen. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересі­чемося ні за яких обставин).

Hier markeert het systeem automatisch de volgende woorden met een negatieve component vet: fouten (помилки), andermans (чужих), vervelend (бісите), maakt me bang (лякає).

FIGUUR 6: Een fragment van het geautomatiseerde taalkundige onderzoek van teksttoxiciteit

Straipsniai / Articles

239

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

5. BENADERINGEN VAN MACHINAAL LEREN: EXPERIMENTEN, RESULTATEN EN BESPREKINGEN

Laten we ons richten op de tweede werkingsmodus van het TextAttributor-systeem, die gewijd is aan technieken voor machinaal leren. Als invoer voor de modeltraining beschikken we over tekstcorpora die zijn gelabeld volgens het doel van elke subtaak: (a) tekstinformatie voor toxiciteitsdetectie en (b) auteurschapsidentificatie. Elk corpus wordt verdeeld in trainings- en controledatasets, en bij een corpus van voldoende omvang ook in een validatieset. De parameters van het gekozen probleemoplossingsmodel worden op de trainingsset geschat. De hyperparameters van het model worden met behulp van de validatieset aangepast. De uiteindelijke prestatie-indicatoren van het model worden gemeten op een controleset, rekening houdend met de beschikbaarheid van computerbronnen die nodig zijn voor de werking van het model. Voor elke subtaak is parallel aan de machinelearningcomponent van TextAttributor een corpus ontwikkeld; de huidige modellen zijn daarom getraind op relatief kleine gegevensverzamelingen, waaronder korte internetteksten uit Oekraïenstalige blogs, reacties, artikelen enzovoort.

5.1. Toxiciteitsdetectie

Als resultaat van een reeks experimentele studies werd een computationeel efficiënte architectuur gekozen die is gebaseerd op de fastText-methode en de bijbehorende hulpmiddelen (Joulin et al. 2016). Deze methode levert woordembeddings en schat de kansverdeling van documenten volgens vooraf bepaalde klassen. Woorden worden in vectorvorm weergegeven op basis van automatische opsplitsing van woorden in delen (subwoorden), wat de openheid van het woordenboek simuleert. De subwoordweergave is belangrijk omdat de Oekraïense taal sterk inflectief is en veel ongeziene woorden en woorden met spelfouten moeten worden gedekt. De doeltreffendheid van de gebruikte benadering wordt ook bepaald door de technische omstandigheden van de systeemwerking en de beschikbare tekstuele bronnen voor modeltraining.

Een voorbereid corpus van ongeveer 12.000 tekstdocumenten werd gebruikt voor binaire classificatie om toxische inhoud te detecteren. Het beste resultaat, gebaseerd op de gegeneraliseerde maatstaf (F1 = 79.4%), werd behaald met de volgende hyperparameterinstellingen: een woordvectordimensionaliteit van 56, een aanvankelijke leersnelheid van 0.15, 500 trainingsepochs, lexicale context weergegeven door bigrammen, subwoordlengtes variërend van 2 tot 5 tekens en een beslissingsdrempel van 0.4. Daarnaast toonde het model een sensitiviteit van 85% en een nauwkeurigheid van ongeveer 70%.

240

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

5.2. Auteurschapsidentificatie

Experimenteel onderzoek naar modellen voor tekstuele auteurschapsidentificatie werd uitgevoerd met behulp van een deel van het corpus van openbaar beschikbare sociaal-politieke teksten, waarin het mogelijk is de persoon te identificeren die de auteur van het document is. In totaal werden 702 teksten geselecteerd van vier auteurs die tussen 60 en 1000 tekens de grootste aantallen documenten publiceerden. Het grootste aantal publicaties van één auteur bedraagt 304 (115 duizend tekens), het kleinste 109 (49 duizend tekens). Voor het testen werden willekeurig 25 teksten per geselecteerde auteur getrokken. De overige documenten vormden de trainingsset.

Het beste resultaat, volgens de gegeneraliseerde maatstaf (F1 = 81%), werd behaald met de volgende hyperparameterwaarden: een dimensie van de woordinbeddingsruimte van 50, een aanvankelijke leersnelheid van 0.1, 50 trainingsepochs, lexicale context weergegeven door bigrammen, subwoordlengtes variërend van 2 tot 5 tekens en een beslissingsdrempel van 0.5. Opmerkelijk is dat voor bepaalde modelconfiguraties de sensitiviteit voor de auteur met het grootste aantal documenten in de dataset 100% bereikte, met een nauwkeurigheid van meer dan 90%. Deze resultaten tonen de haalbaarheid aan van de ontwikkeling van een effectief systeem dat teksten van auteurs die voldoende in de trainingsset vertegenwoordigd zijn nauwkeurig kan afdekken.

De getrainde neurale netwerkmodellen werden geïntegreerd in het TextAttributor-systeem volgens de “client-server”-architectuur, waarin de resultaten van twee taken worden gepresenteerd: (a) toxiciteitsbepaling en (b) auteurschapsdetectie. Het resultaat van de werking van het systeem op de tekst van de “Wet van Oekraïne inzake hoger onderwijs”: toxiciteitsindex (schatting in de vorm van een waarschijnlijkheid: hoe toxisch de tekst is) – 0.04, overeenkomst met auteurs (schattingen in de vorm van de waarschijnlijkheid van auteurschap voor auteurs die bij het systeem bekend zijn): 0.49 voor I. Farion, 0.30 voor Oleksii Honcharenko en 0.22 voor Mariana Bezugla.

6. CONCLUSIES

Het TextAttributor-systeem wordt momenteel getest om problemen met attributie en toxiciteitsbepaling binnen Oekraïenstalige teksten aan te pakken. Dit systeem is zowel gebruiksvriendelijk als doeltreffend voor verschillende technologische studies. In 5 maanden tijd heeft de TextAttributor-webapplicatie automatisch 784 Oekraïense teksten van 226 gebruikers geanalyseerd.

Onze bevindingen tonen de doeltreffendheid aan van onze methode, die verbale elementen kwantificeert op basis van formele grammaticale en semantische parameters, in het bijzonder voor negatieve emotionaliteit. Dit wordt bereikt door een combinatie van woordenboek- en regelgebaseerde benaderingen, aangevuld met machinaal leren

Straipsniai / Articles

241

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

technieken. Experimenteel onderzoek met machinaal leren voor toxiciteitsdetectie en auteurschapsidentificatie op basis van tekst leverde resultaten op die vergelijkbaar zijn met de resultaten van experimenten met vergelijkbare modelkenmerken (aantal documenten en auteurs) die voor andere talen zijn gerapporteerd. Subwoordmodellen vertoonden een grotere robuustheid tegen lexicale openheid en tekstuele fouten.

Het uitgevoerde onderzoek effent de weg voor het oplossen van dergelijke problemen voor het Oekraïens als het detecteren en monitoren van toxische inhoud, haatzaaiende taal en desinformatie, auteurschapsverificatie en deobfuscatie, auteursprofilering en diarizatie, psycholinguïstische profilering, stijlmodellering en het traceren van de bron van valse inhoud enzovoort. Het ontwikkelde schema voor tekstanalyse en -attributie kan ook op andere talen worden toegepast.

Vooruitkijkend zijn we van plan ons instrument voor automatische tekstattributie en toxiciteitsdetectie te integreren met semantische, syntactische, psycholinguïstische en sociolinguïstische analyse. Deze integratie zal ons een dieper inzicht geven in de impact op de lezer. Door semantische analyse van de lexicale taxonomie willen we narratieve elementen identificeren die inherent zijn aan de tekst, en zo de betrouwbaarheid van tekstattributie in procedures voor auteurschapsidentificatie vergroten. Daarnaast zijn we van plan onze tekstcorpora uit te breiden en meertalige grote taalmodellen te gebruiken om de mogelijkheden van ons systeem verder uit te breiden, en instrumenten te implementeren voor statistische tekstvergelijking voor alle stijlen van de Oekraïense taal.

Dankbetuigingen

Het systeem is gecreëerd binnen een project dat werd ondersteund door de Britse ambassade in Kyiv en werd uitgevoerd door een team van docenten en onderzoekers van de leerstoel Oekraïense taal en toegepaste linguïstiek van de Taras Shevchenko National University of Kyiv.

Wij willen de Britse ambassade in Kyiv onze oprechte waardering betuigen voor haar financiële steun aan dit onderzoeksproject. Wij zijn Svitlana Yavorska en Iryna Bezkorovayna dankbaar voor hun begeleiding en hulp gedurende het project. Speciale dank gaat uit naar Kostiantyn Goncharenko voor de organisatie en documentaire ondersteuning van het project. Verder zijn wij dankbaar voor de studenten van het onderwijsprogramma “Applied (Computer) Linguistics and English Language” van de Taras Shevchenko National University of Kyiv. Zij hebben hun tijd, deskundigheid en inspanningen bijgedragen aan de vorming van het corpus van Oekraïense toxische teksten. Wij zijn Oksana Tolochko, afgestudeerde van onze bacheloropleiding, dankbaar voor het samenstellen van een tonaal woordenboek van de Oekraïense taal, dat wij gebruikten om een lexicografische lijst van negatieve emoticons samen te stellen. Daarnaast waarderen wij de inspanningen van Mykola Kostikov bij het verzamelen van gegevens ten zeerste. Wij willen al die leden van de onderzoeksgemeenschap die met hun advies en consultaties aan deze studie hebben bijgedragen onze oprechte dank betuigen.

242

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

REFERENCES

ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/.

Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273.

Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003.

Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038.

Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv].

Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267.

Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146.

Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100.

Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka.

Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265.

Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of

Straipsniai / Articles

243

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01.

Darčuk Natalija 2013: Komp’juterne anotuvannja ukrajin’s’koho tekstu: rezul’taty i perspektyvyj, Kyiv: Osvita Ukrajiny.

Darčuk Natalija, Vasyl’jeva Iryna, Vasyl’jev Oleksij 2021: Vektorna model’ analizu stylistyku tekstiv. – Ukrajins’kyj fizičnyj žurnal 66(5), 373–378.

Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066.

Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036.

Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308.

Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935.

Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453.

Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80.

Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296.

Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, Jégou Hervé, Mikolov Tomas 2016: FastText.zip: Compressing text classification models. – ArXiv e-prints 1612.03651. DOI: 10.48550/arXiv.1612.03651.

244

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264.

Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565.

Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf.

KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx.

LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app.

Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500.

Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041.

McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426.

Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt.

Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031.

Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047.

Straipsniai / Articles

245

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts. Available at: ta.mova.info.

Volos Yana, Levchenko Olena 2023: Statistical profile of Valerie Shevchuk’s idiostyle (morphological level). – Slobozhan Scientific Bulletin, Ser. Philology, 3, 32–36. DOI:10.32782/philspu/2023.3.6.

Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15.

Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas)

SANTRAUKA

Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą.

246

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Įteikta 2024 m. lapkričio 25 d.

NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine [email protected]

VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine [email protected]

Straipsniai / Articles

247