This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
NATALIIA DARCHUK
Taras Shevchenko-universitetet i Kyiv
ORCID-id: orcid.org/0000-0001-8932-9301
Forskningsområden: datorlingvistik, korpuslingvistik, kvantitativ lingvistik, ukrainska språkets grammatik och semantik.
Institutet för informationsteknik och system vid Ukrainas nationella vetenskapsakademi
ORCID-id: orcid.org/0000-0003-1169-6851
Forskningsområden: talanalys, taligenkänning och talsyntes, behandling av naturligt språk.
DOI: doi.org/10.35321/all91-09
SYSTEMET FÖR AUTOMATISK STILOMETRISK ANALYS AV UKRAINSKA MEDIATEXTER TEXTATTRIBUTOR 1.0 (METODER, VERKTYG, FUNKTIONALITET)
Systemet för automatisk stilometrisk analys av ukrainska mediatexter ”TextAttributor 1.0” (metoder, verktyg, funktionalitet)
SAMMANFATTNING
Denna artikel presenterar strukturen, algoritmerna, implementeringen och de experimentella resultaten för det automatiska systemet TextAttributor, som utvecklats av artikelns författare för statistisk parametrisering av ukrainskspråkiga texter med hjälp av en multiparametrisk uppsättning statistiska index som karakteriserar författarens textstil och kan tillämpas på uppgifter för författarskapsattribuering. På grundval av de skapade lingvistiska resurserna och programvaran genererar systemet en lingvistisk analys baserad på de beräknade statistiska indexen och utför en jämförande studie av två texter. Ett ytterligare kriterium för statistisk indexering är textens toxicitetsindex, som beräknas genom metoden för verbal identifiering av toxiskt sentiment. Uppgifter för detektion av författarskap och toxicitet hanteras med två metoder: ordboks- och regelbaserade statistiska beräkningar samt maskininlärning. De aktuella resultaten som implementerats i betaversionen av TextAttributor undersöks ingående.
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
S A M M A N F A T T N I N G
I denna artikel presenteras strukturen, algoritmerna, implementeringen och de experimentella resultaten för det automatiska systemet ”TextAttributor”, som utvecklats av artikelns författare för statistisk parametrisering av texter på ukrainska med hjälp av en multiparametrisk uppsättning statistiska index som karakteriserar författarens textstil och tillämpas på uppgifter för författarskapsattribuering. På grundval av de skapade lingvistiska resurserna och programvaran genererar systemet en lingvistisk analys enligt de beräknade statistiska indexen och utför en jämförande analys av två texter. Ett ytterligare kriterium för statistisk indexering är indexet för text som framkallar negativa stämningar, vilket beräknas med metoden för verbal identifiering av negativa stämningar. Uppgifter för fastställande av författarskap och aggressivitet löses med två metoder: ordboks- och regelbaserade statistiska beräkningar samt maskininlärning. De aktuella resultaten som erhållits med hjälp av betaversionen av ”TextAttributor” analyseras ingående.
Textologisk forskning fick ny vetenskaplig betydelse i och med utvecklingen av metoder inom datorlingvistiken, vilket bidrog till framväxten av en ny riktning som kan betraktas som digital textologi. Inom denna framväxande disciplin uppfattar vi digital textologi som användning av automatiserade korpuslingvistiska metoder i kombination med matematiska modeller för kvantitativ textanalys. Med utgångspunkt i den moderna kvantitativa lingvistikens och behandlingen av naturligt språks aktuella uppgifter har vårt team utvecklat ett system för automatisk lingvistisk-statistisk analys av mediatexter, vilket har implementerats som en webbapplikation med namnet TextAttributor (TextAttributor 1.0 2024). Systemet utför fyra uppgifter: 1) statistisk textparametrisering; 2) stilometri: fastställande av språkstatistiska drag i idiolekt; 3) attribuering: fastställande av graden av likhet mellan texter; och 4) sentimentanalys: identifiering av lexikon för negativa sentiment i texter. Dessutom genereras automatiskt två lingvistiska expertutlåtanden inom systemet på grundval av resultaten från den andra och fjärde uppgiften. TextAttributors mångfunktionalitet kräver att användarna sätter sig in i dess funktionsprinciper. Syftet med denna artikel är att introducera den akademiska och utbildningsinriktade filologiska miljön till systemets utvecklingsmetodik, arkitektur och användningsresultat, för att ge en tydlig förståelse av dess funktioner och analytiska möjligheter, vilka är särskilt relevanta. Detta angreppssätt är särskilt relevant för analys av stora mängder internetkommunikation och
förbättring av informationsförsvarsstrategier under det pågående rysk-ukrainska kriget. Idén att utveckla ett automatiskt system för attribuering av ukrainskspråkiga texter uppstod ur analysen av forskning inom ukrainsk korpuslingvistik (Darčuk 2013) och statistiska studier av författarens stil (Darčuk et al. 2021; Darchuk, Sorokin 2022; Zuban 2019) som genomförts med hjälp av verktygen i Ukrainas språk-korpus (KUM) av projektets författare.
Under utvecklingen av TextAttributor-systemet användes följande metoder: komponentanalys, distributiv analys och innehållsanalys. Innehållsanalysen, en kvantitativ och kvalitativ metod för att extrahera information ur text, använde behandling av naturligt språk och statistiska tekniker. Kvantifiering och sentimentanalys tillämpades också. Sentimentanalys identifierar automatiskt textens tonalitet på grundval av både den emotionella färgningen och författarens bedömning av händelser eller objekt, vilket uppnåddes med hjälp av ordboks- och regelbaserade statistiska beräkningar.
Dessutom införlivades maskininlärningsmetoder, inklusive djupinlärning. En texts statistiska struktur, förstådd som dess kvantitativa modell, möjliggör identifiering av dess funktionella stil, författarskap och tillkomstperiod. I detta arbete extraherades den statistiska strukturens komponenter genom analys av lexikala och grammatiska statistiska särdrag med hjälp av indexeringstekniker och mått på euklidiskt avstånd. Det euklidiska avståndet, som mäter avståndet mellan två punkter i ett n-dimensionellt euklidiskt rum, är ett av de mest använda måtten inom lingvostatistiken för klusteranalys i stilometri och författarskapsattribuering.
Resultatens nyhet består i den första implementeringen inom datorlingvistiken av en automatiserad morfosyntaktisk-semantisk stilometrisk modell för textanalys, baserad på 15 statistiska index som främst parametriserar textens morfologiska samt syntaktiska och semantiska struktur. En stilometrisk modell är en uppsättning statistiska parametrar för en text (lexikala, morfologiska, syntaktiska osv.), på grundval av vilka denna text jämförs med den funktionella stilens stilometriska modell. Enligt vår uppfattning är det möjligt att genom användning av statiska metoder vid konstruktionen av en stilometrisk modell erhålla ett strikt, deterministiskt och vetenskapligt grundat system av gemensamma och särskiljande drag i stilar, genrer osv. För första gången inför stilometrimodellen parametern toxicitetsindex, som på ett karakteristiskt sätt definierar mediatexter under det rysk-ukrainska kriget. Denna modell implementeras inte bara i funktionen för statistisk parametrisering av texter, vilket är typiskt för system av denna typ, utan också i funktionen att jämföra den analyserade texten med den ukrainska språkets mediestil samt för stilometriska och attribueringsrelaterade uppgifter som omfattar två eller flera texter. Den teoretiska betydelsen sträcker sig till valideringen av två metoder för att fastställa textens toxicitet och
226
Acta Linguistica Lithuanica XCI
Page 5
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
författarskap på ukrainska: 1) genom ordboks- och regelbaserade metoder och 2) via maskininlärning, inklusive djupinlärning.
2. TIDIGARE FORSKNING
Inom modern ukrainsk lingvistik har omfattande lingvistisk-statistiska studier genomförts av ukrainska författares och poeters idiolekter, däribland Taras Shevchenko, Lesja Ukrainka, Vasyl Stus (Zuban’ 2019), Ivan Franko (Buk 2021), Roman Ivanytjuks (Lototska 2022), Valerii Sjevtjuk (Volos, Levchenko 2023), Mariia Matios, Yurii Andrukhovytj, Oksana Zabuzjko (Karasov, Levchenko 2024), Ivan Drach, Mykola Vingranovsky (Darchuk et al. 2024), Lina Kostenko (Zuban’ 2019; Darchuk et al. 2024), bland andra. Dessa studier genomfördes på representativa texturval (långa texter) med huvudsakligen en eller några få (högst fem) statistiska parametrar, ofta utan att använda stilometrisk jämförelse. På grund av det arbetskrävande arbetet med att genomföra lingvistisk-statistiska experiment har den ukrainska lingvistiken dessutom i stor utsträckning förbisett omfattande statistisk parametrisering, jämförelse av analyserade texter med standardiserade statistiska parametrar för funktionella stilar, fastställande av graden av textlikhet samt stilometrisk analys och attribueringsanalys av korta texter. Användningen av TextAttributor-systemet i lingvistisk-statistisk forskning, med syfte att utföra dessa uppgifter automatiskt, kommer inte bara att ge frekvenskännetecken för lingvistiska fenomen utan också möjliggöra effektiv stilometrisk analys som resulterar i ett expertutlåtande.
TextAttributor-systemet har fördelar jämfört med sina motsvarigheter inom den globala forskningen. De flesta befintliga system och modeller fokuserar också på användningen av enskilda lingvistisk-statistiska moduler för att identifiera en eller några få, huvudsakligen formella textparametrar (n-gram, de mest frekventa orden, bokstäver) (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). I motsats till detta erbjuder TextAttributor 1.0 ett omfattande angreppssätt, inklusive interaktiv statistisk analys av textens lexikala, morfologiska, syntaktiska och semantiska struktur i realtid utifrån 15 parametrar.
Attribuering av texter utvecklas aktivt inom utländska textstudier; i synnerhet testas Burrows metod (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) effektivitet i många studier av stora mängder textdata i olika stilar, såsom: engelsk prosa från början av 20th-talet (Hoover 2004); modern engelsk poesi (Hoover 2005); poetiska verk på latin (Rybicki, Eder 2011); prosaverk inom större genrer på engelska, franska, italienska, tyska, polska och ungerska samt latin och arabiska (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); politiska texter på engelska, inklusive
attribueringen av amerikanska presidenters tal (Savoy 2015). En annan automatiserad metod för lingvistisk analys, kallad ”Linguistic Inquiry and Word Count” (LIWC), implementeras som en kommersiell applikation och har anpassats till flera språk (Meier et al. 2019; LIWC-22).
Under de senaste åren har uppgifter inom automatisk textattribuering huvudsakligen använt antingen regelbaserade stilometriska metoder eller djupinlärningsmetoder (Eder 2015; Canhasi et al. 2022). Båda metoderna implementerades i TextAttributor-systemet och fungerar effektivt men ger olika resultat: 1) Den regelbaserade metoden möjliggör automatisering av genereringen av lingvistiska slutsatser om idiolekt och textens toxicitet; 2) maskininlärningsmetoden fastställer endast graden av toxicitet och textlikhet och kan användas i klassificeringsuppgifter för övervakning av textinnehåll.
De senaste maskininlärningsmetoderna för sentimentanalys och identifiering av textförfattarskap bygger på statistiska metoder (TF-IDF, Latent Dirichlet Allocation) och djupinlärningstekniker med olika arkitekturer (CNN, LSTM, BERT) i kombination med stilometriska metoder (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). De rapporterade resultaten är i hög grad beroende av antalet klasser (typer av toxicitet, författare), genre, textens längd och framför allt omfattningen av den korrekt annoterade textkorpus som används vid träningsförfarandet. Hög träffsäkerhet i uppgifter för detektion av toxicitet och hatretorik överstiger således 90% vid användning av en korpus som innehåller tiotusentals dokument (Alkomah, Ma 2022). Exempelvis uppnås över 90% träffsäkerhet i författarskapsattribuering för engelskspråkiga litterära verk av 1000 författare, med hjälp av en korpus på 6000 dokument för 15 författare. För korpusar som innehåller färre än 1500 dokument är den rapporterade träffsäkerheten däremot omkring 70% (Khan et al. 2023). För ukrainska språket är identifiering av textförfattarskap och sentiment-/toxicitetsanalys underbeforskade problem (Lupei et al. 2020); dessutom producerar sådana system ingen lingvistisk expertis och kan inte användas som verktyg för lingvistisk forskning.
3. ALLMÄNNA KÄNNETECKEN FÖR TEXTATTRIBUTOR-SYSTEMETS FUNKTION
Under utvecklingen av TextAttributor utfördes följande uppgifter: 1) Teoretisk lingvistik: en metod utvecklades för formaliserad morfologisk, statistisk, stilometrisk, attribueringsrelaterad och sentimentanalys; 2) programvaruutveckling: strukturen för lingvistiska databaser och programvaran för de ovannämnda automatiska analyserna utvecklades; 3) experimentell lingvistik: systemet testades på ukrainska mediatexter, och
228
Acta Linguistica Lithuanica XCI
Page 7
Systemet för automatisk stilometrisk analys av ukrainska mediatexter TextAttributor 1.0 (metoder, verktyg, funktionalitet)
en analytisk modul för automatisk stilometrisk undersökning implementerades. Det automatiserade lingvistiska systemet, som implementerats som en webbapplikation, bearbetar användarinmatade texter i mediestil och genererar numeriska värden för statistiska parametrar som karakteriserar textens egenskaper. Systemet följer en strukturerad arbetssekvens:
1. Texttokenisering: Uppdelning av texten i meningar och ord för analys.
2. Morfologisk etikettering: Tilldelning av etiketter till ord utifrån deras grammatiska former.
3. Kontextuell analys: Uppdatering av de morfologiska etiketterna med hänsyn till kontexten.
4. Syntaktisk analys: Fastställande av binära relationer mellan ord i meningar för att förstå deras grammatiska struktur.
5. Fastställande av syntaktiska relationer: Fastställande av syntaktiska samband på grundval av fördefinierade regler.
6. Matchning av emotionellt negativt ordförråd: Identifiering av ord från en fördefinierad uppsättning negativa ord.
7. Utvärdering av statistiska parametrar: Bedömning av statistiska parametrar för indatatexten med hjälp av automatiskt sammanställda frekvensordböcker.
8. Visualisering av resultat: Grafisk presentation av resultaten av den statistiska parametriseringen, med empiriska värden och konfidensintervall.
9. Jämförelse av resultat: Visualisering av resultaten av den statistiska parametriseringen för två texter i mediestil, vilket underlättar jämförelsen.
10. Utvärdering av euklidiskt avstånd: Kvantifiering av olikheten mellan två texter i mediestil.
11. Generering av expertutlåtande: Generering av två expertutlåtanden: ett om textattribuering och ett annat om textens toxicitet genom lingvistisk undersökning.
12. Toxicitetsdetektion och författarskapsidentifiering: Användning av maskininlärningstekniker, särskilt neurala nätverksmodeller, för att detektera toxicitet och identifiera författare.
Systemets resultat är organiserade i följande avsnitt: indexgruppen Text Attribution Index Group, expertutlåtandet Text Attribution Expert Opinion, jämförelsen Comparison of Text Attribution, den lingvistiska expertisen Linguistic Expertise of Text Toxicity och Neural Network Opinions.
I Text Attribution Index Group (Fig. 1) organiseras de statistiska parametrarna utifrån indatatexten: kolumn 1 visar indexets titel, kolumn 2 visar det empiriska numeriska värdet och kolumn 3 ger en visuell referens genom att jämföra indexets empiriska värde med konfidensintervallets
trösklar (nedre och övre) som härletts från ukrainska mediestiltexter. Det empiriska numeriska värdet representeras på skalan av en fylld, inverterad triangel.
FIGUR 1: Ett fragment av resultatet för textattribuering
I Text Attribution Expert Opinion (Fig. 2) presenterar vi slutsatser om de typiska eller individuella lingvistisk-statistiska särdrag som extraherats ur den analyserade texten för varje uppskattat index. Dessa slutsatser bygger på svaren på frågan: Faller indexets numeriska värde inom konfidensintervallet för den ukrainska språkets mediestil? På grundval av en jämförelse mellan numeriska värden och konfidensintervallets tröskelvärden genererar systemet tre möjliga svar (typiska tecken på mediestil, tecken på idiostil som ligger under normal mediestil och tecken på idiostil som ligger över normal mediestil).
I Comparison of Text Attribution (Fig. 4, avsnitt 4.2) uppdateras de tabellerade uppgifterna omedelbart när ”Calculate Vector Distance” väljs enligt följande: kolumn 1 listar användarinmatade texter tillsammans med den tidigare analyserade texten; kolumn 2 visar antalet meningar i varje text; kolumn 3 visar antalet ord; kolumn 4 visar det euklidiska avståndet mellan den analyserade texten och varje text i tabellen; kolumn 5, med etiketten ”Compare”, startar en automatisk jämförelse av statistiska index mellan den analyserade texten och den valda texten. När motsvarande ”Compare”-element aktiveras tillhandahålls omfattande information om den statistiska jämförelsen mellan två texter i gruppen ”Text Attribution Indices” (Fig. 3).
230
Acta Linguistica Lithuanica XCI
Page 9
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
FIGUR 2: Ett exempel på ett genererat expertutlåtande
I Linguistic Expertise of Text Toxicity (avsnitt 4.3) presenteras en lexikal-semantisk tolkning av det beräknade toxicitetsindexet (Fig. 6).
I Neural Network Opinions presenterar vi resultatet från vår djupinlärningsmodell, som kvantifierar textens toxicitet på en skala från 0 (icke-toxisk) till 1 (hög toxicitet). Vi bedömer också textlikheten med kända författare, med värden från 0 (ingen likhet) till 1 (hög likhet), baserat på de författare som modellen tränats på. Resultat visas endast för tester med ett likhetsmått som överstiger 0,1. Vårt nuvarande system fungerar i demoläge och använder en begränsad korpus av författartexter för att uppskatta likheten med användarinmatad text.
4. ATTRIBUERING AV UKRAINSKSPRÅKIGA TEXTER: EXPERIMENT, RESULTAT OCH DISKUSSION
4.1. Statistiska parametriseringsindex
Den utvecklade stilometriska modellen löser två uppgifter: 1) identifiering av individuella drag i en författares stil (stilometri); 2) bedömning av likheten mellan två texter på grundval av lingvistiska och statistiska parametrar (attribuering).
19 parametrar används för att statistiskt analysera användarens indatatext (se Fig. 1 för gruppen Text Attribution Index Group). De fyra första parametrarna omfattar grundläggande kvantitativa data: antal ord, obearbetade ord, ordboksstorlek och antal meningar. Antalet ord utesluter ordförråd som inte bearbetas av systemet, såsom dialektismer, muskovitismer, okazionalismer osv. De återstående 15 parametrarna består av beräkningsbara index som ger skalära storheter.
För den stilometriska analysen kommer vi att validera Hypotes 1. Denna hypotes hävdar att det genom analys av empiriska data som omfattar statistiska parametrar inom och utanför konfidensintervallet för den ukrainska mediestilen är möjligt att urskilja unika författardrag i en given medietext. Två uppsättningar konfidensintervall beräknades för varje lingvistisk parameter på grundval av urval av ukrainska mediatexter: ett för texter på över 1000 ord (urvalsstorlek: 124,576 ord) och ett för texter på högst 1000 ord (urvalsstorlek: 15,635 ord).
Konfidensintervallet för varje statistisk parameter fastställdes med hjälp av standardavvikelsen, σ, för indexets genomsnittliga numeriska värde (ANVI) inom texturvalet, betecknat som ANVI ± σ. Standardavvikelsen uppskattar hur mycket de empiriska numeriska värdena för statistiska index kan avvika från indexets genomsnittliga numeriska värde inom mediestilen. För att säkerställa noggrannheten fastställdes konfidensintervallet för σ genom ett lingvistiskt och statistiskt experiment. Följaktligen erbjuder systemet tre möjliga slutsatser vid prövning av Hypotes 1: 1) indexets numeriska värde faller inom konfidensintervallet; 2) indexets numeriska värde ligger under intervallets nedre tröskel; eller 3) indexets numeriska värde överstiger intervallets övre tröskel.
Låt oss betrakta resultaten från parametrisering av Text 1, författad av bloggaren Oleksii Honcharenko (se Fig. 1). Analysen grundar sig på statistiska parametrar och deras efterföljande tolkning, sammanfattad i det genererade expertutlåtandet som visas i Fig. 2.
De statistiska måtten för ordförråd och textvolym visar ett kvantitativt samband. I Text 1 ligger alla dessa indikatorer inom det typiska intervallet för mediestil:
1) Variationsindexet (IB) representerar förhållandet mellan unika ord och textens totala storlek och fungerar som ett mått på lexikal rikedom. IB-värdet 0,54 ligger inom intervallet 30–60%, vilket visar på en måttlig grad av lexikal mångfald;
2) Textens exklusivitetsindex (IVT) uttrycker förhållandet mellan antalet hapax legomena som förekommer en gång i texten och textvolymen. IVT på 0,36 ligger inom intervallet 20–40%, vilket visar på låg lexikal exklusivitet);
232
Acta Linguistica Lithuanica XCI
Page 11
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
3) Ordförrådets exklusivitetsindex (IVL) uttrycker förhållandet mellan antalet hapax legomena som förekommer endast en gång i texten och den totala ordförrådsvolymen. IVL på 0,66 ligger inom intervallet 60–76%, vilket visar på en hög grad av lexikal exklusivitet.
Låt oss därefter betrakta de statistiska parametrarna för det kvantitativa sambandet mellan lexikala och grammatiska ordklasser i Text 1:
1) Indexet för nominala attribut, eller epitetisering, (IIO) uttrycker förhållandet mellan antalet substantiv och antalet adjektiv. Ett IIO på 1.07 är högre än normen för mediestil på 1.0, vilket visar att substantiv dominerar över adjektiv och därmed resulterar i färre epitet i texten;
2) Indexet för verbala attribut (IDO) uttrycker förhållandet mellan antalet adverb och antalet verb. Ett IDO på 0.57 är högre än normen för mediestil på 0.56. Denna andel adverb visar en låg grad av verbala attribut i texten;
3) Nominaliseringsgraden (STN) uttrycker förhållandet mellan antalet substantiv och antalet verb. Ett STN på 1.76 är lägre än normen för mediestil på 3.00. En minskning av detta index visar att verb dominerar över substantiv och att textens nominaliseringsgrad är låg;
4) Pronominaliseringsindexet (IPRO) uttrycker förhållandet mellan antalet personliga pronomen och textens ordmängd. Ett IPRO på 0.09 är högre än normen för mediestil och är ett tecken på idiolekten. Personliga pronomen utgör mer än 7% av texten, vilket visar graden av sammanhållning i texten;
5) Modalitetsindexet (MOD) uttrycker förhållandet mellan antalet partiklar och antalet ord i texten. IMOD på 0.07 är högre än normen för mediestil på 4% och är ett tecken på idiolekten. Partiklar utgör mer än 4% av texten, vilket bestämmer i vilken grad författaren uttrycker olika värderingar av företeelser och situationer i texten;
6) Substantivitetsindexet (ISUB) uttrycker förhållandet mellan antalet substantiv och textens ordmängd. Ett ISUB på 0.26 är lägre än normen för mediestil. Substantiv utgör mindre än 30% av texten, vilket visar textens låga grad av statiskhet.
Låt oss förklara de statistiska parametrarna för det kvantitativa förhållandet mellan fraser och meningar i Text 1:
1) Dynamikindexet (IDYN) uttrycker förhållandet mellan antalet verbfraser och antalet nominalfraser. Ett IDYN på 0.74 är högre än normen för mediestil på 0.6 och är ett tecken på idiolekten. Att verbfraser dominerar över nominalfraser (IDYN större än 1.0) bestämmer den dynamiska och snabba utvecklingen av händelser i textens betydelse;
2) Kohesionsindexet (IZV) uttrycker förhållandet mellan antalet prepositioner och konjunktioner och antalet meningar i texten. Ett IZV på 0.66 ligger inom det typiska intervallet 0.45–0.90 för mediestil, vilket visar att antalet meningar dominerar över antalet prepositioner och konjunktioner. Detta bestämmer den genomsnittliga graden av sammanhang mellan de verkligheter, företeelser och situationer som beskrivs i Text 1.
Särskild uppmärksamhet kommer att ägnas åt psykolingvistiska statistiska parametrar (Chuhunov 2009) i Text 1:
1) Tragerkoefficienten (KT) uttrycker förhållandet mellan antalet verb och antalet adjektiv i texten och visar talarens emotionella stabilitet/instabilitet. Ett KT på 0.61 är högre än normen för mediestil på 0.5 och är ett tecken på idiolekten. Enligt den psykologiska tolkningen visar detta författarens/talarens låga emotionalitet, obeslutsamhet inför att vidta aktiva praktiska handlingar och oro. Ett värde inom intervallet 1.35 ± 0.05 bestämmer normal emotionell stabilitet och reglering hos författaren;
2) Handlingssäkerhetskoefficienten (KOD) uttrycker förhållandet mellan antalet verb och antalet substantiv i texten. Detta förhållande visar graden av författarens socialisering och utsagans syntaktiska fullständighet. Ett KOD på 0.57 ligger inom det typiska intervallet 0.30–0.60 för mediestil, vilket visar en låg grad av objektifierad handlingskoefficient. Enligt den psykologiska tolkningen tyder detta på låg emotionalitet hos författaren/talaren, obeslutsamhet när det gäller aktiva praktiska handlingar och oro. Ett värde inom intervallet 1.35 ± 0.05 bestämmer normal emotionell stabilitet och reglering av känslor hos författaren, vilket på grundval av de språkliga dragen visar en normal grad av syntaktisk fullständighet i meningarna och korrekt syntaktisk struktur;
3) Aggressivitetskoefficienten (KA) uttrycker förhållandet mellan antalet verb och verbbruk och det totala antalet ord i texten, vilket markerar språkets aggressivitet i psykolingvistiskt avseende. Ett KA på 0.15 är högre än normen för mediestil på 13% och är ett tecken på idiolekten. Enligt den psykologiska tolkningen visar värden under 60% en låg grad av aggressivitet, författarens undertryckta känslor och obeslutsamhet. Ett närmande till 60% bestämmer författarens normala grad av aggressivitet och emotionella stabilitet, medan värden över 60% visar hög aggressivitet hos författaren och emotionell upphetsning.
Slutligen ska vi betrakta den semantiska statistiska parametern för Text 1: Textens toxicitetsindex (ITOX) beräknas utifrån frekvensen av negativt ordförråd i texten (för mer information, se avsnitt 4.3). Ett ITOX-värde på 0.36 ligger inom det typiska intervallet 0.1–0.7 för mediestil. ITOX formar kognitiva och pragmatiska förhållningssätt till negativa känslor.
234
Acta Linguistica Lithuanica XCI
Page 13
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
4.2. Textjämförelse med statistiska parametrar
Uppgiften att bedöma graden av likhet mellan två texter innebar att Hypotes 2 prövades. Denna hypotes säger att om de empiriska data som erhålls genom den statistiska parametriseringen av två texter endast visar en liten skillnad i indexens numeriska värden, tillhör dessa texter samma författare. Hypotesen prövas inom systemet på två sätt: 1) genom att jämföra de numeriska värdena för varje index i de två texterna; 2) genom att bestämma vektoravståndet mellan de två texterna. Dessa problem är implementerade i avsnittet Jämförelse av textattribuering. Den första uppgiften innebär att empiriska data för texter jämförs med hjälp av index på skalan för konfidensintervallet för mediestil (Fig. 3). Som visas i Fig. 3 presenteras de kvantitativa egenskaperna hos parametrarna för båda texterna i olika färger för användarens bekvämlighet. Visualiseringen jämför de empiriska indexvärdena för båda texterna med konfidensintervallets tröskelvärden (nedre och övre), härledda från ukrainska texter i mediestil.
FIGUR 3: Jämförelse av texternas vektoravstånd
Den andra uppgiften är att beräkna vektoravståndet mellan två texter med hjälp av den euklidiska avståndsformeln. Detta innebär att kvadraterna av skillnaderna mellan de numeriska värdena för de 15 statistiska parametrarna i de två texterna summeras. Därefter beräknas kvadratroten ur denna summa. De numeriska värdena
för vektoravståndet visar graden av statistisk olikhet mellan texterna och ger ett mått på avståndet mellan dem. Även om variationerna i vektoravståndets värde för medietexter inte är välkända kan avståndet vara 0 vid jämförelse av identiska texter. Detta innebär att texterna är olika om vektoravståndet är större än 0. Ju större vektoravståndets numeriska värde är, desto större är dessutom de språkliga och statistiska skillnaderna mellan texterna. Jämförelsen av euklidiskt avstånd presenteras i tabellform. I kolumn 4 i Fig. 4 representerar de numeriska värdena de euklidiska avstånden. Fig. 4 visar en jämförelse mellan den analyserade texten av Oleksii Honcharenko (Text 1) och tre andra texter av samma författare: rad 1 för Text 2 (avstånd 0.44); rad 2 för Text 3 (avstånd 0.56); rad 3 för Text 4 (avstånd 0.77). De empiriska uppgifterna visar att likheten mellan texter av en och samma författare ligger inom 1, medan texter av andra författare (rad 4–10) uppvisar avstånd större än 1.
FIGUR 4. Systematisering av det euklidiska avståndet mellan texter
En jämförelse av texternas statistiska parametrar övertygar oss om att den föreslagna attribueringsmetodiken blottlägger en stilometrisk modell för ukrainskspråkiga texter. Denna modell kan också användas för att fastställa textens författarskap. Vi kommer att bekräfta detta genom en visuell presentation av attribueringen av 7 texter av tre olika författare enligt 15 statistiska parametrar med hjälp av metoden Uniform Manifold Approximation and Projection (UMAP) (McInnes et al. 2020), vars algoritm också är implementerad i TextAttributor-systemet. Detta
236
Acta Linguistica Lithuanica XCI
Page 15
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
teknik gör det möjligt att reducera egenskapsrummets dimensionalitet genom att projicera ett 15-dimensionellt rum på planet. I Fig. 5 motsvarar punkter med olika former (P1–P7 för författare 1, F1–F7 för författare 2, M1–M7 för författare 3) 7 slumpmässigt utvalda texter av olika författare.
Som vi kan se kan punktavbildningarna av texterna från de tre författarna efter dimensionsreduktionen synligt separeras i distinkta områden. Detta exempel bekräftar att de parametrar som definieras av TextAttributor är viktiga för att beskriva texternas stilistiska drag och för att fastställa textens författarskap (även i reducerad form).
FIGUR 5: Grafisk representation av textattribuering med UMAP-metoden
4.3. Indexering av textens negativa sentiment
När vi utvecklade ett system av statistiska parametrar för att fastställa textens stil och författarskap insåg vi att textens toxicitet kunde fungera som ett attribueringsindex. Därför skapade vi en separat modul för att automatiskt fastställa toxicitetsindexet i TextAttributor.
I dag har informationskomponenten blivit särskilt viktig i hybridkrigföring. Därför utgjordes materialet för vår studie av en forskningskorpus med onlinemedietexter inom politisk diskurs, omfattande 10 miljoner ord. Vi använder termen ”toxisk text” i vid bemärkelse. Dessa texter kännetecknas av trakasserier, hot, obscenitet, nätmobbning, trolling och identitetsbaserade hattexter samt innehåller emotikoner, det vill säga fenomen och objekt som framkallar negativa känslor hos en person (t.ex. krig, flyganfall, korruption).
Projektet syftade till att fastställa potentialen för realisering av negativt sentiment i ukrainska texter och att utveckla ett automatiserat system för identifiering av toxiskt innehåll. Uppgiften omfattade två på varandra följande deluppgifter: för det första att utveckla ett system för lingvistisk undersökning av toxiska texter med fastställande av toxicitetsindex genom ordboksanalys och regelbaserade metoder; för det andra att konstruera ett träningsdataset för maskininlärning och utveckla ett neuralt nätverk för att förutsäga textens toxicitetsindex.
Låt oss se närmare på genomförandet av den första uppgiften. Den innebar konstruktionen av en lexikografisk databas med tre separata ordböcker:
1) Emotiogenordbok: En sammanställning av 5000 ord (enligt betydelserna hos lexikalisk-semantiska varianter) med negativa sentimenttoner, graderade på en skala till −2. Exempel omfattar omoralisk, straffrihet, mutor och stjäla;
2) Hatordbok: Omfattar 3000 ord, inklusive individnamn (1620), obscena termer (613) och förolämpande språk (787). Exempel omfattar västerlänning (западенець: ett nedsättande namn på personer från de västra regionerna i Ukraina) och hästhandlare;
3) Toxiska fraser: En samling av 1500 idiomatiska uttryck som förmedlar negativa känslor. Exempel omfattar grimaserar som en apa, kysser hans arsle och öppnar munnen.
Varje post i dessa listor annoterades med semantiska särdrag, där hatordboken hade 18 särdrag och listan över toxiska fraser hade 26. Exempelvis märktes ord i hatordboken med kännetecken som ’s’ för sexism, ’r’ för rasism och ’e’ för åldersdiskriminering. Denna lexikografiska databas, ett multiparametriskt system, tilldelar enheter (ord eller fraser) semantiska särdrag som, kombinerade med frekvensdata från den analyserade texten, möjliggör toxicitetsanalys.
Textens toxicitetsindex beräknas med formeln:
Itox = (e + |K| (m + t)) / n * 10,
Här är n textens volym; e är antalet emotionella ord; m är antalet hatord; t är antalet toxiska fraser; K är en koefficient lika med −2, som betonar hatord och toxiska fraser, vilka på en skala av
238
Acta Linguistica Lithuanica XCI
Page 17
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
fem siffror (+2, +1, 0, −1, −2) motsvarar −2. Indexvärdena varierar från 0 till +1.
Exempelvis är textens toxicitetsindex i ”Personer med en röd penna (Люди з червоною ручкою)” (12 meningar, 129 ord) 1.01, vilket visar dess höga toxicitet, eftersom tröskeln för så korta texter ligger mellan 0.1 och 0.7. Samtidigt genererar systemet resultaten av en automatisk lingvistisk undersökning av textens toxicitet (se Fig. 6), bestående av: 1) en statistisk karta över de semantiska klasserna hos det negativa ordförrådet enligt de lexikografiska listornas klassificeringsmarkörer (emotiogener – 5, vulgarismer – 2, sexism – 2); 2) en text med specifika ord med negativt sentiment som verbaliserar den statistiska kartans kategorier. Låt oss se på ett utdrag ur den analyserade verkliga texten (Fig. 6):
de personer som går omkring med en röd penna och rättar misstag i andra människors inlägg: vilka är ni ens? Har ni någon aning om hur irriterande ni är? Jag studerar era profiler med avsikt, jag är nyfiken på den värld ni existerar i. Denna värld skrämmer mig mycket. Jag hoppas innerligt att vi i verkliga livet inte under några omständigheter kommer att korsa varandras vägar. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося ні за яких обставин).
Här markerar systemet automatiskt följande ord med en negativ komponent i fetstil: misstag (помилки), andra människors (чужих), irriterande (бісите), skrämmer (лякає).
FIGUR 6: Ett fragment av den automatiserade lingvistiska undersökningen av textens toxicitet
5. METODER FÖR MASKININLÄRNING: EXPERIMENT, RESULTAT OCH DISKUSSION
Låt oss fokusera på TextAttributor-systemets andra driftläge, som ägnas åt maskininlärningstekniker. Som indata för modellträningen har vi textkorpusar märkta enligt målet för varje deluppgift: (a) textinformation för toxicitetsdetektion och (b) författaridentifiering. Varje korpus delas upp i tränings- och kontrollmängder samt, för en tillräckligt stor korpus, en valideringsmängd. Parametrarna för den valda problemlösningsmodellen uppskattas på träningsmängden. Modellens hyperparametrar justeras med hjälp av valideringsmängden. Modellens slutliga prestandaindikatorer mäts på en kontrollmängd, med hänsyn till tillgången till beräkningsresurser som krävs för modellens funktion. En korpus för varje deluppgift utvecklades parallellt med TextAttributors maskininlärningskomponent, varför de aktuella modellerna tränades på relativt små datamängder som omfattade korta internettexter från ukrainskspråkiga bloggar, kommentarer, artiklar osv.
5.1. Toxicitetsdetektion
Som ett resultat av en serie experimentella studier valdes en beräkningsmässigt effektiv arkitektur baserad på fastText-metoden och dess verktyg (Joulin et al. 2016). Denna metod tillhandahåller ordinbäddningar och uppskattar sannolikhetsfördelningen för dokument enligt fördefinierade klasser. Ord representeras i vektorform baserat på automatisk uppdelning av ord i delar (delord), vilket simulerar ett öppet ordförråd. Delordsrepresentationen är viktig eftersom ukrainskan är starkt böjningsrik och många tidigare osedda ord samt ord med stavfel måste täckas. Effektiviteten hos den använda metoden bestäms också av de tekniska villkoren för systemets drift och de textresurser som är tillgängliga för modellträning.
En förberedd korpus med cirka 12 000 textdokument användes för binär klassificering för att upptäcka toxiskt innehåll. Det bästa resultatet, baserat på det generaliserade måttet (F1 = 79.4%), uppnåddes med följande hyperparameterinställningar: en ordvektordimensionalitet på 56, en initial inlärningshastighet på 0.15, 500 träningsepoker, lexikaliskt sammanhang representerat av bigram och delordslängder från 2 till 5 tecken samt en beslutströskel på 0.4. Dessutom visade modellen en sensitivitet på 85% samtidigt som den uppnådde en noggrannhet på cirka 70%.
240
Acta Linguistica Lithuanica XCI
Page 19
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
5.2. Författaridentifiering
Experimentell forskning om modeller för identifiering av textförfattarskap genomfördes med hjälp av en del av korpusen med offentligt tillgängliga sociopolitiska texter, där det är möjligt att identifiera den person som är dokumentets författare. Totalt valdes 702 texter från fyra författare som publicerade det största antalet dokument på mellan 60 och 1000 tecken. Det största antalet publikationer av en författare är 304 (115 tusen tecken), och det minsta är 109 (49 tusen tecken). För testning togs 25 texter per utvald författare slumpmässigt ut. Resten av dokumenten utgjorde träningsmängden.
Det bästa resultatet enligt det generaliserade måttet (F1 = 81%) uppnåddes med följande hyperparametervärden: en dimension på 50 för ordinbäddningsrymden, en initial inlärningshastighet på 0.1, 50 träningsepoker, lexikaliskt sammanhang representerat av bigram och delordslängder från 2 till 5 tecken samt en beslutströskel på 0.5. Anmärkningsvärt är att känsligheten för författaren med det största antalet dokument i datasetet för vissa modellkonfigurationer nådde 100%, med en noggrannhet över 90%. Dessa resultat visar möjligheten att utveckla ett effektivt system som kan täcka texter av författare som är tillräckligt representerade i träningsmängden med hög noggrannhet.
De tränade neurala nätverksmodellerna integrerades i TextAttributor-systemet i ”klient-server”-arkitekturen, där resultaten av två uppgifter presenteras: (a) toxicitetsbestämning och (b) författarskapsdetektion. Resultatet av systemets arbete med texten ”Ukrainas lag om högre utbildning”: Toxicitetsindex (uppskattning i form av sannolikhet: hur toxisk texten är) – 0.04, likhet med författare (uppskattningar i form av sannolikheten för författarskap för författare som är kända för systemet): 0.49 för I. Farion, 0.30 för Oleksii Honcharenko och 0.22 för Mariana Bezugla.
6. SLUTSATSER
TextAttributor-systemet genomgår för närvarande testfaser för att hantera problem med attribuering och toxicitetsbestämning i ukrainskspråkiga texter. Systemet är både användarvänligt och effektivt för olika tekniska studier. Under 5 månader har TextAttributors webbapplikation automatiskt analyserat 784 ukrainska texter av 226 användare.
Våra resultat visar effektiviteten hos vår metod, som innebär kvantifiering av verbala element utifrån formella grammatiska och semantiska parametrar, särskilt för negativ emotionalitet. Detta uppnås genom en kombination av ordboks- och regelbaserade metoder, kompletterade med maskininlärning
tekniker. Experimentell maskininlärningsforskning för toxicitetsdetektion och författaridentifiering genom text gjorde det möjligt för oss att erhålla resultat jämförbara med resultaten från experiment med liknande modellegenskaper (antal dokument och författare) som rapporterats för andra språk. Delordsmodeller visade ökad robusthet mot lexikal öppenhet och textfel.
Den genomförda forskningen banar väg för att lösa sådana problem för ukrainskan som detektering och övervakning av toxiskt innehåll, hatretorik och desinformation, verifiering av författarskap och avobfuskering, författarprofilering och diarieföring, psykolingvistisk profilering, stilmodellering och spårning av källan till falskt innehåll osv. Det utvecklade schemat för textanalys och attribuering kan också tillämpas på andra språk.
Framöver planerar vi att integrera vårt verktyg för automatisk textattribuering och toxicitetsdetektion med semantisk, syntaktisk, psykolingvistisk och sociolingvistisk analys. Denna integration kommer att ge oss en djupare förståelse av påverkan på läsaren. Genom att använda semantisk analys av lexikal taxonomi strävar vi efter att identifiera narrativa element som är inneboende i texten och därigenom öka tillförlitligheten hos textattribuering i förfaranden för författarskapsidentifiering. Dessutom planerar vi att utvidga våra textkorpusar och använda flerspråkiga stora språkmodeller för att ytterligare utöka systemets möjligheter samt implementera verktyg för statistisk textjämförelse för alla stilar i det ukrainska språket.
Tack
Systemet har skapats inom ramen för ett projekt som stöds av British Embassy in Kyiv och genomförts av ett team av lärare och forskare vid institutionen för ukrainska språket och tillämpad lingvistik vid Taras Shevchenko National University of Kyiv.
Vi vill uttrycka vår uppriktiga uppskattning till British Embassy in Kyiv för dess ekonomiska stöd till detta forskningsprojekt. Vi är tacksamma mot Svitlana Yavorska och Iryna Bezkorovayna för deras vägledning och hjälp under hela projektet. Ett särskilt tack riktas till Kostiantyn Goncharenko för projektets organisering och dokumentationsstöd. Vidare är vi tacksamma mot studenterna på utbildningsprogrammet ”Tillämpad (dator-)lingvistik och engelska” vid Taras Shevchenko National University of Kyiv. De har bidragit med sin tid, sakkunskap och sina insatser till att skapa korpusen av ukrainska toxiska texter. Vi är tacksamma mot Oksana Tolochko, en tidigare student på vårt kandidatprogram, för att ha skapat en tonal ordbok över det ukrainska språket, som vi använde för att sammanställa en lexikografisk lista över negativa emotikoner. Dessutom uppskattar vi djupt de insatser som Mykola Kostikov gjort i datainsamlingsprocessen. Vi vill uttrycka vår uppriktiga tacksamhet till alla medlemmar av forskarsamhället som bidrog till denna studie med råd och konsultationer.
242
Acta Linguistica Lithuanica XCI
Page 21
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
REFERENCES
ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/.
Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273.
Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003.
Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038.
Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv].
Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267.
Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146.
Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100.
Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka.
Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265.
Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of
sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01.
Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066.
Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036.
Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308.
Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935.
Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453.
Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80.
Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296.
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264.
Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565.
Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf.
KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx.
LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app.
Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500.
Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041.
McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426.
Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt.
Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031.
Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047.
Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15.
Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas)
SANTRAUKA
Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą.
246
Acta Linguistica Lithuanica XCI
Page 25
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Įteikta 2024 m. lapkričio 25 d.
NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine [email protected]
VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine [email protected]