Straipsniai / Articles 223 NATALIIADARCHUK TarasShevchenkoNationalUniversityofKyiv ORCIDid:orcid.org/0000-0001-8932-9301 Les domaines de recherche sont la linguistique informatique, la linguistique des corpus, la linguistique quantitative, la grammaire et la sémantique de la langue. La langue ukrainienne. OKSANA ZUBAN (nombre de membres du groupe) Université nationale Taras Shevchenko de Kiev (ORCID id: orcid.org) et ses domaines de recherche sont la linguistique informatique, l'expertise linguistique, la linguistique quantitative, la grammaire et la sémantique de la langue. La langue ukrainienne. Je suis VALENTYNA ROBEIKO Taras Shevchenko Université nationale de Kiev ORCID id: orcid.org/0000-0003-2266-7650 Les domaines de recherche sont l'analyse de la parole, la reconnaissance et la synthèse, la phonétique et le traitement du langage naturel. YULIIA TSYHVINTSEVA a été arrêtée. Université nationale de Kiev Taras Shevchenko, Institut de la langue ukrainienne de l'Académie nationale des sciences d'Ukraine ORCID id: orcid.org/0000-0002-9684-3840 Les domaines de recherche sont la néologie ukrainienne, la lexicologie et la lexicographie. Je suis Victor Sorokin. Analyse sémantique de l'Université nationale de Kiev ORCIDid:orcid.org/0000-0002-3637-0535 Fieldsofresearch:automaticsyntaxanalysis,automatic Taras Shevchenko, traitement du langage naturel.
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 224 Acta Linguistica Lituanica XCI (en anglais) Mykola Sakhok a été arrêté. Institut des technologies et des systèmes de l'information de l'Académie nationale des sciences de l'Ukraine Le numéro d'identification ORCID est le suivant: orcid.org/0000-0003-1169-6851 Champs de recherche: analyse de la parole, reconnaissance et synthèse, traitement du langage naturel. DOI: doi.org/10.35321/all91-09 (en anglais) THESYSTEMFORAUTOMATIC STYLOMETRICANALYSIS OFUKRAINIANMEDIA TEXTSTEXTATTRIBUTOR1.0 (techniques, moyens, Fonctionnalité) Système d'analyse automatique des stylométries des textes ukrainiens […]TextAttributor 1.0[…] (méthodes, mesures, fonctionnalités) Notation à l'appui Cet article présente la structure, les algorithmes, la mise en œuvre et les résultats expérimentaux du système automatique TextAttributor développé par les auteurs de l'article pour la paramétrisation statistique du texte en langue ukrainienne à l'aide d'un ensemble multiparamétrique d'indices statistiques, caractérisant le style du texte de l'auteur et applicables aux tâches d'attribution de l'auteur. Sur la base des ressources linguistiques et du logiciel créés, le système génère une analyse linguistique basée sur les indices statistiques calculés et effectue une étude comparative de deux textes. "L'analyse linguistique numérique est une nouvelle direction qui peut être considérée comme une textologie numérique. ""L'analyse linguistique numérique est une nouvelle direction qui
Les articles 225 et 225 du Statut The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) ANOTACIJA Šiame straipsnyje pristatoma straipsnio autorių sukurtos automatinės sistemos […]TextAttributor[…], skirtos statistiniam ukrainiečių kalbos tekstų parametrizavimui naudojant daugiaparametrinį statistinių rodiklių rinkinį, apibūdinantį autoriaus stilių ir taikystės autorystės uždaviniams, struktūra, algoritmai, įdiegimas ir eksperimentiniai rezultatai. Sukurtų lingvistinių ir programinių pagrindu sistema generuoja lingvistinę analizę pagal statistinius indeksus ir at at tekstų lyginą analizą statistinio indeksavimo kriterijus yra pagrįmas nuika sukeliančio indeksas, davidajimas nuikavimo metodą tekstų. Autoramos ir ir ir ir ir irimajimas irimajimo. rezultatai,gautinaudojantis„TextAttributor“betaversija,išsamiaiišnagrinėti. ESMINIAIŽODŽIAI:kompiuterinėlingvistika,ukrainiečiųkalba,jausmingumoanalizė, 1. INTRODUCTION (présentation de la présente décision) Textologicalresearchgainednewscientificimportancewiththeadvancement ofcomputationallinguisticsmethods,whichcontributedtotheformationofa peut être considérée comme une textologie numérique. ""L'analyse linguistique numérique est une nouvelle direction qui peut être considérée comme une nouvelle direction qui peut être considérée comme une nouvelle direction qui peut être considérée comme une nouvelle direction qui peut être considérée comme une nouvelle direction."
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 226 ActaLinguisticaLithuanicaXCI enhancinginformationdefencestrategiesduringtheongoingRussian-Ukrainian le concept de développement d'un système automatique d'outils en langue ukrainienne du textattributionarosefromtheanalysisofresearchinthefieldofUkrainian corpuslinguistics(Darčuk 2013)andstatisticalstudiesoftheauthor’s style (Darčuket al.2021;Darchuk,Sorokin2022;Zuban’2019)conductedusingthe Corpus de la langue ukrainienne (KUM) par les auteurs du projet. L'analyse des sentiments During the development of the TextAttributor system, the following methodswereemployed:componentanalysis,distributiveanalysis,andcontent analysis.Contentanalysis,aquantitativeandqualitativemethodforextracting identifie automatiquement la tonalité du texte en fonction à la fois de la coloration émotionnelle et de l'évaluation des événements ou des objets par l'auteur, ce qui a été réalisé en utilisant des calculs statistiques basés sur des dictionnaires et des règles. La structure statistique d'un texte, comprise comme son modèle quantitatif, permet d'identifier son style fonctionnel, son auteur et sa période de création.Dans ce travail, les composants de la structure statistique ont été extraits en analysant les caractéristiques statistiques lexicales et grammaticales à l'aide de techniques d'indexation et de mesures de distance euclidiennes.La distance euclidienne, qui mesure la distance entre deux points dans un espace euclidien n-dimensionnel, est l'une des mesures les plus largement utilisées en statistique pour l'analyse de grappes dans la linguétrie et l'attribution d'auteur. The novelty of the results is the first implementation in computational linguistics of an automated morpho-syntactic-semantic stylometric model Pour l'analyse du texte, basé sur 15 indices statistiques qui paramétrent principalement la structure morphologique, ainsi que syntaxique et sémantique du texte, un modèle stylométrique est un ensemble de paramètres statistiques d'un texte (lexical, morphologique, syntaxique, etc.), sur la base desquels une analyse comparative de ce texte est effectuée avec le modèle stylométrique russe du style fonctionnel.
Straipsniai articles 227 et 227 de la convention The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) authorshipinUkrainian:1)throughdictionaryandrule-basedapproaches,and 2)viamachinelearning,includingdeeplearning. 2. Travaux connexes Dans la linguistique ukrainienne moderne, d'importantes études linguistiques et statistiques ont été menées sur les idiolectes des écrivains et poètes ukrainiens, dont Taras Shevchenko, Lesya Lesinka, Vasyl Stus (Zubanov, 2019), Ivan Franko (Bukov, 2021), Roman Ivanychuk (Lotka), Valery Shevchuk (Volos, Levchenko, 2023), Maria Matios, Yaras Andrukhovych, Oksana Zabuzhko (K4, 2020), Levchenko, Ivan Drach, Mykola Vingranovsky (Darchuk et al., 2020) parmi d'autres. Ces études ont été menées sur des échantillons représentatifs (texts longs) en utilisant principalement un ou un (pas plus de cinq) paramètres statistiques, sans appliquer de phénomènes linguistiques similaires. La plupart des systèmes et modèles existants se concentrent également sur l'utilisation de modules linguistiques et statistiques individuels pour identifier un ou plusieurs paramètres de texte, principalement formels (n-grammes, mots, lettres les plus fréquents) (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). L'attribution de textes est activement développée dans les études textuelles étrangères, en particulier la méthode de Burrows (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) son efficacité est testée dans de nombreuses études sur de grands volumes de données textuelles de différents styles comme: la prose anglaise du début du XXe siècle (Hoover 2004); la poésie anglaise moderne (Hoover 2005); les œuvres poétiques en latin (Rybicki, 2011); les œuvres en prose des principaux genres en anglais, français, italien, allemand, polonais, hongrois, ainsi que en latin et arabe (Eder, 2011; Evert et al. 2015; Jannidis et al. 2015).
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 228 ActaLinguisticaLithuanicaXCI theattributionofspeechesofAmericanpresidents(Savoy2015).Onemore Une méthode d'analyse linguistique automatisée appelée "Linguistic Inquiry and Word Count" (LIWC) est mise en œuvre en tant qu'application commerciale et adaptée à plusieurs langues (Meier et al. 2019; LIWC-22). Ces dernières années, les tâches d'attribution automatique de texte ont principalement utilisé des méthodes stylométriques basées sur des règles ou des méthodes d'apprentissage profond (Eder 2015; Canhasi et al. 2022). Les deux méthodes ont été mises en œuvre dans le système TextAttributor, fonctionnant efficacement mais donnant des résultats différents: 1) La méthode basée sur des règles permet d'automatiser la génération de conclusions linguistiques sur la toxicité idiolecte et du texte. Les méthodes récentes d'apprentissage automatique pour l'analyse du sentiment et l'identification de l'auteur du texte sont basées sur des approches statistiques (style-IDF, allocation latente de Dirichlet) et des techniques d'apprentissage profond avec diverses architectures (CNN, LSATM, BERT) en combinaison avec des méthodes stylométriques (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023) Les résultats sont extrêmement dépendants du nombre de classes (types de toxicité, auteurs), du genre, de la longueur du texte et, surtout, du volume du corpus de texte correctement structuré utilisé pour la procédure de formation. turn,forcorporacontaininglessthan1500documentsthereportedaccuracy isabout70%(Khanet al.2023).FortheUkrainianlanguage,textauthorship (Lupeiet al.2020),moreover,suchsystemsdonotproducelinguisticexpertise andcannotbeusedastoolsforlinguisticresearch.
Straipsniai / Articles 229 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 1. Tokenisation du texte: Décomposition du texte en phrases et en mots pour l'analyse. 2. Étiquetage morphologique: Attribuer des étiquettes aux mots en fonction de leurs formes grammaticales. 3. Analyse contextuelle: mise à jour des étiquettes morphologiques concernant le contexte. 4. analyse syntaxique: établir des relations binaires entre les mots dans les phrases pour comprendre leur structure grammaticale. 5. Établissement de relations syntaxiques: détermination de connexions syntaxiques basées sur des règles prédéfinies. 6. Correspondance du vocabulaire émotionnellement négatif: Identifier des mots d'un ensemble prédéfini de vocabulaire négatif. 7. Évaluation des paramètres statistiques: évaluation des paramètres statistiques pour le texte d'entrée à l'aide de vocabulaires de fréquence compilés automatiquement. 8. Visualisation des résultats: présentation des résultats de la paramétrisation statistique graphically,withempiricalvaluesandconfidenceintervals. 9.Comparison of Results:Visualizingstatisticalparameterizationoutcomes fortwomedia-styletexts,facilitatingcomparison. 10.Euclidean Distance Evaluation:Quantifyingthedissimilaritybetween twomedia-styletexts. 11. Génération d'opinions d'experts: Génération de deux opinions d'experts: l'une sur l'attribution du texte et l'autre sur la toxicité du texte par l'examen linguistique. 12. Détection de la toxicité et identification de l'auteur: exploiter les techniques d'apprentissage automatique, en particulier les modèles de réseaux neuronaux, pour détecter la toxicité et identifier les auteurs. Les résultats du système sont organisés dans les parties suivantes: groupe d'index d'attribution de texte, avis d'expert en attribution de texte, comparaison de l'attribution de texte, expertise linguistique de la toxicité du texte et réseau neural. Des opinions. In Text Attribution Index Group (Fig. 1), statistical parameters are organizedbasedontheinputtext:column1displaystheIndextitle,column 2 présente la valeur numérique empirique et la colonne 3 fournit une référence visuelle en comparant la valeur empirique de l'indice avec l'intervalle de confiance
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 230 Acta Linguistica Lithuanica seuils XCI (inférieur et supérieur) dérivés de textes de style médiatique ukrainien. La valeur numérique empirique est représentée sur l'échelle par un triangle inversé rempli. FIGURE 1: Un fragment du résultat de l'attribution du texte Dans l'opinion d'expert sur l'attribution du texte (fig. 2), nous présentons des conclusions concernant les caractéristiques statistiques linguistiques typiques ou individuelles extraites du texte analysé pour chaque indice estimé. Ces conclusions sont dérivées des réponses à la question: la valeur numérique de l'indice se situe-t-elle dans l'intervalle de confiance du style médiatique de la langue ukrainienne? Dans la comparaison de l'attribution de texte (Fig. 4, sous-section 4.2), en sélectionnant "Calculer la distance vectorielle", les données tabulées sont rapidement mises à jour comme suit: la colonne 1 répertorie les textes saisis par l'utilisateur avec le texte analysé précédemment; la colonne 2 affiche le nombre de phrases dans chaque texte; la colonne 3 montre le nombre de mots; la colonne 4 présente la distance euclidienne entre le texte analysé et chaque texte dans le tableau; la colonne 5, intitulée "Comparer", initiatesanautomaticcomparisonofstatisticalindicesbetweentheanalyzedtext andtheselectedtext.Uponactivatingthecorresponding“Compare”element, comprehensiveinformationonthestatisticalcomparisonbetweentwotextsis providedinthe“TextAttributionIndices”group(Fig.3).
Straipsniai articles 231 et 231 de la convention The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Figure 2: Un exemple de modèle d'opinion d'expert généré, qui quantifie la toxicité du texte sur In Linguistic Expertise of Text Toxicity (subsection 4.3), a lexicalsemanticinterpretationofthecalculatedtoxicityindexispresented(Fig.6). InNeural Network Opinionswepresenttheoutputofourdeeplearning une échelle de 0 (non toxique) à 1 (haute toxicité). Nous évaluons également la similitude du texte avec les auteurs connus, avec des valeurs allant de 0 (pas de similitude) à 1 (haute similitude), en fonction des auteurs sur lesquels le modèle a été formé. Les résultats ne sont affichés que pour les tests dont la mesure de similitude dépasse 0,1. 4.Attribution des textes en langue ukrainienne: expériences, Résultats et discussions Le modèle stylométrique développé résout deux tâches: 1) Identifier les caractéristiques individuelles du style d'un auteur (stylométrie); 2) Évaluer la similitude entre deux textes sur la base de paramètres linguistiques et statistiques (attribution).
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 238 Acta Linguistica Lithuanica XCI Aujourd'hui, la composante informationnelle est devenue particulièrement importante dans la guerre hybride. Par conséquent, le matériel de notre étude était un corpus de recherche de textes médiatiques en ligne de discours politique d'un volume de 10 millions de mots. Nous utilisons le terme "texte toxique" au sens large. Ces textes sont caractérisés par le harcèlement, les menaces, l'obscénité, le cyber-intimidation, le trolling et les textes de haine basés sur l'identité, et contiennent des émoogènes, qui sont des phénomènes et des objets qui provoquent des émotions négatives chez une personne. Ce projet visait à déterminer le potentiel de réalisation de sentiments négatifs dans les textes ukrainiens et à développer un système automatisé pour l'identification du contenu toxique. Cette tâche comprenait deux sous-tâches consécutives: premièrement, développer un système d'examen linguistique du texte avec détermination des indices de toxicité à travers l'analyse de dictionnaire et des méthodes basées sur des règles; deuxièmement, construire un ensemble de données de formation à des fins d'apprentissage automatique et le développement d'un réseau neural pour prédire les indices de toxicité du texte. Regardons l'achèvement de la première tâche. Cela impliquait les individus de construction (1620), les termes obscènes (613), et le langage abusif (787). Les exemples incluent l'occidental (западенець: un nom péjoratif pour les ofalexicographicdatabasehousingthreedistinctdictionaries: 1)Emotiogendictionary:Acompilationof5000words(accordingtothe meaningsoflexical-semanticvariants)withnegativesentimenttones,ratedon ascaleof–2.Examplesincludeimmoral,impunity,briberyandsteal; 2) Hate Speech Dictionary: Comprising 3000 words, including names of gens des régions de l'ouest de l'Ukraine) et le huckster; Les phrases toxiques sont une collection de 1500 expressions idiomatiques qui transmettent des émotions négatives, comme les grimaces d'un singe, les baisers dans le cul et l'ouverture de la bouche. Chaque entrée de ces listes a été annotée avec des caractéristiques sémantiques, le Dictionnaire du discours de haine ayant 18 caractéristiques et la liste des phrases toxiques ayant 26. Par exemple, les mots du Dictionnaire du discours de haine ont été marqués avec des caractéristiques telles que […]s[…] pour le sexisme, […]r[…] pour le racisme et […]e[…] pour l'âge. Cette base de données lexicographique, un système multiparamétrique, attribue des caractéristiques sémantiques aux unités (mots ou phrases) qui, combinées avec les données de fréquence du texte analysé. L'indice de toxicité du texte est calculé à l'aide de la formule suivante: Itox = (e + |K| (m + t)) n * 10, Ici, n est le volume de texte; e est le nombre de mots émotionnels; m est le nombre de mots de discours de haine; t est le nombre de phrases toxiques; K est un coefficient égal à […]2, il met l'accent sur les mots de discours de haine et les phrases toxiques, qui sur une échelle de
Straipsniai / Articles 239 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) cinq chiffres (+2, +1, 0, […]1, […]2) correspondent à […]2. Les valeurs de l'indice varient de 0 à +1. Par exemple, l'indice de toxicité du texte […]People with a red pen (Люди с червоною ручкою)[…] (12 phrases, 129 mots) est de 1,01, ce qui indique sa toxicité élevée, car le seuil pour de tels textes courts varie de 0,1 à 0,7. Simultanément, le système génère les résultats d'un examen linguistique automatique de la toxicité du texte (voir Fig. 6), comprenant: 1) une carte statistique des classes sémantiques du vocabulaire négatif selon les marqueurs de classification des listes lexicographiques (émogènes […] 5, sentiment vulgaire […] 2, sexe […] 2); 2) un texte avec des mots spécifiques, verbalisant les catégories de la carte statistique. Avez-vous une idée de à quel point vous êtes ennuyeux ? J'étudie vos profils exprès, je suis curieux du monde dans lequel vous existez. Ce monde me fait beaucoup peur. J'espère sincèrement que dans la vie réelle, nous ne nous croiserons en aucune circonstance. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляеєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося pas pour leurs обставин). Ici, le système souligne automatiquement en gras les mots suivants avec une composante négative: erreurs (помилки), autres personnes (чужих), ennuyeux (бисите), effrayants (лякае). Figure 6: Un fragment d'examen linguistique automatisé de la toxicité du texte
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 240 Acta Linguistica Lituanica XCI (en anglais) 5. MACHINELEARNINGAPPROACHES: EXPERIMENTS,RESULTSAND Des discussions Concentrons-nous sur le deuxième mode de fonctionnement du système TextAttributor dédié aux techniques d'apprentissage automatique. À l'entrée de la formation du modèle, nous avons des corpus de texte étiquetés en fonction de l'objectif de chaque sous-tâche: (a) informations de texte de détection de toxicité et (b) identification de l'auteur. Chaque corpus est divisé en ensembles de formation et de contrôle, ainsi que, pour un corpus suffisamment grand, un ensemble de validation. validationset.Thefinalperformanceindicatorsofthemodelaremeasuredona controlset,takingintoaccounttheavailabilityofcomputingresources,which arenecessaryforthemodel’soperability.Acorpusforeachsubtaskhasbeen developedinparallelwiththeTextAttributormachinelearningcomponent,so 5.1 Détection de la toxicité À la suite d'une série d'études expérimentales, une architecture computationnellement efficace a été choisie sur la base de la méthode fastText et de ses outils (Joulin et al. 2016). Cette méthode fournit des intégrations de mots et estime la distribution de probabilité des documents selon des classes prédéfinies. Les mots sont présentés sous forme vectorielle basée sur la division automatique des mots en parties (sous-mots), qui simule l'ouverture du dictionnaire. Un corpus préparé d'environ 12 000 documents de texte a été utilisé pour la classification binaire pour détecter le contenu toxique.Le meilleur résultat, basé sur la métrique généralisée (F1 = 79,4%), a été obtenu avec les paramètres hyperparamétriques suivants: une dimensionnalité du vecteur de 500 mots, un taux d'apprentissage initial de 0,15, des époques d'entraînement, un contexte lexicale représenté par des bigrammes, des longueurs de sous-mots allant de 2 à 5 caractères et un seuil de décision de 56,0.4. 70%.
Straipsniai / Articles 241 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 5.2 Identification de l'auteur La recherche expérimentale des modèles d'identification de l'auteur du texte a été réalisée à l'aide d'une partie du corpus de textes socio-politiques accessibles au public, dans laquelle il est possible d'identifier la personne qui est l'auteur du document. Un total de 702 textes de quatre auteurs qui ont publié le plus grand nombre de documents entre 60 et 1000 caractères ont été sélectionnés. Le plus grand nombre de publications par l'auteur est 304 (115 000 caractères) et le plus petit est 109 (49 000 caractères). Les résultats démontrent la possibilité de développer un système efficace capable de couvrir avec précision les textes d'auteurs suffisamment représentés dans l'ensemble de formation. Les modèles de réseau neuronal formés ont été Thebestresult,accordingtothegeneralizedmetric(F1=81%),wasachieved withthefollowinghyperparametervalues:awordembeddingspacedimension intégrés dans le système TextAttributor dans l'architecture "client-serveur", où les résultats de deux tâches sont présentés: (a) détermination de la toxicité et (b) détection de adecision-makingthresholdof0.5.Notably,forcertainmodelconfigurations, thesensitivitytotheauthorwiththelargestnumberofdocumentsinthedataset l'auteur. 6. Conclusions à tirer Le système TextAttributor est actuellement en phase de test pour résoudre les problèmes d'attribution et de détermination de la toxicité dans les textes en langue ukrainienne. 784 textes en ukrainien par 226 utilisateurs. Nos résultats démontrent l'efficacité de notre méthode, qui consiste à quantifier les éléments verbaux basés sur des paramètres grammaticaux et sémantiques formels, particularlyfornegativeemotionality.Thisisachievedthroughacombination ofdictionaryandrule-basedapproaches,complementedbymachinelearning
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK Les modèles de sous-mots ont montré une vérification et une désobfuscation améliorées techniques.Experimentalmachinelearningresearchfortoxicitydetectionand authorship identification bytext allowed us toobtainresults comparable to resultsofexperimentswithsimilarmodelcharacteristics(numberofdocuments de l'auteur, le profilage et la diarisation de l'auteur, le profilage psycholinguistique, la robustnessagainstlexicalopennessandtextualerrors. TheconductedresearchpavesthewayforsolvingsuchproblemsforUkrainian as detectingand monitoringtoxic content,hate speechandmisinformation, modélisation de style et le suivi de la source du contenu faux, etc. Le schéma d'analyse et d'attribution du texte développé peut également être appliqué à d'autres langues. À l'avenir, nous prévoyons d'intégrer notre outil automatique d'attribution de texte et de détection de toxicité avec une analyse sémantique, syntaxique, psycholinguistique et sociolinguistique. Cette intégration nous donnera une compréhension plus profonde de l'impact sur le lecteur. En utilisant l'analyse sémantique de la taxonomie lexicale, nous visons à identifier les éléments narratifs inhérents au texte, augmentant ainsi la fiabilité de l'attribution de texte dans les procédures d'identification de l'auteur. Remerciements The system has been created within a project supported by the British EmbassyinKyivandcarriedoutbyateamofeducatorsandresearchersofthe Chaire de langue ukrainienne et de linguistique appliquée, Taras Shevchenko National L'université de Kiev. Nous tenons à exprimer notre sincère gratitude à l'ambassade britannique à Kiev pour leur soutien financier à ce projet de recherche. Nous sommes reconnaissants à Svitlana Yavorska et Iryna Bezkorovayna pour leurs conseils et leur assistance tout au long du projet. Nous sommes particulièrement reconnaissants à Kostiantyn Goncharenko pour l'organisation et le soutien documentaire du projet. En outre, nous sommes reconnaissants aux étudiants du programme éducatif […]App (Computer) Linguistique et Langue Anglaise[…] de l'Université nationale Taras Shevchenko de Kiev. thisstudywiththeiradviceandconsultations.
Straipsniai / Articles 243 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) REFERENCES ALIAS–Automated Linguistic Identification & Assessment System.Availableat:https:// aliastechnology.com/alias-overview/. Alkomah Fatimah, Ma Xiaogang 2022:ALiteratureReviewofTextualHate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/ info13060273. ArgamonShlomo2007:InterpretingBurrows’sDelta:GeometricandProbabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/ fqn003. Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023:ComparisonbetweenMachine LearningandDeepLearningApproachesfortheDetectionofToxicCommentson SocialNetworks.–Applied Sciences13(10),6038.DOI:10.3390/app13106038. Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts,LNUimeniIvanaFranka[IvanFranko NationalUniversityofLviv]. Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to LikelyAuthorship.–Literary and Linguistic Computing17(3),267–287.DOI:10.1093/ llc/17.3.267. Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparingtechniquesforauthorshipattributionofsourcecode.–Software: Practice and Experience44(1),1–32.DOI:10.1002/spe.2146. CanhasiErcan,KadriuArbana,MisiniArta2022:ASurveyonAuthorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/ seeur-2022-0100. ChuhunovVadym2009:Diahnostyka v psykhoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv:Nauka. Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and IntelligentSystems(COLINS-2022)1:Main Conference,eds.V.Lytvyn,N.Sharonova, I.Jonek-Kowalska,A.Kowalska-Styczen,V.Vysotska,Ye.Kupriianov,O.Kanishcheva, O.Cherednichenko,Th.Hamon,N.Grabar,Poland,12–13May,2022,256–265. Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 244 ActaLinguisticaLithuanicaXCI sentences.–Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies1(35),5–10.DOI:10.17721/1728-2659.2024.35.01. Darčuk Natalija 2013: Kompjuterne anotuvannja ukrajins’koho tekstu: rezul’taty i perspektyvy,Kyiv:OsvitaUkrajiny. DarčukNatalija,Vasyl’jevaIryna,Vasyl’jevOleksij2021:Vektornamodel’ analizustylistykytekstiv.–Ukrajins’kyj fizyčnyj žurnal66(5),373–378. Eder Maciej 2015:Doessizematter?Authorshipattribution,smallsamples,big problem.–Digital Scholarship in the Humanities30(2),167–182.DOI:10.1093/llc/ fqt066. Eder Maciej, Rybicki Jan 2013:Dobirdsofafeatherreallyflocktogether,or howtochoosetrainingsamplesforauthorship attribution.–Literary and Linguistic Computing28(2),229–236.DOI:10.1093/llc/fqs036. EvertStefan,ProislThomas,SchöchChristof,JannidisFotis,Pielström Steffen, Vitt Thorsten 2015:ExplainingDelta,or:Howdodistancemeasures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom,21July2015,eds.F.Formato,A.Hardie,Lancaster:UCREL.Availableat: https://zenodo.org/records/18308. GuptaShriyaT.P.,SahooJajatiK.,RoulRajendraK.2019:Authorship identificationusingrecurrentneuralnetworks.–ICISDM’19:Proceedingsofthe2019 3rdInternationalConferenceonInformationSystemandDataMining,UnitedStates, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935. Hoover David 2004:TestingBurrows’sdelta.–Literary and Linguistic Computing 19(4),453–475.DOI:10.1093/llc/19.4.453. HooverDavid2005:Delta,DeltaPrime,andModernAmericanPoetry:Authorship AttributionTheoryandMethod.–ACH/ALLC 2005:Proceedingsofthe17thJoint InternationalConferenceoftheAssociationforComputersandtheHumanities(ACH) andtheAssociationforLiteraryandLinguisticComputing,Canada,15–18June2005, UniversityofVictoria:HumanitiesComputingandMediaCentre,79–80. JannidisFotis,PielströmSteffen,SchöchChristof,VittThorsten2015: ImprovingBurrows’Delta–Anempiricalevaluationoftextdistancemeasures.–DH 2015:DigitalHumanities,AbstractsoftheGlobalDigitalHumanitiesConference11, Australia,29June–3July2015,Sydney.DOI:https://zenodo.org/records/1321296. Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, JégouHérve,MikolovTomas2016:FastText.zip:Compressingtextclassification models.–ArXiv e-prints 1612.03651.DOI:10.48550/arXiv.1612.03651.
Straipsniai / Articles 245 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Karasov Vitalii, Levchenko Olena 2024:StatisticalprofileofO.Zabuzhko’s idiostyle. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems,Lviv,April12–13,2024, 251–264. KhanTalhaF.,AnwarWaheed,ArshadHumera,AbbasSyedN.2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ ACCESS.2023.3299565. KhomytskaIryna,TeslyukVasyl,BazylevychIryna,KaramyshevaIryna 2023:AutomatedIdentificationofAuthorialStyles.–CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol3396/paper26.pdf. KUM–Korpus ukrajins’koji movy:LinhvistyčnyjportalMova.info.Availableat:http:// www.mova.info/corpus.aspx. LIWC-22–Linguistic Inquiry and Word Count.Availableat:https://www.liwc.app. Lototska Nataliia 2022:StatisticalCharacteristicsofRomanIvanychuk’sIdiolect (BasedonWriter’sTextCorpus).–CEUR Workshop Proceedings3171,487–500. LupeiMaksym,MitsaAlexander,RepariukVolodymyr,SharkanVasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style usingneuralnetworks.–Eastern-European Journal of Enterprise Technologies1/2(103), 30–36.DOI:10.15587/1729-4061.2020.195041. McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform ManifoldApproximationandProjectionforDimensionReduction.–ArXiv e-prints 1802.03426.DOI:10.48550/arXiv.1802.03426. MeierTabea,BoydRyan,PennebakerJames,MehMatthiasl,Martin Mike,WolfMarkus,HornAndrea2019:“LIWCaufDeutsch”:Thedevelopment, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt. Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: DoWeReallyNeedtheMostFrequentWords?–Literary and Linguistic Computing 26(3),315–321.DOI:10.1093/llc/fqr031. Savoy Jacques 2015: Comparative evaluation of term selection functions for authorshipattribution.–Digital Scholarship in the Humanities30(2),246–261.DOI: 10.1093/llc/fqt047.
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 246 ActaLinguisticaLithuanicaXCI TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts.Availableat:ta.mova.info. Volos Yana, Levchenko Olena 2023:StatisticalprofileofValerieShevchuk’s idiostyle(morphologicallevel).–Slobozhan Scientific Bulletin, Ser. Philology,3,32–36. DOI:10.32782/philspu/2023.3.6. Zuban’Oksana2019:TheMorphemicSystemStylometricAnalysisoftheUkrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistyčni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15. Système d'analyse automatique des stylométries […]TextAttributor 1.0[…] Ce n'est pas le cas. (méthodes, mesures, fonctionnalités) SANTRAUKA (pays du nord de l'Inde) TextAttributor statistiquement paramétrise les aspects de l'analyse des textes de la langue ukrainienne. Naudodama multiparametrinis 15 utilise l'index statistique du rinkinio, TextAttributor décrit les autorités stylistiques du rinkinio. Integre les méthodes de l'analyse des textes comme composante, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes, pour l'analyse des textes. irįvertintitekstopanašumą,ypačpolitiniodiskursoirnemandagioskomunikacijosžiniasklaidoskonteksteRusijosirUkrainoskarometu.Straipsnyjepabrėžiamapraktinėirteorinė„TextAttributor“reikšmė,demonstruojantjosefektyvumądidelėmstekstoapimtimsir tiksliomsanalitinėmsgalimybėms.Sėkmingasžodynais,taisyklėmispagrįstųirmašininio bevykdomųtyrimųrezultataiyranuodugniaiišnagrinėti,obūsimosjųkryptysnustatomos siekiantišplėstikalbinįkorpusąirtobulintimašininiomokymosimodelius,siekiantpagerintitikslumąirpritaikomumą.
Straipsniai Articles 247 Įteikta The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 2024 m. novembre 25 d. (article 247 du traité sur les droits de l'homme) NATALIIA DARCHUK J'ai été arrêtée. Université nationale Taras Shevchenko de Kiev (Ukraine) est située dans la région de Kiev. Rue de Volodymyrska au numéro 60 Kyiv, 01033, Ukraine
[email protected] Il s'agit d'une ville située dans la région de Kyiv. OKSANA ZUBAN (nombre de membres du groupe) Université nationale Taras Shevchenko de Kiev (Ukraine) est située dans la région de Kiev. Rue de Volodymyrska au numéro 60 Kyiv, 01033, Ukraine
[email protected] (en anglais) Je suis VALENTYNA ROBEIKO Université nationale Taras Shevchenko de Kiev (Ukraine) est située dans la région de Kiev. Rue de Volodymyrska au numéro 60 Kyiv, 01033, Ukraine valentyna.robeik[email protected] Université nationale de Kiev Taras Shevchenko YULIIA TSYHVINTSEVA Université nationale de Kiev Taras Shevchenko est située dans le centre de la ville de Kiev. Rue de Volodymyrska au numéro 60 Kyiv, 01033, en Ukraine Institut de la langue ukrainienne de l'Académie nationale des sciences de l'Ukraine 4 rue Mykhailo Hrushevskyi Kyiv, 01001, Ukraine julivo [email protégé] Je suis Victor Sorokin. Université nationale Taras Shevchenko de Kiev (Ukraine) est située dans la région de Kiev. Rue de Volodymyrska au numéro 60 Kyiv, 01033, Ukraine victor.sorok[email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] Mykola Sakhok a été arrêté. Institut pour les technologies et les systèmes de l'information of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine s[email protected]om