scieee.
EN original LT DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

NATALIIA DARCHUK

Київський національний університет імені Тараса Шевченка

ORCID id: orcid.org/0000-0001-8932-9301

Напрями досліджень: комп’ютерна лінгвістика, корпусна лінгвістика, кількісна лінгвістика, граматика та семантика української мови.

OKSANA ZUBAN

Київський національний університет імені Тараса Шевченка

ORCID id: orcid.org/0000-0002-2644-3892

Напрями досліджень: комп’ютерна лінгвістика, лінгвістична експертиза, кількісна лінгвістика, граматика та семантика української мови.

VALENTYNA ROBEIKO

Київський національний університет імені Тараса Шевченка

ORCID id: orcid.org/0000-0003-2266-7650

Напрями досліджень: аналіз, розпізнавання та синтез мовлення, фонетика, опрацювання природної мови.

YULIIA TSYHVINTSEVA

Київський національний університет імені Тараса Шевченка, Інститут української мови Національної академії наук України

ORCID id: orcid.org/0000-0002-9684-3840

Напрями досліджень: українська неологія, лексикологія та лексикографія.

VICTOR SOROKIN

Київський національний університет імені Тараса Шевченка

ORCID id: orcid.org/0000-0002-3637-0535

Напрями досліджень: автоматичний синтаксичний аналіз, автоматичний семантичний аналіз, опрацювання природної мови.

Straipsniai / Articles

223

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

MYKOLA SAZHOK

Інститут інформаційних технологій і систем Національної академії наук України

ORCID id: orcid.org/0000-0003-1169-6851

Напрями досліджень: аналіз, розпізнавання та синтез мовлення, опрацювання природної мови.

DOI: doi.org/10.35321/all91-09

СИСТЕМА АВТОМАТИЧНОГО СТИЛОМЕТРИЧНОГО АНАЛІЗУ УКРАЇНСЬКИХ МЕДІАТЕКСТІВ TEXTATTRIBUTOR 1.0 (МЕТОДИ, ЗАСОБИ, ФУНКЦІОНАЛЬНІСТЬ)

Система автоматичного стилометричного аналізу українських медіатекстів «TextAttributor 1.0» (методи, засоби, функціональність)

АНОТАЦІЯ

У статті представлено структуру, алгоритми, реалізацію та експериментальні результати автоматичної системи TextAttributor, розробленої авторами статті для статистичної параметризації текстів українською мовою з використанням багатопараметричного набору статистичних індексів, що характеризують стиль тексту автора та можуть застосовуватися в завданнях атрибуції авторства. На основі створених лінгвістичних ресурсів і програмного забезпечення система генерує лінгвістичний аналіз за розрахованими статистичними індексами та здійснює порівняльне дослідження двох текстів. Додатковим критерієм статистичного індексування є індекс токсичності тексту, обчислений методом вербальної ідентифікації токсичного сентименту. Завдання визначення авторства й токсичності розв’язуються двома методами: статистичними обчисленнями на основі словника і правил та машинним навчанням. Поточні результати, реалізовані в бета-версії TextAttributor, детально досліджено.

КЛЮЧОВІ СЛОВА: комп’ютерна лінгвістика, українська мова, аналіз сентименту, атрибуція авторства, стилометрія, класифікація текстів.

224

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

А Н О Т А Ц І Я

У цій статті представлено структуру, алгоритми, реалізацію та експериментальні результати автоматичної системи «TextAttributor», створеної авторами статті для статистичної параметризації текстів українською мовою з використанням багатопараметричного набору статистичних показників, що характеризують стиль авторського тексту та застосовуються для завдань атрибуції авторства. На основі створених лінгвістичних ресурсів і програмного забезпечення система генерує лінгвістичний аналіз за обчисленими статистичними індексами та здійснює порівняльний аналіз двох текстів. Додатковим критерієм статистичного індексування є індекс токсичності тексту, обчислений методом вербальної ідентифікації токсичного сентименту. Завдання визначення авторства й токсичності розв’язуються двома методами: статистичними обчисленнями на основі словника та правил і машинним навчанням. Поточні результати, отримані за допомогою бета-версії «TextAttributor», детально досліджено.

КЛЮЧОВІ СЛОВА: комп’ютерна лінгвістика, українська мова, аналіз сентименту, атрибуція авторства, стилометрія, класифікація тексту.

1. ВСТУП

Текстологічні дослідження набули нового наукового значення з розвитком методів комп’ютерної лінгвістики, що сприяли формуванню нового напряму, який можна назвати цифровою текстологією. У межах цієї дисципліни, що виникає, ми концептуалізуємо цифрову текстологію як застосування автоматизованих методів корпусної лінгвістики у поєднанні з математичними моделями для кількісного аналізу тексту. Керуючись актуальними завданнями сучасної кількісної лінгвістики та опрацювання природної мови, наша команда розробила систему автоматичного лінгвостатистичного аналізу медіатекстів, реалізовану як вебзастосунок під назвою TextAttributor (TextAttributor 1.0 2024). Система функціонує у чотирьох завданнях: 1) статистична параметризація тексту; 2) стилометрія: визначення лінгвістико-статистичних ознак ідіолекту; 3) атрибуція: визначення ступеня подібності текстів; і 4) аналіз сентименту: виявлення лексики негативного сентименту в текстах. Крім того, у межах системи автоматично генеруються два лінгвістичні експертні висновки за результатами другого та четвертого завдань. Багатофункціональність системи TextAttributor вимагає від користувачів ознайомлення з принципами її роботи. Мета цієї статті — ознайомити академічну та освітню філологічну спільноту з методологією створення системи, її архітектурою та результатами роботи, щоб забезпечити чітке розуміння її функцій і аналітичних можливостей, які мають особливе значення. Цей підхід особливо актуальний для аналізу великих обсягів інтернет-комунікації та

Straipsniai / Articles

225

НАТАЛІЯ ДАРЧУК, ОКСАНА ЗУБАН, ВАЛЕНТИНА РОБЕЙКО, ЮЛІЯ ЦИГВІНЦЕВА, ВІКТОР СОРОКІН, МИКОЛА САЖОК

посилення стратегій інформаційного захисту під час російсько-української війни, що триває. Концепція розроблення автоматичної системи атрибуції текстів українською мовою виникла внаслідок аналізу досліджень у галузі української корпусної лінгвістики (Darčuk 2013) та статистичних досліджень авторського стилю (Darčuk et al. 2021; Darchuk, Sorokin 2022; Zuban 2019), проведених авторами проєкту за допомогою інструментів корпусу української мови (KUM).

Під час розроблення системи TextAttributor було застосовано такі методи: компонентний аналіз, дистрибутивний аналіз і контент-аналіз. Контент-аналіз, кількісний і якісний метод вилучення інформації з тексту, використовував опрацювання природної мови та статистичні методи. Також було застосовано квантування й аналіз сентименту. Аналіз сентименту автоматично визначає тональність тексту на основі емоційного забарвлення та оцінки автором подій або об’єктів; цього було досягнуто за допомогою статистичних обчислень на основі словника і правил.

Крім того, було інтегровано методи машинного навчання, зокрема глибинне навчання. Статистична структура тексту, яку розуміють як його кількісну модель, дає змогу визначати його функціональний стиль, авторство та період створення. У цій роботі компоненти статистичної структури було виокремлено шляхом аналізу лексичних і граматичних статистичних ознак із використанням методів індексування та метрик евклідової відстані. Евклідова відстань, що вимірює відстань між двома точками в n-вимірному евклідовому просторі, є однією з найпоширеніших метрик у лінгвостатистиці для кластерного аналізу в стилометрії та атрибуції авторства.

Новизна результатів полягає в першій у комп’ютерній лінгвістиці реалізації автоматизованої морфосинтаксично-семантичної стилометричної моделі аналізу тексту, заснованої на 15 статистичних індексах, які передусім параметризують морфологічну, а також синтаксичну й семантичну структуру тексту. Стилометрична модель — це сукупність статистичних параметрів тексту (лексичних, морфологічних, синтаксичних тощо), на основі яких здійснюють порівняльний аналіз цього тексту зі стилометричною моделлю функціонального стилю. На нашу думку, використання статичних методів під час побудови стилометричної моделі дає змогу отримати строгу, детерміновану, науково обґрунтовану систему спільних і відмінних ознак у стилях, жанрах тощо. Уперше до стилометричної моделі введено параметр індексу токсичності, який характерно визначає медіатексти під час російсько-української війни. Цю модель реалізовано не лише у функції статистичної параметризації текстів, типовій для систем такого виду, а й у функції порівняння аналізованого тексту з медіастилем української мови, а також для стилометричних і атрибуційних завдань із залученням двох або більше текстів. Теоретичне значення полягає також у валідації двох методів визначення токсичності тексту та

226

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

авторства українською мовою: 1) за допомогою словникового підходу та підходу, заснованого на правилах, і 2) за допомогою машинного навчання, зокрема глибинного навчання.

2. ОГЛЯД ПОПЕРЕДНІХ ДОСЛІДЖЕНЬ

У сучасній українській лінгвістиці проведено значні лінгвостатистичні дослідження ідіолектів українських письменників і поетів, зокрема Тараса Шевченка, Лесі Українки, Василя Стуса (Zuban’ 2019), Івана Франка (Buk 2021), Романа Іваничука (Lototska 2022), Валерія Шевчука (Volos, Levchenko 2023), Марії Матіос, Юрія Андруховича, Оксани Забужко (Karasov, Levchenko 2024), Івана Драча, Миколи Вінграновського (Darchuk et al. 2024), Ліни Костенко (Zuban’ 2019; Darchuk et al. 2024) та інших. Ці дослідження проводилися на репрезентативних вибірках текстів (великих текстах) із використанням переважно одного або кількох (не більше п’яти) статистичних параметрів, часто без застосування стилометричного порівняння. Крім того, через трудомісткість проведення лінгвостатистичних експериментів українська лінгвістика значною мірою не приділяла уваги комплексній статистичній параметризації, порівнянню аналізованих текстів зі стандартними статистичними параметрами функціональних стилів, визначенню ступеня подібності текстів, а також стилометричному й атрибуційному аналізу коротких текстів. Використання системи TextAttributor у лінгвостатистичних дослідженнях, спрямоване на автоматичне виконання цих завдань, забезпечить не лише частотні характеристики мовних явищ, а й ефективний стилометричний аналіз, результатом якого буде експертний висновок.

Система TextAttributor має переваги порівняно з аналогами у світовій науці. Більшість наявних систем і моделей також зосереджені на використанні окремих лінгвостатистичних модулів для визначення одного або кількох, переважно формальних (n-грам, найчастотніших слів, літер), параметрів тексту (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). Натомість TextAttributor 1.0 пропонує комплексний підхід, що охоплює інтерактивний статистичний аналіз лексичної, морфологічної, синтаксичної та семантичної структури тексту в реальному часі за 15 параметрами.

Атрибуція текстів активно розвивається в зарубіжних текстологічних дослідженнях, зокрема ефективність методу Берроуза (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) перевіряють у багатьох дослідженнях на великих масивах текстових даних різних стилів, як-от: англійська проза початку 20th століття (Hoover 2004); сучасна англійська поезія (Hoover 2005); поетичні твори латиною (Rybicki, Eder 2011); прозові твори основних жанрів англійською, французькою, італійською, німецькою, польською, угорською мовами, а також латиною та арабською (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); політичні тексти англійською мовою, зокрема

Straipsniai / Articles

227

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

атрибуція промов американських президентів (Savoy 2015). Ще один метод автоматичного лінгвістичного аналізу під назвою «Linguistic Inquiry and Word Count» (LIWC) реалізовано як комерційний застосунок і адаптовано до кількох мов (Meier et al. 2019; LIWC-22).

Останніми роками в завданнях автоматичної атрибуції текстів переважно використовували або стилометричні методи, засновані на правилах, або методи глибинного навчання (Eder 2015; Canhasi et al. 2022). Обидва методи реалізовано в системі TextAttributor; вони ефективно функціонують, але дають різні результати: 1) метод, заснований на правилах, дає змогу автоматизувати формування лінгвістичних висновків про ідіолект і токсичність тексту; 2) метод машинного навчання визначає лише ступінь токсичності та подібність текстів і може використовуватися в завданнях класифікації для моніторингу текстового контенту.

Сучасні методи машинного навчання для аналізу сентименту та ідентифікації авторства текстів ґрунтуються на статистичних підходах (TF-IDF, Latent Dirichlet Allocation) і методах глибинного навчання з різними архітектурами (CNN, LSTM, BERT) у поєднанні зі стилометричними методами (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). Наведені результати надзвичайно залежать від кількості класів (типів токсичності, авторів), жанру, обсягу тексту і, найважливіше, обсягу належно анотованого текстового корпусу, використаного для процедури навчання. Так, високі показники точності в завданнях виявлення токсичності та мови ворожнечі перевищують 90% за використання корпусу, що містить десятки тисяч документів (Alkomah, Ma 2022). Наприклад, понад 90% точності в атрибуції авторства досягнуто для англомовних літературних творів 1000 авторів із використанням корпусу з 6000 документів для 15 авторів. Водночас для корпусів, що містять менше ніж 1500 документів, заявлена точність становить близько 70% (Khan et al. 2023). Для української мови ідентифікація авторства текстів та аналіз сентименту/токсичності є недостатньо дослідженими проблемами (Lupei et al. 2020); крім того, такі системи не формують лінгвістичної експертизи й не можуть використовуватися як інструменти лінгвістичного дослідження.

3. ЗАГАЛЬНА ХАРАКТЕРИСТИКА РОБОТИ СИСТЕМИ TEXTATTRIBUTOR

Під час розроблення TextAttributor було виконано такі завдання: 1) теоретична лінгвістика: розроблено методологію формалізованого морфологічного, статистичного, стилометричного, атрибуційного аналізу та аналізу сентименту; 2) програмна інженерія: розроблено структуру лінгвістичних баз даних і програмне забезпечення для зазначених автоматичних аналізів; 3) експериментальна лінгвістика: систему протестовано на українських медіатекстах, а

228

Acta Linguistica Lithuanica XCI

Система автоматичного стилометричного аналізу українських медіатекстів TextAttributor 1.0 (методи, засоби, функціональність)

реалізовано аналітичний модуль для автоматичного стилометричного дослідження. Автоматизована лінгвістична система, реалізована як вебзастосунок, опрацьовує введені користувачем тексти медіастилю, генеруючи числові значення статистичних параметрів, що характеризують властивості тексту. Система працює за структурованою послідовністю операцій:

1. Токенізація тексту: поділ тексту на речення та слова для аналізу.

2. Морфологічне маркування: присвоєння словам міток на основі їхніх граматичних форм.

3. Контекстуальний аналіз: оновлення морфологічних міток з урахуванням контексту.

4. Синтаксичний аналіз: встановлення бінарних зв’язків між словами в реченнях для розуміння їхньої граматичної структури.

5. Встановлення синтаксичних зв’язків: визначення синтаксичних зв’язків на основі заздалегідь визначених правил.

6. Добір емоційно негативної лексики: ідентифікація слів із заздалегідь визначеного набору негативної лексики.

7. Оцінювання статистичних параметрів: оцінювання статистичних параметрів вхідного тексту за допомогою автоматично укладених частотних словників.

8. Візуалізація результатів: графічне представлення результатів статистичної параметризації з емпіричними значеннями та довірчими інтервалами.

9. Порівняння результатів: візуалізація результатів статистичної параметризації для двох текстів медіастилю, що полегшує їх порівняння.

10. Оцінювання евклідової відстані: кількісне визначення відмінності між двома текстами медіастилю.

11. Формування експертного висновку: формування двох експертних висновків: одного щодо атрибуції тексту, іншого — щодо токсичності тексту за результатами лінгвістичного дослідження.

12. Виявлення токсичності та ідентифікація авторства: використання методів машинного навчання, зокрема моделей нейронних мереж, для виявлення токсичності та ідентифікації авторів.

Результати роботи системи організовано в таких розділах: група індексів атрибуції тексту, експертний висновок щодо атрибуції тексту, порівняння атрибуції текстів, лінгвістична експертиза токсичності тексту та висновки нейронної мережі.

У групі індексів атрибуції тексту (рис. 1) статистичні параметри організовано на основі вхідного тексту: у стовпці 1 відображено назву індексу, у стовпці 2 наведено емпіричне числове значення, а стовпець 3 забезпечує візуальне представлення шляхом порівняння емпіричного значення індексу з порогами довірчого інтервалу

Straipsniai / Articles

229

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

(нижнім і верхнім), отриманими з текстів українського медіастилю. Емпіричне числове значення представлено на шкалі за допомогою зафарбованого перевернутого трикутника.

РИСУНОК 1: Фрагмент результату атрибуції тексту

У експертному висновку щодо атрибуції тексту (рис. 2) ми подаємо висновки щодо типових або індивідуальних лінгвістичних статистичних ознак, виокремлених з аналізованого тексту для кожного оціненого індексу. Ці висновки ґрунтуються на відповідях на запитання: чи входить числове значення індексу до довірчого інтервалу медіастилю української мови? На основі порівняння числових значень із пороговими значеннями довірчого інтервалу система генерує три можливі відповіді (типові ознаки медіастилю, ознаки ідіостилю, нижчі за норму медіастилю, та ознаки ідіостилю, вищі за норму медіастилю).

У порівнянні атрибуції текстів (рис. 4, підрозділ 4.2) після вибору «Calculate Vector Distance» табличні дані оперативно оновлюються так: у стовпці 1 перелічено введені користувачем тексти разом із раніше проаналізованим текстом; у стовпці 2 відображено кількість речень у кожному тексті; у стовпці 3 наведено кількість слів; у стовпці 4 подано евклідову відстань між аналізованим текстом і кожним текстом у таблиці; у стовпці 5 із назвою «Compare» ініціюється автоматичне порівняння статистичних індексів аналізованого тексту та вибраного тексту. Після активації відповідного елемента «Compare» у групі «Text Attribution Indices» (рис. 3) надається вичерпна інформація про статистичне порівняння двох текстів.

230

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

РИСУНОК 2: Приклад сформованого експертного висновку

У лінгвістичній експертизі токсичності тексту (підрозділ 4.3) представлено лексико-семантичну інтерпретацію обчисленого індексу токсичності (рис. 6).

У висновках нейронної мережі ми подаємо результати роботи нашої моделі глибинного навчання, яка кількісно визначає токсичність тексту за шкалою від 0 (нетоксичний) до 1 (висока токсичність). Ми також оцінюємо подібність тексту до відомих авторів зі значеннями від 0 (відсутність подібності) до 1 (висока подібність), спираючись на авторів, на текстах яких навчалася модель. Результати показано лише для тестів із показником подібності понад 0,1. Наша поточна система працює в демонстраційному режимі, використовуючи обмежений корпус авторських текстів для оцінювання подібності до введеного користувачем тексту.

4. АТРИБУЦІЯ ТЕКСТІВ УКРАЇНСЬКОЮ МОВОЮ: ЕКСПЕРИМЕНТИ, РЕЗУЛЬТАТИ ТА ОБГОВОРЕННЯ

4.1. Індекси статистичної параметризації

Розроблена стилометрична модель розв’язує два завдання: 1) визначення індивідуальних ознак авторського стилю (стилометрія); 2) оцінювання подібності між двома текстами на основі лінгвістичних і статистичних параметрів (атрибуція).

Straipsniai / Articles

231

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

Для статистичного аналізу введеного користувачем тексту використовують 19 параметрів (див. рис. 1, група індексів атрибуції тексту). Перші чотири параметри охоплюють базові кількісні дані: кількість слів, необроблені слова, обсяг словника та кількість речень. Кількість слів не включає лексику, яку система не опрацювала, зокрема діалектизми, московізми, оказіоналізми тощо. Решта 15 параметрів складається з обчислюваних індексів, що дають скалярні величини.

Для стилометричного аналізу ми маємо перевірити гіпотезу 1. Ця гіпотеза стверджує, що шляхом аналізу емпіричних даних, які охоплюють статистичні параметри в межах і поза межами довірчого інтервалу українського медіастилю, можна виявити унікальні авторські ознаки в певному медіатексті. Для кожного лінгвістичного параметра на основі вибірок українських медіатекстів було обчислено два набори довірчих інтервалів: один для текстів обсягом понад 1000 слів (обсяг вибірки: 124,576 слів), інший — для текстів обсягом до 1000 слів (обсяг вибірки: 15,635 слів).

Довірчий інтервал для кожного статистичного параметра встановлювали за допомогою стандартного відхилення, σ, середнього числового значення індексу (ANVI) у вибірці текстів, позначеного як ANVI ± σ. Стандартне відхилення оцінює, наскільки емпіричні числові значення статистичних індексів можуть відхилятися від середнього числового значення індексу в межах медіастилю. Для забезпечення точності довірчий інтервал для σ визначали за допомогою лінгвістичного та статистичного експерименту. Отже, під час перевірки гіпотези 1 система пропонує три можливі висновки: 1) числове значення індексу входить до довірчого інтервалу; 2) числове значення індексу нижче нижнього порога інтервалу; або 3) числове значення індексу перевищує верхній поріг інтервалу.

Розглянемо результати, отримані внаслідок параметризації тексту 1, автором якого є блогер Олексій Гончаренко (див. рис. 1). Цей аналіз ґрунтується на статистичних параметрах та їхній подальшій інтерпретації, викладеній у сформованому експертному висновку, як показано на рис. 2.

Статистичні показники, що стосуються словникового складу та обсягу тексту, виявляють кількісний взаємозв’язок. У тексті 1 усі ці показники перебувають у типовому для медіастилю діапазоні:

1) Індекс різноманітності (IB) відображає співвідношення унікальних слів до загального обсягу тексту та слугує показником лексичного багатства. Значення IB, що дорівнює 0.54, входить до діапазону 30%–60%, що свідчить про помірний рівень лексичного різноманіття;

2) Індекс ексклюзивності тексту (IVT) виражає співвідношення кількості гапаксів, що трапляються в тексті один раз, до обсягу тексту. Значення IVT, що дорівнює 0.36, входить до діапазону 20%–40%, що свідчить про низьку лексичну ексклюзивність);

232

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

3) Індекс ексклюзивності словника (IVL) виражає співвідношення кількості гапаксів, що трапляються в тексті лише один раз, до загального обсягу словника. Значення IVL, що дорівнює 0.66, входить до діапазону 60%–76%, що свідчить про високий ступінь лексичної ексклюзивності.

Далі розглянемо статистичні параметри кількісної кореляції лексичних і граматичних класів слів у тексті 1:

1) Індекс номінальних атрибутів, або епітетизація (IIO) виражає співвідношення кількості іменників до кількості прикметників. IIO, що дорівнює 1.07, є вищим за норму медійного стилю 1.0, що свідчить про переважання іменників над прикметниками, унаслідок чого в тексті менше епітетів;

2) Індекс дієслівних атрибутів (IDO) виражає співвідношення кількості прислівників до кількості дієслів. IDO, що дорівнює 0.57, є вищим за норму медійного стилю 0.56. Така частка прислівників свідчить про низький ступінь дієслівної атрибутивності тексту;

3) Ступінь номіналізації (STN) виражає співвідношення кількості іменників до кількості дієслів. STN, що дорівнює 1.76, є нижчим за норму медійного стилю 3.00. Зниження цього індексу свідчить про переважання дієслів над іменниками та низький ступінь номіналізації тексту;

4) Індекс займенниковості (IPRO) виражає співвідношення кількості особових займенників до обсягу слововживань у тексті. IPRO, що дорівнює 0.09, є вищим за норму медійного стилю та є ознакою ідіостилю. Особові займенники охоплюють понад 7% тексту, що свідчить про ступінь зв’язності тексту;

5) Індекс модальності (MOD) виражає співвідношення кількості часток до кількості слів у тексті. IMOD, що дорівнює 0.07, є вищим за норму медійного стилю 4% та є ознакою ідіостилю. Частки охоплюють понад 4% тексту, що визначає ступінь вираження автором різних оцінок явищ і ситуацій у тексті;

6) Індекс субстантивності (ISUB) виражає співвідношення кількості іменників до обсягу слововживань у тексті. ISUB, що дорівнює 0.26, є нижчим за норму медійного стилю. Іменники охоплюють менш як 30% тексту, що визначає низький ступінь статичності тексту.

Пояснімо статистичні параметри кількісного співвідношення словосполучень і речень у Тексті 1:

1) Індекс динамічності (IDYN) виражає співвідношення кількості дієслівних словосполучень до кількості іменникових словосполучень. IDYN, що дорівнює 0.74, є вищим за норму медійного стилю 0.6 та є ознакою ідіостилю. Переважання дієслівних словосполучень над іменниковими (IDYN більше за 1.0) визначає динамічне й швидке розгортання подій у змісті тексту;

Straipsniai / Articles

233

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

2) Індекс зв’язності (IZV) виражає співвідношення кількості прийменників і сполучників до кількості речень у тексті. IZV, що дорівнює 0.66, перебуває в типовому діапазоні від 0.45 до 0.90 для медійного стилю, що свідчить про переважання кількості речень над кількістю прийменників і сполучників. Це визначає середній ступінь зв’язності між реаліями, явищами та ситуаціями, описаними в Тексті 1.

Особливу увагу буде приділено психолінгвістичним статистичним параметрам (Chuhunov 2009) у Тексті 1:

1) Коефіцієнт Трейґера (KT) виражає співвідношення кількості дієслів до кількості прикметників у тексті, указуючи на емоційну стабільність/нестабільність мовця. KT, що дорівнює 0.61, є вищим за норму медійного стилю 0.5 та є ознакою ідіостилю. Згідно з психологічною інтерпретацією, це свідчить про низьку емоційність автора/мовця, нерішучість щодо активних практичних дій і тривожність. Значення в діапазоні 1.35 ± 0.05 визначає нормальну емоційну стабільність і регуляцію для автора;

2) Коефіцієнт визначеності дії (KOD) виражає співвідношення кількості дієслів до кількості іменників у тексті. Це співвідношення вказує на ступінь соціалізації автора та синтаксичну завершеність висловлення. KOD, що дорівнює 0.57, перебуває в типовому діапазоні від 0.30 до 0.60 для медійного стилю, що свідчить про низький ступінь коефіцієнта опредметненої дії. Згідно з психологічною інтерпретацією, це вказує на низький рівень емоційності автора/мовця, нерішучість щодо активних практичних дій і тривожність. Значення в діапазоні 1.35 ± 0.05 визначає нормальну емоційну стабільність і регуляцію емоцій автором, що, з огляду на мовні особливості, свідчить про нормальний ступінь синтаксичної завершеності речень і правильну синтаксичну структуру;

3) Коефіцієнт агресивності (KA) виражає співвідношення кількості дієслів і дієслівних слововживань до загальної кількості слів у тексті, що позначає агресивність мови в психолінгвістичному аспекті. KA, що дорівнює 0.15, є вищим за норму медійного стилю 13% та є ознакою ідіостилю. Згідно з психологічною інтерпретацією, значення нижче 60% указують на низький ступінь агресивності, пригнічені емоції автора та його нерішучість. Наближення до 60% визначає нормальний ступінь агресивності й емоційної стабільності автора, тоді як значення понад 60% указують на високу агресивність автора та емоційне збудження.

Насамкінець розглянемо семантичний статистичний параметр Тексту 1: індекс токсичності тексту (ITOX) обчислюється за частотністю негативної лексики в тексті (докладніше див. розділ 4.3). Значення ITOX, що дорівнює 0.36, перебуває в типовому діапазоні від 0.1 до 0.7 для медійного стилю. ITOX формує когнітивні та прагматичні настанови щодо негативних емоцій.

234

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

4.2. Порівняння текстів за статистичними параметрами

Завдання оцінювання ступеня подібності між двома текстами передбачало перевірку Гіпотези 2. Ця гіпотеза стверджує, що якщо емпіричні дані, отримані внаслідок статистичної параметризації двох текстів, демонструють лише невелику різницю в числових значеннях індексів, то ці тексти належать одному авторові. Цю гіпотезу перевіряють у системі двома способами: 1) порівнянням числових значень кожного індексу у двох текстах; 2) визначенням векторної відстані між двома текстами. Ці завдання реалізовано в розділі «Порівняння атрибуції текстів». Перше завдання передбачає порівняння емпіричних даних текстів за допомогою індексів на шкалі довірчого інтервалу медійного стилю (Fig. 3). Як показано на Fig. 3, кількісні характеристики параметрів обох текстів відображаються різними кольорами для зручності користувача. Візуалізація порівнює емпіричні значення індексів обох текстів із порогами довірчого інтервалу (нижнім і верхнім), отриманими на основі текстів українського медійного стилю.

FIGURE 3: Порівняння векторної відстані текстів

Друге завдання полягає в обчисленні векторної відстані між двома текстами за формулою евклідової відстані. Це передбачає підсумовування квадратів різниць між числовими значеннями 15 статистичних параметрів двох текстів. Потім обчислюють квадратний корінь із цієї суми. Числові значення

Straipsniai / Articles

235

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

векторної відстані вказують на ступінь статистичної несхожості між текстами та дають змогу виміряти відстань між ними. Хоча коливання значення векторної відстані для медійних текстів недостатньо вивчені, під час порівняння ідентичних текстів відстань може дорівнювати 0. Це означає, що тексти є різними, якщо векторна відстань більша за 0. Крім того, що більше числове значення векторної відстані, то більші лінгвістичні та статистичні відмінності між текстами. Порівняння за евклідовою відстанню подано в табличному форматі. У стовпці 4 Fig. 4 числові значення являють собою евклідові відстані. На Fig. 4 показано порівняння аналізованого тексту Олексія Гончаренка (Текст 1) із трьома іншими текстами того самого автора: рядок 1 для Тексту 2 (відстань 0.44); рядок 2 для Тексту 3 (відстань 0.56); рядок 3 для Тексту 4 (відстань 0.77). Емпіричні дані демонструють, що подібність текстів одного автора залишається в межах 1, тоді як тексти інших авторів (рядки 4–10) мають відстані, більші за 1.

FIGURE 4. Систематизація евклідової відстані між текстами

Порівняння статистичних параметрів текстів переконує нас, що запропонована методика атрибуції виявляє стилометричну модель українськомовних текстів. Цю модель також можна використовувати для визначення авторства тексту. Ми підтвердимо це візуальним представленням атрибуції 7 текстів трьох різних авторів за 15 статистичними параметрами за допомогою методу Uniform Manifold Approximation and Projection (UMAP) (McInnes et al. 2020), алгоритм якого також реалізовано в системі TextAttributor. Це

236

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

методика дає змогу зменшити розмірність простору ознак, проєктуючи 15-вимірний простір на площину. На Fig. 5 точки різної форми (P1–P7 для Автора 1, F1–F7 для Автора 2, M1–M7 для Автора 3) відповідають 7 випадково вибраним текстам різних авторів.

Як бачимо, після зменшення розмірності відображення точок текстів трьох авторів можна наочно розділити на окремі ділянки. Цей приклад підтверджує, що параметри, визначені TextAttributor, є важливими для опису стильових особливостей текстів і визначення авторства тексту (навіть у зменшеному вигляді).

FIGURE 5: Графічне представлення атрибуції текстів за допомогою методу UMAP

4.3. Індексування негативної тональності тексту

Розробляючи систему статистичних параметрів для визначення стилю й авторства тексту, ми усвідомили, що токсичність тексту може слугувати індексом атрибуції. Тому ми створили окремий модуль для автоматичного визначення індексу токсичності в TextAttributor.

Straispsniai / Articles

237

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

Сьогодні інформаційний компонент набув особливого значення в умовах гібридної війни. Тому матеріалом нашого дослідження став корпус онлайн-медійних текстів політичного дискурсу обсягом 10 мільйонів слів. Термін «токсичний текст» ми використовуємо в широкому значенні. Такі тексти характеризуються переслідуванням, погрозами, непристойністю, кібербулінгом, тролінгом і текстами, що містять ненависть на ґрунті ідентичності, а також емотиконами — явищами й об’єктами, які спричиняють у людини негативні емоції (наприклад, війна, повітряна тривога, корупція).

Метою цього проєкту було визначити потенціал реалізації негативної тональності в українських текстах і розробити автоматизовану систему виявлення токсичного контенту. Це завдання охоплювало два послідовні підзавдання: по-перше, розроблення системи лінгвістичного дослідження токсичних текстів із визначенням індексів токсичності за допомогою словникових і заснованих на правилах методів; по-друге, створення навчального набору даних для машинного навчання та розроблення нейронної мережі для прогнозування індексів токсичності тексту.

Розгляньмо виконання першого завдання. Воно передбачало створення лексикографічної бази даних із трьома окремими словниками:

1) Словник емотіогенів: добірка з 5000 слів (відповідно до значень лексико-семантичних варіантів) із негативними відтінками тональності, оціненими за шкалою −2. Приклади: аморальний, безкарність, хабарництво і красти;

2) Словник мови ворожнечі: містить 3000 слів, зокрема назви осіб (1620), непристойні терміни (613) і образливу лексику (787). Приклади: западенець (западенець: зневажлива назва людей із західних регіонів України) і спекулянт;

3) Токсичні фрази: добірка з 1500 фразеологічних виразів, що передають негативні емоції. Приклад: кривиться, як мавпа, цілує дупу й роззявляє рота.

Кожен запис у цих списках було анотовано семантичними ознаками: Словник мови ворожнечі має 18 ознак, а список токсичних фраз — 26. Наприклад, слова у Словнику мови ворожнечі позначалися такими характеристиками, як «s» для сексизму, «r» для расизму та «e» для ейджизму. Ця лексикографічна база даних, мультипараметрична система, призначає семантичні ознаки одиницям (словам або фразам), що в поєднанні з частотними даними аналізованого тексту дає змогу аналізувати токсичність.

Індекс токсичності тексту обчислюють за формулою:

Itox = (e + |K| (m + t)) / n * 10,

Тут n — обсяг тексту; e — кількість емоційних слів; m — кількість слів мови ворожнечі; t — кількість токсичних фраз; K — коефіцієнт, що дорівнює −2; він підсилює слова мови ворожнечі й токсичні фрази, які за шкалою

238

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

із п’яти цифр (+2, +1, 0, −1, −2) відповідає −2. Значення індексу варіюють від 0 до +1.

Наприклад, індекс токсичності тексту «Люди з червоною ручкою» (12 речень, 129 слів) дорівнює 1.01, що свідчить про його високу токсичність, оскільки поріг для таких коротких текстів коливається від 0.1 до 0.7. Одночасно система генерує результати автоматичного лінгвістичного дослідження токсичності тексту (див. Fig. 6), що містить: 1) статистичну карту семантичних класів негативної лексики відповідно до класифікаційних маркерів лексикографічних списків (емотіогени — 5, вульгаризми — 2, сексизм — 2); 2) текст із конкретними словами негативної тональності, що вербалізують категорії статистичної карти. Розгляньмо уривок аналізованого тексту з реального життя (Fig. 6):

ті люди, які ходять із червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як бісите? Я спеціально вивчаю ваші профілі, мені цікаво, у якому світі ви існуєте. Цей світ лякає мене дуже. Щиро сподіваюся, що в реальному житті ми за жодних обставин не перетнемося. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересі­чемося ні за яких обставин).

Тут система автоматично виділяє жирним шрифтом такі слова з негативним компонентом: помилки (помилки), чужих (чужих), бісите (бісите), лякає (лякає).

FIGURE 6: Фрагмент автоматичного лінгвістичного дослідження токсичності тексту

Straipsniai / Articles

239

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

5. ПІДХОДИ МАШИННОГО НАВЧАННЯ: ЕКСПЕРИМЕНТИ, РЕЗУЛЬТАТИ ТА ОБГОВОРЕННЯ

Зосередьмося на другому режимі роботи системи TextAttributor, присвяченому методам машинного навчання. На вхід для навчання моделі подаються текстові корпуси, марковані відповідно до мети кожного підзавдання: (a) текстова інформація для виявлення токсичності та (b) ідентифікація авторства. Кожен корпус поділяють на навчальну й контрольну вибірки, а для достатньо великого корпусу — також на валідаційну вибірку. Параметри вибраної моделі розв’язання задачі оцінюють на навчальній вибірці. Гіперпараметри моделі налаштовують за валідаційною вибіркою. Остаточні показники ефективності моделі вимірюють на контрольній вибірці з урахуванням доступності обчислювальних ресурсів, необхідних для функціонування моделі. Корпус для кожного підзавдання розробляли паралельно з компонентом машинного навчання TextAttributor, тому поточні моделі навчали на відносно невеликих даних, що містили короткі інтернет-тексти українськомовних блогів, коментарів, статей тощо.

5.1. Виявлення токсичності

У результаті серії експериментальних досліджень було вибрано обчислювально ефективну архітектуру, засновану на методі fastText і його інструментах (Joulin et al. 2016). Цей метод забезпечує векторні подання слів і оцінює розподіл імовірностей документів за заздалегідь визначеними класами. Слова подаються у векторній формі на основі автоматичного поділу слів на частини (підслова), що імітує відкритість словника. Подання підслів є важливим, оскільки українська мова має високу флективність, і необхідно охоплювати велику кількість невідомих слів, а також слів із орфографічними помилками. Ефективність використаного підходу також визначається технічними умовами функціонування системи та доступними текстовими ресурсами для навчання моделі.

Підготовлений корпус приблизно з 12 000 текстових документів використано для бінарної класифікації з метою виявлення токсичного контенту. Найкращого результату за узагальненою метрикою (F1 = 79.4%) досягнуто за таких значень гіперпараметрів: розмірність вектора слова — 56, початкова швидкість навчання — 0.15, 500 епох навчання, лексичний контекст, представлений біграмами, довжина підслів — від 2 до 5 символів, поріг ухвалення рішення — 0.4. Крім того, модель продемонструвала чутливість 85% за точності приблизно 70%.

240

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

5.2. Ідентифікація авторства

Експериментальне дослідження моделей ідентифікації авторства текстів проводили з використанням частини корпусу загальнодоступних суспільно-політичних текстів, у яких можна ідентифікувати особу автора документа. Було відібрано загалом 702 тексти чотирьох авторів, які опублікували найбільшу кількість документів обсягом від 60 до 1000 символів. Найбільша кількість публікацій автора становить 304 (115 тисяч символів), а найменша — 109 (49 тисяч символів). Для тестування випадково відібрали по 25 текстів для кожного вибраного автора. Решта документів утворила навчальну вибірку.

Найкращого результату за узагальненою метрикою (F1 = 81%) досягнуто за таких значень гіперпараметрів: розмірність простору векторних подань слів — 50, початкова швидкість навчання — 0.1, 50 епох навчання, лексичний контекст, представлений біграмами, довжина підслів — від 2 до 5 символів, поріг ухвалення рішення — 0.5. Примітно, що для певних конфігурацій моделі чутливість до автора з найбільшою кількістю документів у наборі даних досягла 100%, а точність перевищила 90%. Ці результати демонструють можливість розроблення ефективної системи, здатної точно охоплювати тексти авторів, достатньо представлених у навчальній вибірці.

Навчені моделі нейронних мереж було інтегровано в систему TextAttributor за «клієнт-серверною» архітектурою, де представлено результати двох завдань: (a) визначення токсичності та (b) виявлення авторства. Результат роботи системи з текстом «Закону України про вищу освіту»: індекс токсичності (оцінка у формі ймовірності: наскільки токсичним є текст) — 0.04, подібність до авторів (оцінки у формі ймовірності авторства для авторів, відомих системі): 0.49 для I. Farion, 0.30 для Oleksii Honcharenko та 0.22 для Mariana Bezugla.

6. ВИСНОВКИ

Система TextAttributor наразі проходить етапи тестування для розв’язання проблем атрибуції та визначення токсичності українськомовних текстів. Ця система є зручною та ефективною для різноманітних технологічних досліджень. За 5 місяців вебзастосунок TextAttributor автоматично проаналізував 784 українські тексти 226 користувачів.

Наші результати демонструють ефективність методу, який передбачає квантифікацію вербальних елементів на основі формальних граматичних і семантичних параметрів, особливо щодо негативної емоційності. Цього досягають завдяки поєднанню словникових і заснованих на правилах підходів, доповнених машинним навчанням

Straipsniai / Articles

241

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

методами. Експериментальне машинне навчання для виявлення токсичності та ідентифікації авторства за текстом дало змогу отримати результати, зіставні з результатами експериментів з аналогічними характеристиками моделей (кількістю документів і авторів), описаними для інших мов. Моделі підслів продемонстрували підвищену стійкість до лексичної відкритості та текстових помилок.

Проведене дослідження відкриває шлях до розв’язання таких завдань для української мови, як виявлення та моніторинг токсичного контенту, мови ворожнечі й дезінформації, верифікація авторства та деобфускація, профілювання авторів і діаризація, психолінгвістичне профілювання, моделювання стилю та відстеження джерела фейкового контенту тощо. Розроблену схему аналізу й атрибуції тексту також можна застосовувати до інших мов.

У перспективі ми плануємо інтегрувати наш інструмент автоматичної атрибуції текстів і виявлення токсичності із семантичним, синтаксичним, психолінгвістичним і соціолінгвістичним аналізом. Ця інтеграція дасть нам глибше розуміння впливу на читача. Використовуючи семантичний аналіз лексичної таксономії, ми прагнемо виявити наративні елементи, властиві тексту, тим самим підвищивши надійність атрибуції тексту в процедурах ідентифікації авторства. Крім того, ми плануємо розширити наші текстові корпуси та використовувати багатомовні великі мовні моделі, щоб і надалі розширювати можливості нашої системи, а також упровадити інструменти статистичного порівняння текстів для всіх стилів української мови.

Подяки

Систему створено в межах проєкту, підтриманого Посольством Великої Британії в Kyiv, і реалізовано командою викладачів та дослідників кафедри української мови й прикладної лінгвістики Taras Shevchenko National University of Kyiv.

Ми хотіли б висловити щиру вдячність Посольству Великої Британії в Kyiv за фінансову підтримку цього дослідницького проєкту. Ми вдячні Svitlana Yavorska та Iryna Bezkorovayna за їхні настанови й допомогу протягом усього проєкту. Особлива подяка Kostiantyn Goncharenko за організаційну та документальну підтримку проєкту. Крім того, ми вдячні студентам освітньої програми «Прикладна (комп’ютерна) лінгвістика та англійська мова» Taras Shevchenko National University of Kyiv. Вони долучилися своїм часом, знаннями та зусиллями до формування корпусу українських токсичних текстів. Ми вдячні Oksana Tolochko, випускниці нашої бакалаврської програми, за створення тонального словника української мови, який ми використали для укладання лексикографічного списку негативних емотиконів. Крім того, ми надзвичайно вдячні Mykola Kostikov за його зусилля під час збирання даних. Ми хотіли б висловити щиру подяку всім членам дослідницької спільноти, які долучилися до цього дослідження своїми порадами та консультаціями.

242

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

REFERENCES

ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/.

Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273.

Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003.

Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038.

Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv].

Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267.

Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146.

Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100.

Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka.

Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265.

Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of

Straipsniai / Articles

243

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01.

Darčuk Natalija 2013: Komp’juterne anotuvannja ukrajin’s’koho tekstu: rezul’taty i perspektyvyj, Kyiv: Osvita Ukrajiny.

Darčuk Natalija, Vasyl’jeva Iryna, Vasyl’jev Oleksij 2021: Vektorna model’ analizu stylistyku tekstiv. – Ukrajins’kyj fizičnyj žurnal 66(5), 373–378.

Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066.

Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036.

Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308.

Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935.

Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453.

Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80.

Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296.

Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, Jégou Hervé, Mikolov Tomas 2016: FastText.zip: Compressing text classification models. – ArXiv e-prints 1612.03651. DOI: 10.48550/arXiv.1612.03651.

244

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264.

Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565.

Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf.

KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx.

LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app.

Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500.

Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041.

McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426.

Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt.

Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031.

Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047.

Straipsniai / Articles

245

NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK

TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts. Available at: ta.mova.info.

Volos Yana, Levchenko Olena 2023: Statistical profile of Valerie Shevchuk’s idiostyle (morphological level). – Slobozhan Scientific Bulletin, Ser. Philology, 3, 32–36. DOI:10.32782/philspu/2023.3.6.

Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15.

Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas)

SANTRAUKA

Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą.

246

Acta Linguistica Lithuanica XCI

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Įteikta 2024 m. lapkričio 25 d.

NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine [email protected]

VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]

MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine [email protected]

Straipsniai / Articles

247