This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
NATALIIA DARCHUK
Киевский национальный университет имени Тараса Шевченко
Области исследований: анализ, распознавание и синтез речи, обработка естественного языка.
DOI: doi.org/10.35321/all91-09
СИСТЕМА АВТОМАТИЧЕСКОГО СТИЛОМЕТРИЧЕСКОГО АНАЛИЗА УКРАИНОЯЗЫЧНЫХ МЕДИА-ТЕКСТОВ TEXTATTRIBUTOR 1.0 (МЕТОДЫ, СРЕДСТВА, ФУНКЦИОНАЛЬНОСТЬ)
Система автоматического стилометрического анализа украиноязычных медиатекстов «TextAttributor 1.0» (методы, средства, функциональность)
АННОТАЦИЯ
В статье представлены структура, алгоритмы, реализация и экспериментальные результаты автоматической системы TextAttributor, разработанной авторами статьи для статистической параметризации украиноязычных текстов с использованием многопараметрического набора статистических индексов, характеризующих стиль текста автора и применимых к задачам атрибуции авторства. На основе созданных лингвистических ресурсов и программного обеспечения система формирует лингвистический анализ на базе рассчитанных статистических индексов и проводит сравнительное исследование двух текстов. Дополнительным критерием статистической индексации является индекс токсичности текста, рассчитываемый методом вербальной идентификации токсичного сентимента. Задачи определения авторства и токсичности решаются с использованием двух методов: статистических вычислений на основе словаря и правил и машинного обучения. Текущие результаты, реализованные в бета-версии TextAttributor, подробно рассмотрены.
КЛЮЧЕВЫЕ СЛОВА: компьютерная лингвистика, украинский язык, анализ сентимента, атрибуция авторства, стилометрия, классификация текста.
224
Acta Linguistica Lithuanica XCI
Page 3
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
А Н Н О Т А Ц И Я
В этой статье представлены структура, алгоритмы, реализация и экспериментальные результаты автоматической системы «TextAttributor», созданной авторами статьи для статистической параметризации текстов на украинском языке с использованием многопараметрического набора статистических показателей, характеризующих стиль текста автора и применяемых к задачам атрибуции авторства. На основе созданных лингвистических ресурсов и программного обеспечения система формирует лингвистический анализ по рассчитанным статистическим индексам и проводит сравнительный анализ двух текстов. Дополнительным критерием статистической индексации является индекс токсичности текста, рассчитываемый с применением метода вербальной идентификации токсичных настроений. Задачи определения авторства и выявления злонамеренности решаются двумя методами: статистическими вычислениями на основе словаря и правил и машинным обучением. Текущие результаты, полученные с использованием бета-версии «TextAttributor», подробно рассмотрены.
КЛЮЧЕВЫЕ СЛОВА: компьютерная лингвистика, украинский язык, анализ тональности, атрибуция авторства, стилометрия, классификация текста.
1. ВВЕДЕНИЕ
Текстологические исследования приобрели новое научное значение благодаря развитию методов компьютерной лингвистики, способствовавшему формированию нового направления, которое можно рассматривать как цифровую текстологию. В рамках этой формирующейся дисциплины мы понимаем цифровую текстологию как использование автоматизированных методов корпусной лингвистики в сочетании с математическими моделями количественного анализа текста. Руководствуясь актуальными задачами современной количественной лингвистики и обработки естественного языка, наша команда разработала систему автоматического лингвостатистического анализа медиатекстов, реализованную в виде веб-приложения под названием TextAttributor (TextAttributor 1.0 2024). Система выполняет четыре задачи: 1) статистическую параметризацию текста; 2) стилометрию: определение лингвостатистических особенностей идиолекта; 3) атрибуцию: определение степени сходства между текстами; и 4) анализ сентимента: выявление лексики отрицательной тональности в текстах. Кроме того, в системе автоматически формируются два лингвистических экспертных заключения на основе результатов второй и четвёртой задач. Многофункциональность системы TextAttributor требует от пользователей ознакомления с принципами её работы. Цель статьи — познакомить академическое и образовательное филологическое сообщество с методологией создания системы, её архитектурой и результатами работы, чтобы обеспечить ясное понимание её функций и аналитических возможностей, которые имеют особое значение. Этот подход особенно актуален для анализа больших объёмов интернет-коммуникации и
Straipsniai / Articles
225
Page 4
НАТАЛИЯ ДАРЧУК, ОКСАНА ЗУБАН, ВАЛЕНТИНА RОBEIKO, ЮЛИЯ ЦЫГВИНЦЕВА, ВИКТОР СОРОКИН, НИКОЛАЙ САЖОК
укрепления стратегий информационной защиты в условиях продолжающейся российско-украинской войны. Концепция разработки автоматической системы атрибуции украиноязычных текстов возникла на основе анализа исследований в области украинской корпусной лингвистики (Darčuk 2013) и статистических исследований авторского стиля (Darčuk et al. 2021; Darchuk, Sorokin 2022; Zuban 2019), проведённых авторами проекта с использованием инструментов корпуса украинского языка (KUM).
При разработке системы TextAttributor применялись следующие методы: компонентный анализ, дистрибутивный анализ и контент-анализ. Контент-анализ — количественный и качественный метод извлечения информации из текста — осуществлялся с использованием обработки естественного языка и статистических методов. Также применялись квантование и анализ сентимента. Анализ сентимента автоматически определяет тональность текста на основе как эмоциональной окраски, так и оценки автором событий или объектов; это было достигнуто с помощью статистических вычислений на основе словаря и правил.
Кроме того, были интегрированы методы машинного обучения, включая глубокое обучение. Статистическая структура текста, понимаемая как его количественная модель, позволяет определить его функциональный стиль, авторство и период создания. В данной работе компоненты статистической структуры извлекались посредством анализа лексических и грамматических статистических характеристик с использованием методов индексации и метрик евклидова расстояния. Евклидово расстояние, измеряющее расстояние между двумя точками в n-мерном евклидовом пространстве, является одной из наиболее широко используемых в лингвостатистике метрик для кластерного анализа в стилометрии и атрибуции авторства.
Новизна результатов состоит в первой реализации в компьютерной лингвистике автоматизированной морфосинтаксико-семантической стилометрической модели анализа текста, основанной на 15 статистических индексах, которые прежде всего параметризуют морфологическую, а также синтаксическую и семантическую структуру текста. Стилометрическая модель представляет собой совокупность статистических параметров текста (лексических, морфологических, синтаксических и т. д.), на основе которых проводится сравнительный анализ этого текста со стилометрической моделью функционального стиля. По нашему мнению, использование статических методов при построении стилометрической модели позволяет получить строгую, детерминированную, научно обоснованную систему общих и отличительных признаков стилей, жанров и т. д. Впервые в стилометрической модели введён параметр индекса токсичности, характерным образом определяющий медиатексты в период российско-украинской войны. Эта модель реализована не только в функции статистической параметризации текстов, что типично для систем такого типа, но и в функции сопоставления анализируемого текста с медиастилем украинского языка, а также для стилометрических и атрибуционных задач, связанных с двумя и более текстами. Теоретическая значимость заключается в апробации двух методов определения токсичности текста и
226
Acta Linguistica Lithuanica XCI
Page 5
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
авторства на украинском языке: 1) посредством подходов на основе словаря и правил и 2) с помощью машинного обучения, включая глубокое обучение.
2. ОБЗОР ИССЛЕДОВАНИЙ
В современной украинской лингвистике проведены значительные лингвостатистические исследования идиолектов украинских писателей и поэтов, включая Тараса Шевченко, Лесю Украинку, Василя Стуса (Zuban’ 2019), Ивана Франко (Buk 2021), Романа Иванычука (Lototska 2022), Валерия Шевчука (Volos, Levchenko 2023), Марию Матиос, Юрия Андруховича, Оксану Забужко (Karasov, Levchenko 2024), Ивана Драча, Николая Винграновского (Darchuk et al. 2024), Лину Костенко (Zuban’ 2019; Darchuk et al. 2024) и других. Эти исследования проводились на репрезентативных выборках текстов (текстах большого объёма) с использованием преимущественно одного или нескольких (не более пяти) статистических параметров, часто без применения стилометрического сравнения. Кроме того, из-за трудоёмкости проведения лингвостатистических экспериментов украинская лингвистика в значительной степени оставляла без внимания комплексную статистическую параметризацию, сопоставление анализируемых текстов со стандартными статистическими параметрами функциональных стилей, определение степени сходства текстов, а также стилометрический и атрибуционный анализ коротких текстов. Использование системы TextAttributor в лингвостатистических исследованиях, направленное на автоматическое выполнение этих задач, позволит не только получить частотные характеристики языковых явлений, но и эффективно провести стилометрический анализ, результатом которого станет экспертное заключение.
Система TextAttributor имеет преимущества по сравнению со своими аналогами в мировой науке. Большинство существующих систем и моделей также сосредоточено на использовании отдельных лингвостатистических модулей для выявления одного или нескольких, главным образом формальных (n-грамм, наиболее частотных слов, букв), параметров текста (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). В отличие от них, TextAttributor 1.0 предлагает комплексный подход, включающий интерактивный статистический анализ лексической, морфологической, синтаксической и семантической структуры текста в реальном времени по 15 параметрам.
Атрибуция текстов активно развивается в зарубежных текстологических исследованиях; в частности, эффективность метода Берроуза (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) проверяется во многих исследованиях на больших объёмах текстовых данных различных стилей, таких как: английская проза начала XXth века (Hoover 2004); современная английская поэзия (Hoover 2005); поэтические произведения на латыни (Rybicki, Eder 2011); прозаические произведения основных жанров на английском, французском, итальянском, немецком, польском, венгерском, а также латинском и арабском языках (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); политические тексты на английском языке, включая
атрибуцию речей американских президентов (Savoy 2015). Ещё один метод автоматического лингвистического анализа, называемый «Linguistic Inquiry and Word Count» (LIWC), реализован в виде коммерческого приложения и адаптирован для нескольких языков (Meier et al. 2019; LIWC-22).
В последние годы в задачах автоматической атрибуции текста преимущественно использовались либо стилометрические методы на основе правил, либо методы глубокого обучения (Eder 2015; Canhasi et al. 2022). Оба метода реализованы в системе TextAttributor, эффективно функционируют, но дают разные результаты: 1) метод на основе правил позволяет автоматизировать формирование лингвистических заключений об идиолекте и токсичности текста; 2) метод машинного обучения определяет только степень токсичности и сходство текстов и может использоваться в задачах классификации для мониторинга текстового контента.
Современные методы машинного обучения для анализа сентимента и идентификации авторства текста основаны на статистических подходах (TF-IDF, Latent Dirichlet Allocation) и методах глубокого обучения с различными архитектурами (CNN, LSTM, BERT) в сочетании со стилометрическими методами (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). Приводимые результаты чрезвычайно зависят от числа классов (типов токсичности, авторов), жанра, длины текста и, что наиболее важно, объёма надлежащим образом размеченного текстового корпуса, использованного для процедуры обучения. Так, высокие показатели точности в задачах выявления токсичности и языка вражды превышают 90% при использовании корпуса, содержащего десятки тысяч документов (Alkomah, Ma 2022). Например, точность более 90% при атрибуции авторства достигается для англоязычных литературных произведений 1000 авторов с использованием корпуса из 6000 документов для 15 авторов. В свою очередь, для корпусов, содержащих менее 1500 документов, заявленная точность составляет около 70% (Khan et al. 2023). Для украинского языка идентификация авторства текста и анализ сентимента/токсичности являются недостаточно изученными задачами (Lupei et al. 2020); кроме того, такие системы не формируют лингвистическую экспертизу и не могут использоваться как инструменты лингвистического исследования.
3. ОБЩАЯ ХАРАКТЕРИСТИКА РАБОТЫ СИСТЕМЫ TEXTATTRIBUTOR
В ходе разработки TextAttributor были выполнены следующие задачи: 1) теоретическая лингвистика: разработана методология формализованного морфологического, статистического, стилометрического, атрибуционного анализа и анализа сентимента; 2) разработка программного обеспечения: разработаны структура лингвистических баз данных и программное обеспечение для упомянутых автоматических анализов; 3) экспериментальная лингвистика: система протестирована на украинских медиатекстах, и
228
Acta Linguistica Lithuanica XCI
Page 7
Система автоматического стилометрического анализа украиноязычных медиатекстов TextAttributor 1.0 (методы, средства, функциональность)
реализован аналитический модуль для автоматического стилометрического исследования. Автоматизированная лингвистическая система, реализованная в виде веб-приложения, обрабатывает введённые пользователем тексты медиастиля, формируя числовые значения статистических параметров, характеризующих свойства текста. Система работает в следующей последовательности:
1. Токенизация текста: разбиение текста на предложения и слова для анализа.
2. Морфологическая разметка: присвоение словам меток на основе их грамматических форм.
3. Контекстуальный анализ: обновление морфологических меток с учётом контекста.
4. Синтаксический анализ: установление бинарных отношений между словами в предложениях для понимания их грамматической структуры.
5. Установление синтаксических связей: определение синтаксических связей на основе заранее заданных правил.
6. Сопоставление эмоционально негативной лексики: выявление слов из заранее определённого набора негативной лексики.
7. Оценка статистических параметров: оценка статистических параметров входного текста с использованием автоматически составленных частотных словарей.
8. Визуализация результатов: графическое представление результатов статистической параметризации с эмпирическими значениями и доверительными интервалами.
9. Сравнение результатов: визуализация результатов статистической параметризации двух текстов медиастиля, облегчающая их сравнение.
10. Оценка евклидова расстояния: количественная оценка различий между двумя текстами медиастиля.
11. Формирование экспертного заключения: формирование двух экспертных заключений: одного об атрибуции текста, другого — о токсичности текста на основе лингвистического исследования.
12. Выявление токсичности и идентификация авторства: использование методов машинного обучения, в частности моделей нейронных сетей, для выявления токсичности и идентификации авторов.
Результаты работы системы организованы в следующих разделах: группа индексов атрибуции текста, экспертное заключение об атрибуции текста, сравнение атрибуции текста, лингвистическая экспертиза токсичности текста и заключения нейронной сети.
В группе индексов атрибуции текста (рис. 1) статистические параметры организованы на основе входного текста: в столбце 1 отображается название индекса, в столбце 2 представлено эмпирическое числовое значение, а в столбце 3 приводится визуальное сопоставление эмпирического значения индекса с порогами доверительного интервала
(нижним и верхним), полученными на основе текстов украинского медиастиля. Эмпирическое числовое значение представлено на шкале закрашенным перевёрнутым треугольником.
РИСУНОК 1: Фрагмент результата атрибуции текста
В экспертном заключении об атрибуции текста (рис. 2) представлены выводы о типичных или индивидуальных лингвостатистических особенностях, извлечённых из анализируемого текста для каждого оцениваемого индекса. Эти выводы основаны на ответах на вопрос: попадает ли числовое значение индекса в доверительный интервал медиастиля украинского языка? На основе сопоставления числовых значений с пороговыми значениями доверительного интервала система формирует три возможных ответа (типичные признаки медиастиля, признаки идиостиля ниже нормы медиастиля и признаки идиостиля выше нормы медиастиля).
В сравнении атрибуции текста (рис. 4, подраздел 4.2) после выбора пункта «Рассчитать векторное расстояние» табличные данные оперативно обновляются следующим образом: в столбце 1 перечислены введённые пользователем тексты вместе с ранее проанализированным текстом; в столбце 2 отображается число предложений в каждом тексте; в столбце 3 указано количество слов; в столбце 4 представлено евклидово расстояние между анализируемым текстом и каждым текстом в таблице; в столбце 5 с меткой «Сравнить» запускается автоматическое сравнение статистических индексов анализируемого текста с выбранным текстом. После активации соответствующего элемента «Сравнить» в группе «Индексы атрибуции текста» (рис. 3) предоставляется подробная информация о статистическом сравнении двух текстов.
230
Acta Linguistica Lithuanica XCI
Page 9
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
РИСУНОК 2: Пример сформированного экспертного заключения
В лингвистической экспертизе токсичности текста (подраздел 4.3) представлена лексико-семантическая интерпретация рассчитанного индекса токсичности (рис. 6).
В заключениях нейронной сети представлены результаты работы нашей модели глубокого обучения, которая количественно оценивает токсичность текста по шкале от 0 (нетоксичный) до 1 (высокая токсичность). Мы также оцениваем сходство текста с известными авторами; значения находятся в диапазоне от 0 (отсутствие сходства) до 1 (высокое сходство) и основываются на авторах, на текстах которых обучалась модель. Результаты отображаются только для тестов с показателем сходства выше 0,1. Наша текущая система работает в демонстрационном режиме, используя ограниченный корпус авторских текстов для оценки сходства с введённым пользователем текстом.
4. АТРИБУЦИЯ УКРАИНОЯЗЫЧНЫХ ТЕКСТОВ: ЭКСПЕРИМЕНТЫ, РЕЗУЛЬТАТЫ И ОБСУЖДЕНИЕ
4.1. Индексы статистической параметризации
Разработанная стилометрическая модель решает две задачи: 1) выявление индивидуальных особенностей авторского стиля (стилометрия); 2) оценку сходства между двумя текстами на основе лингвистических и статистических параметров (атрибуция).
Для статистического анализа введённого пользователем текста используются 19 параметров (см. рис. 1, группу индексов атрибуции текста). Первые четыре параметра охватывают основные количественные данные: количество слов, необработанные слова, объём словаря и количество предложений. Подсчёт слов не включает лексику, не обработанную системой, например диалектизмы, московизмы, окказионализмы и т. д. Остальные 15 параметров представляют собой вычисляемые индексы, дающие скалярные величины.
Для стилометрического анализа мы собираемся проверить гипотезу 1. Эта гипотеза утверждает, что посредством анализа эмпирических данных, охватывающих статистические параметры внутри доверительного интервала украинского медиастиля и за его пределами, можно выявить уникальные авторские особенности в данном медиатексте. Для каждого лингвистического параметра на основе выборок украинских медиатекстов были рассчитаны два набора доверительных интервалов: один для текстов объёмом более 1000 слов (объём выборки: 124,576 слов), другой — для текстов объёмом до 1000 слов (объём выборки: 15,635 слов).
Доверительный интервал для каждого статистического параметра устанавливался с использованием стандартного отклонения σ среднего числового значения индекса (ANVI) в выборке текстов и обозначался как ANVI ± σ. Стандартное отклонение показывает, насколько эмпирические числовые значения статистических индексов могут отклоняться от среднего числового значения индекса в рамках медиастиля. Для обеспечения точности доверительный интервал для σ был определён посредством лингвистического и статистического эксперимента. В результате при проверке гипотезы 1 система предлагает три возможных заключения: 1) числовое значение индекса находится в пределах доверительного интервала; 2) числовое значение индекса ниже нижнего порога интервала; или 3) числовое значение индекса превышает верхний порог интервала.
Рассмотрим результаты параметризации текста 1, автором которого является блогер Oleksii Honcharenko (см. рис. 1). Этот анализ основан на статистических параметрах и их последующей интерпретации, представленной в сформированном экспертном заключении, как показано на рис. 2.
Статистические показатели, характеризующие словарный состав и объём текста, выявляют количественную взаимосвязь. В тексте 1 все эти показатели находятся в типичном для медиастиля диапазоне:
1) Индекс разнообразия (IB) представляет собой отношение уникальных слов к общему объёму текста и служит мерой лексического богатства. Значение IB, равное 0,54, находится в диапазоне 30–60%, что указывает на умеренный уровень лексического разнообразия;
2) Индекс эксклюзивности текста (IVT) выражает отношение количества гапаксов, встречающихся в тексте один раз, к объёму текста. Значение IVT, равное 0,36, находится в диапазоне 20–40%, что указывает на низкую лексическую эксклюзивность;
232
Acta Linguistica Lithuanica XCI
Page 11
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
3) Индекс эксклюзивности словаря (IVL) выражает отношение количества гапаксов, встречающихся в тексте только один раз, к общему объёму словаря. Значение IVL, равное 0,66, находится в диапазоне 60–76%, что указывает на высокую степень лексической эксклюзивности.
Далее рассмотрим статистические параметры количественного соотношения лексических и грамматических классов слов в тексте 1:
1) Индекс именных атрибутов, или эпитетизация (IIO) выражает соотношение количества существительных к количеству прилагательных. IIO, равный 1,07, выше нормы медиастиля, равной 1,0, что указывает на преобладание существительных над прилагательными и, следовательно, на меньшее количество эпитетов в тексте;
2) Индекс глагольных атрибутов (IDO) выражает соотношение количества наречий к количеству глаголов. IDO, равный 0,57, выше нормы медиастиля, равной 0,56. Такая доля наречий указывает на низкую степень глагольной атрибутивности текста;
3) Степень номинализации (STN) выражает соотношение количества существительных к количеству глаголов. STN, равный 1,76, ниже нормы медиастиля, равной 3,00. Снижение этого индекса указывает на преобладание глаголов над существительными и низкую степень номинализации текста;
4) Индекс прономинализации (IPRO) выражает соотношение количества личных местоимений к объёму словоупотребления текста. IPRO, равный 0,09, выше нормы медиастиля и является признаком идиостиля. Личные местоимения охватывают более 7% текста, указывая на степень его связности;
5) Индекс модальности (MOD) выражает соотношение количества частиц к количеству слов в тексте. IMOD, равный 0,07, выше нормы медиастиля, равной 4%, и является признаком идиостиля. Частицы охватывают более 4% текста, что определяет степень выраженности автором различных оценок явлений и ситуаций в тексте;
6) Индекс субстантивности (ISUB) выражает соотношение количества существительных к объёму словоупотребления текста. ISUB, равный 0,26, ниже нормы медиастиля. Существительные охватывают менее 30% текста, что определяет низкую степень статичности текста.
Объясним статистические параметры количественного соотношения словосочетаний и предложений в Тексте 1:
1) Индекс динамизма (IDYN) выражает соотношение количества глагольных словосочетаний к количеству именных словосочетаний. IDYN, равный 0,74, выше нормы медиастиля, равной 0,6, и является признаком идиостиля. Преобладание глагольных словосочетаний над именными (IDYN больше 1,0) определяет динамичное и быстрое развёртывание событий в смысловом содержании текста;
2) Индекс связности (IZV) выражает соотношение количества предлогов и союзов к количеству предложений в тексте. IZV, равный 0,66, находится в типичном диапазоне от 0,45 до 0,90 для медиастиля, что указывает на преобладание количества предложений над количеством предлогов и союзов. Это определяет среднюю степень связности между реалиями, явлениями и ситуациями, описанными в Тексте 1.
Особое внимание будет уделено психолингвистическим статистическим параметрам (Chuhunov 2009) в Тексте 1:
1) Коэффициент Трейгера (KT) выражает соотношение количества глаголов к количеству прилагательных в тексте, указывая на эмоциональную стабильность/нестабильность говорящего. KT, равный 0,61, выше нормы медиастиля, равной 0,5, и является признаком идиостиля. Согласно психологической интерпретации, это указывает на низкую эмоциональность автора/говорящего, нерешительность в принятии активных практических действий и тревожность. Значение в диапазоне 1,35 ± 0,05 определяет нормальную эмоциональную устойчивость и регуляцию автора;
2) Коэффициент определённости действия (KOD) выражает соотношение количества глаголов к количеству существительных в тексте. Это соотношение указывает на степень социализации автора и синтаксическую завершённость высказывания. KOD, равный 0,57, находится в типичном диапазоне от 0,30 до 0,60 для медиастиля, что указывает на низкую степень коэффициента опредмеченности действия. Согласно психологической интерпретации, это свидетельствует о низком уровне эмоциональности автора/говорящего, нерешительности в отношении активных практических действий и тревожности. Значение в диапазоне 1,35 ± 0,05 определяет нормальную эмоциональную устойчивость и регуляцию эмоций автором, что на основании языковых признаков указывает на нормальную степень синтаксической завершённости предложений и корректную синтаксическую структуру;
3) Коэффициент агрессивности (KA) выражает соотношение количества глаголов и глагольных употреблений к общему количеству слов в тексте, характеризуя агрессивность языка в психолингвистическом аспекте. KA, равный 0,15, выше нормы медиастиля, равной 13%, и является признаком идиостиля. Согласно психологической интерпретации, значения ниже 60% указывают на низкую степень агрессивности, подавленные эмоции автора и его нерешительность. Приближение к 60% определяет нормальную степень агрессивности и эмоциональную устойчивость автора, тогда как значения выше 60% указывают на высокую агрессивность автора и эмоциональное возбуждение.
Наконец, рассмотрим семантический статистический параметр Текста 1: Индекс токсичности текста (ITOX) рассчитывается на основе частотности негативной лексики в тексте (подробнее см. раздел 4.3). Значение ITOX, равное 0,36, находится в типичном диапазоне от 0,1 до 0,7 для медиастиля. ITOX формирует когнитивные и прагматические установки по отношению к негативным эмоциям.
234
Acta Linguistica Lithuanica XCI
Page 13
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
4.2. Сравнение текстов по статистическим параметрам
Задача оценки степени сходства между двумя текстами включала проверку Гипотезы 2. Согласно этой гипотезе, если эмпирические данные, полученные в результате статистической параметризации двух текстов, показывают лишь небольшое различие в числовых значениях индексов, то эти тексты принадлежат одному автору. Эта гипотеза проверяется в системе двумя способами: 1) сравнением числовых значений каждого индекса в двух текстах; 2) определением векторного расстояния между двумя текстами. Эти задачи реализованы в разделе «Сравнение атрибуции текстов». Первая задача заключается в сравнении эмпирических данных текстов с использованием индексов на шкале доверительного интервала медиастиля (Fig. 3). Как показано на Fig. 3, количественные характеристики параметров обоих текстов отображаются разными цветами для удобства пользователя. Визуализация сопоставляет эмпирические значения индексов обоих текстов с порогами доверительного интервала (нижним и верхним), полученными для текстов украинского медиастиля.
FIGURE 3: Сравнение векторного расстояния текстов
Вторая задача заключается в вычислении векторного расстояния между двумя текстами с использованием формулы евклидова расстояния. Она включает суммирование квадратов разностей между числовыми значениями 15 статистических параметров двух текстов. Затем вычисляется квадратный корень этой суммы. Числовые значения
векторного расстояния указывают на степень статистического различия между текстами и дают меру расстояния между ними. Хотя колебания значения векторного расстояния для медиатекстов неизвестны, при сравнении идентичных текстов расстояние может быть равно 0. Это означает, что тексты различаются, если векторное расстояние больше 0. Кроме того, чем больше числовое значение векторного расстояния, тем больше лингвистические и статистические различия между текстами. Сравнение евклидовых расстояний представлено в табличной форме. В столбце 4 Fig. 4 числовые значения представляют евклидовы расстояния. На Fig. 4 показано сравнение анализируемого текста Oleksii Honcharenko (Текст 1) с тремя другими текстами того же автора: строка 1 для Текста 2 (расстояние 0,44); строка 2 для Текста 3 (расстояние 0,56); строка 3 для Текста 4 (расстояние 0,77). Эмпирические данные показывают, что сходство текстов одного автора остаётся в пределах 1, тогда как тексты других авторов (строки 4–10) демонстрируют расстояния больше 1.
FIGURE 4. Систематизация евклидова расстояния между текстами
Сравнение статистических параметров текстов убеждает нас в том, что предложенная методология атрибуции выявляет стилометрическую модель текстов на украинском языке. Эта модель также может использоваться для определения авторства текста. Мы подтвердим это визуальным представлением атрибуции 7 текстов трёх разных авторов по 15 статистическим параметрам с использованием метода Uniform Manifold Approximation and Projection (UMAP) (McInnes et al. 2020), алгоритм которого также реализован в системе TextAttributor. Это
236
Acta Linguistica Lithuanica XCI
Page 15
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
метод позволяет уменьшить размерность пространства признаков, спроецировав 15-мерное пространство на плоскость. На Fig. 5 точки различной формы (P1–P7 для Автора 1, F1–F7 для Автора 2, M1–M7 для Автора 3) соответствуют 7 случайно выбранным текстам разных авторов.
Как видно, после уменьшения размерности отображения точек текстов трёх авторов можно визуально разделить на отдельные области. Этот пример подтверждает, что параметры, определённые TextAttributor, важны для описания стилистических особенностей текстов и определения авторства текста (даже в сокращённой форме).
FIGURE 5: Графическое представление атрибуции текста с использованием метода UMAP
4.3. Индексация негативной тональности текста
Разрабатывая систему статистических параметров для определения стиля и авторства текста, мы осознали, что токсичность текста может служить индексом атрибуции. Поэтому мы создали отдельный модуль для автоматического определения индекса токсичности в TextAttributor.
Сегодня информационная составляющая стала особенно важной в условиях гибридной войны. Поэтому материалом нашего исследования послужил исследовательский корпус онлайн-медиатекстов политического дискурса объёмом 10 миллионов слов. Мы используем термин «токсичный текст» в широком смысле. Для таких текстов характерны преследование, угрозы, непристойность, кибербуллинг, троллинг и тексты, содержащие ненависть на основе идентичности, а также эмотиконы; это явления и объекты, вызывающие у человека негативные эмоции (например, война, воздушная тревога, коррупция).
Целью проекта было определить потенциал реализации негативной тональности в украинских текстах и разработать автоматизированную систему выявления токсичного содержания. Эта задача включала две последовательные подзадачи: во-первых, разработку системы лингвистического исследования токсичных текстов с определением индексов токсичности посредством словарного анализа и методов на основе правил; во-вторых, создание обучающего набора данных для машинного обучения и разработку нейронной сети для прогнозирования индексов токсичности текста.
Рассмотрим выполнение первой задачи. Она включала создание лексикографической базы данных, содержащей три отдельных словаря:
1) Эмотиогенный словарь: собрание 5000 слов (согласно значениям лексико-семантических вариантов) с оттенками негативной тональности, оцениваемыми по шкале −2. Примеры включают аморальный, безнаказанность, взяточничество и украсть;
2) Словарь языка вражды: содержит 3000 слов, включая названия лиц (1620), непристойные термины (613) и оскорбительную лексику (787). Примеры включают западник (западенець: уничижительное название людей из западных регионов Украины) и спекулянт;
3) Токсичные фразы: собрание из 1500 идиоматических выражений, передающих негативные эмоции. Примеры включают кривляется как обезьяна, целует свою задницу и открывает рот.
Каждая единица этих списков была аннотирована семантическими признаками: Словарь языка вражды имеет 18 признаков, а список токсичных фраз — 26. Например, слова в Словаре языка вражды были снабжены такими характеристиками, как ‘s’ для сексизма, ‘r’ для расизма и ‘e’ для эйджизма. Эта лексикографическая база данных, представляющая собой многопараметрическую систему, присваивает семантические признаки единицам (словам или фразам), что в сочетании с частотными данными анализируемого текста позволяет проводить анализ токсичности.
Индекс токсичности текста вычисляется по формуле:
Itox = (e + |K| (m + t)) / n * 10,
Здесь n — объём текста; e — количество эмоциональных слов; m — количество слов языка вражды; t — количество токсичных фраз; K — коэффициент, равный −2; он усиливает влияние слов языка вражды и токсичных фраз, которые по шкале из
238
Acta Linguistica Lithuanica XCI
Page 17
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
пяти знаков (+2, +1, 0, −1, −2) соответствуют −2. Значения индекса варьируются от 0 до +1.
Например, индекс токсичности текста «Люди с красной ручкой (Люди з червоною ручкою)» (12 предложений, 129 слов) равен 1,01, что указывает на его высокую токсичность, поскольку пороговое значение для таких коротких текстов находится в диапазоне от 0,1 до 0,7. Одновременно система генерирует результаты автоматического лингвистического исследования токсичности текста (см. Fig. 6), включающие: 1) статистическую карту семантических классов негативной лексики согласно классификационным маркерам лексикографических списков (эмотиогены — 5, вульгаризмы — 2, сексизм — 2); 2) текст с конкретными словами негативной тональности, вербализующими категории статистической карты. Рассмотрим отрывок анализируемого реального текста (Fig. 6):
те люди, которые ходят с красной ручкой и исправляют ошибки в чужих постах: кто вы вообще такие? Вы хоть представляете, как достали вы? Я специально изучаю ваши профили, мне интересно, в каком мире вы существуете. Этот мир пугает меня очень сильно. Я искренне надеюсь, что в реальной жизни мы ни при каких обстоятельствах не пересечёмся. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося ні за яких обставин).
Здесь система автоматически выделяет жирным шрифтом следующие слова с негативным компонентом: ошибки (помилки), чужих (чужих), достали (бісите), пугает (лякає).
FIGURE 6: Фрагмент автоматического лингвистического исследования токсичности текста
5. ПОДХОДЫ МАШИННОГО ОБУЧЕНИЯ: ЭКСПЕРИМЕНТЫ, РЕЗУЛЬТАТЫ И ОБСУЖДЕНИЕ
Сосредоточимся на втором режиме работы системы TextAttributor, посвящённом методам машинного обучения. На входе для обучения модели имеются текстовые корпуса, размеченные в соответствии с целью каждой подзадачи: (a) текстовая информация для выявления токсичности и (b) идентификация авторства. Каждый корпус разделён на обучающую и контрольную выборки, а для достаточно большого корпуса — также на валидационную выборку. Параметры выбранной модели решения задачи оцениваются на обучающей выборке. Гиперпараметры модели настраиваются по валидационной выборке. Итоговые показатели эффективности модели измеряются на контрольной выборке с учётом доступности вычислительных ресурсов, необходимых для работоспособности модели. Корпус для каждой подзадачи разрабатывался параллельно с компонентом машинного обучения TextAttributor, поэтому текущие модели обучались на относительно небольших данных, включающих короткие интернет-тексты украинскоязычных блогов, комментариев, статей и т. д.
5.1. Выявление токсичности
В результате серии экспериментальных исследований была выбрана вычислительно эффективная архитектура на основе метода fastText и его инструментов (Joulin et al. 2016). Этот метод создаёт векторные представления слов и оценивает распределение вероятностей документов по заранее заданным классам. Слова представлены в векторной форме на основе автоматического разбиения слов на части (подслова), что имитирует открытость словаря. Представление подслов важно, поскольку украинский язык характеризуется высокой флективностью, а также необходимо охватить множество невстречавшихся ранее слов и слов с орфографическими ошибками. Эффективность использованного подхода также определяется техническими условиями работы системы и доступными текстовыми ресурсами для обучения модели.
Подготовленный корпус примерно из 12 000 текстовых документов использовался для бинарной классификации с целью выявления токсичного содержания. Наилучший результат по обобщённой метрике (F1 = 79,4%) был достигнут при следующих настройках гиперпараметров: размерность вектора слова — 56, начальная скорость обучения — 0,15, 500 эпох обучения, лексический контекст представлен биграммами, длина подслов — от 2 до 5 символов, порог принятия решения — 0,4. Кроме того, модель продемонстрировала чувствительность 85% при точности около 70%.
240
Acta Linguistica Lithuanica XCI
Page 19
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
5.2. Идентификация авторства
Экспериментальное исследование моделей идентификации авторства текста проводилось с использованием части корпуса общедоступных общественно-политических текстов, в которых можно установить лицо, являющееся автором документа. Всего было отобрано 702 текста четырёх авторов, опубликовавших наибольшее количество документов объёмом от 60 до 1000 символов. Наибольшее количество публикаций одного автора составляет 304 (115 тысяч символов), наименьшее — 109 (49 тысяч символов). Для тестирования случайным образом отбирались по 25 текстов каждого выбранного автора. Остальные документы составили обучающую выборку.
Наилучший результат по обобщённой метрике (F1 = 81%) был достигнут при следующих значениях гиперпараметров: размерность пространства векторных представлений слов — 50, начальная скорость обучения — 0,1, 50 эпох обучения, лексический контекст представлен биграммами, длина подслов — от 2 до 5 символов, порог принятия решения — 0,5. Примечательно, что для некоторых конфигураций модели чувствительность к автору с наибольшим количеством документов в наборе данных достигала 100%, а точность превышала 90%. Эти результаты демонстрируют возможность разработки эффективной системы, способной точно охватывать тексты авторов, достаточно представленных в обучающей выборке.
Обученные модели нейронных сетей были интегрированы в систему TextAttributor по архитектуре «клиент–сервер», в которой представлены результаты двух задач: (a) определение токсичности и (b) выявление авторства. Результат работы системы на тексте «Закона Украины о высшем образовании»: индекс токсичности (оценка в форме вероятности: насколько токсичен текст) — 0,04; сходство с авторами (оценки в форме вероятности авторства для известных системе авторов): 0,49 для I. Farion, 0,30 для Oleksii Honcharenko и 0,22 для Mariana Bezugla.
6. ВЫВОДЫ
В настоящее время система TextAttributor проходит этапы тестирования для решения задач атрибуции и определения токсичности украинскоязычных текстов. Эта система удобна и эффективна для различных технологических исследований. За 5 месяцев веб-приложение TextAttributor автоматически проанализировало 784 украинских текста 226 пользователей.
Наши результаты демонстрируют эффективность метода, который предусматривает квантификацию вербальных элементов на основе формальных грамматических и семантических параметров, особенно в отношении негативной эмоциональности. Это достигается сочетанием словарного подхода и подхода на основе правил, дополненных машинным обучением
методами. Экспериментальное исследование машинного обучения для выявления токсичности и идентификации авторства по тексту позволило получить результаты, сопоставимые с результатами экспериментов с аналогичными характеристиками моделей (количеством документов и авторов), представленными для других языков. Модели подслов продемонстрировали повышенную устойчивость к открытости лексикона и текстовым ошибкам.
Проведённое исследование открывает путь к решению таких задач для украинского языка, как выявление и мониторинг токсичного содержания, языка вражды и дезинформации, верификация авторства и деобфускация, профилирование авторов и диаризация, психолингвистическое профилирование, моделирование стиля и отслеживание источника фальшивого контента и т. д. Разработанная схема анализа и атрибуции текста также может применяться к другим языкам.
В перспективе мы планируем интегрировать наш инструмент автоматической атрибуции текста и выявления токсичности с семантическим, синтаксическим, психолингвистическим и социолингвистическим анализом. Эта интеграция даст нам более глубокое понимание воздействия на читателя. Используя семантический анализ лексической таксономии, мы стремимся выявлять нарративные элементы, присущие тексту, тем самым повышая надёжность атрибуции текста в процедурах идентификации авторства. Кроме того, мы планируем расширить наши текстовые корпуса и использовать многоязычные большие языковые модели для дальнейшего расширения возможностей системы, а также реализовать инструменты статистического сравнения текстов для всех стилей украинского языка.
Благодарности
Система создана в рамках проекта, поддержанного Посольством Великобритании в Kyiv и выполненного командой преподавателей и исследователей кафедры украинского языка и прикладной лингвистики Национального университета Kyiv имени Taras Shevchenko.
Мы хотели бы выразить искреннюю признательность Посольству Великобритании в Kyiv за финансовую поддержку этого исследовательского проекта. Мы благодарны Svitlana Yavorska и Iryna Bezkorovayna за руководство и помощь на протяжении всего проекта. Особая благодарность Kostiantyn Goncharenko за организационную и документальную поддержку проекта. Кроме того, мы благодарны студентам образовательной программы «Прикладная (компьютерная) лингвистика и английский язык» Национального университета Kyiv имени Taras Shevchenko. Они внесли свой вклад временем, знаниями и усилиями в формирование корпуса украинских токсичных текстов. Мы благодарны Oksana Tolochko, выпускнице нашей программы бакалавриата, за создание тонального словаря украинского языка, который мы использовали для составления лексикографического списка негативных эмотиконов. Кроме того, мы глубоко признательны Mykola Kostikov за усилия, приложенные к сбору данных. Мы хотели бы выразить искреннюю благодарность всем членам исследовательского сообщества, которые внесли вклад в это исследование своими советами и консультациями.
242
Acta Linguistica Lithuanica XCI
Page 21
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
REFERENCES
ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/.
Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273.
Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003.
Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038.
Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv].
Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267.
Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146.
Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100.
Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka.
Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265.
Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of
sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01.
Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066.
Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036.
Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308.
Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935.
Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453.
Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80.
Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296.
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264.
Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565.
Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf.
KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx.
LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app.
Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500.
Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041.
McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426.
Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt.
Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031.
Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047.
Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15.
Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas)
SANTRAUKA
Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą.
246
Acta Linguistica Lithuanica XCI
Page 25
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Įteikta 2024 m. lapkričio 25 d.
NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine [email protected]
VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine [email protected]