NATALIIA DARCHUK
جامعة تاراس شيفتشينكو الوطنية في كييف
معرّف ORCID: orcid.org/0000-0001-8932-9301
مجالات البحث: اللسانيات الحاسوبية، ولسانيات المدونات، واللسانيات الكمية، ونحو اللغة الأوكرانية ودلالاتها.
OKSANA ZUBAN
جامعة تاراس شيفتشينكو الوطنية في كييف
معرّف ORCID: orcid.org/0000-0002-2644-3892
مجالات البحث: اللسانيات الحاسوبية، والخبرة اللغوية، واللسانيات الكمية، ونحو اللغة الأوكرانية ودلالاتها.
VALENTYNA ROBEIKO
جامعة تاراس شيفتشينكو الوطنية في كييف
معرّف ORCID: orcid.org/0000-0003-2266-7650
مجالات البحث: تحليل الكلام، والتعرّف عليه وتوليده، وعلم الأصوات، ومعالجة اللغة الطبيعية.
YULIIA TSYHVINTSEVA
جامعة تاراس شيفتشينكو الوطنية في كييف، ومعهد اللغة الأوكرانية التابع للأكاديمية الوطنية للعلوم في أوكرانيا
معرّف ORCID: orcid.org/0000-0002-9684-3840
مجالات البحث: علم الكلمات الأوكرانية الحديث، وعلم المفردات، وصناعة المعاجم.
VICTOR SOROKIN
جامعة تاراس شيفتشينكو الوطنية في كييف
معرّف ORCID: orcid.org/0000-0002-3637-0535
مجالات البحث: التحليل التركيبي الآلي، والتحليل الدلالي الآلي، ومعالجة اللغة الطبيعية.
Straipsniai / Articles
223
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
MYKOLA SAZHOK
معهد تكنولوجيات المعلومات والنظم التابع للأكاديمية الوطنية للعلوم في أوكرانيا
معرّف ORCID: orcid.org/0000-0003-1169-6851
مجالات البحث: تحليل الكلام، والتعرّف عليه وتوليده، ومعالجة اللغة الطبيعية.
DOI: doi.org/10.35321/all91-09
نظام التحليل الأسلوبي الآلي للنصوص الإعلامية الأوكرانية TextAttributor 1.0 (التقنيات، والوسائل، والوظائف)
نظام التحليل الأسلوبي الآلي للنصوص الإعلامية الأوكرانية «TextAttributor 1.0» (الأساليب، والوسائل، والوظائف)
الملخص
تعرض هذه الورقة بنية نظام TextAttributor الآلي، وخوارزمياته، وتنفيذه، ونتائجه التجريبية، وهو نظام طوّره مؤلفو الورقة لتمثيل النصوص الأوكرانية إحصائياً باستخدام مجموعة متعددة المعايير من المؤشرات الإحصائية التي تميّز أسلوب نص المؤلف ويمكن تطبيقها في مهام إسناد التأليف. واستناداً إلى الموارد اللغوية والبرمجيات المُنشأة، يولّد النظام تحليلاً لغوياً قائماً على المؤشرات الإحصائية المحسوبة، ويجري دراسة مقارنة لنصين. ويُعدّ مؤشر سمّية النص، المحسوب من خلال منهج التعرف اللفظي إلى المشاعر السامة، معياراً إضافياً للفهرسة الإحصائية. وتُعالَج مهمتا الكشف عن التأليف والسمّية باستخدام طريقتين: الحسابات الإحصائية القائمة على القاموس والقواعد، والتعلّم الآلي. وتُفحَص بالتفصيل النتائج الحالية المنفّذة في النسخة التجريبية من TextAttributor.
الكلمات المفتاحية: اللسانيات الحاسوبية، اللغة الأوكرانية، تحليل المشاعر، إسناد التأليف، الأسلوبية الإحصائية، تصنيف النصوص.
224
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
الملخص
تقدم هذه المقالة بنية نظام TextAttributor الآلي الذي أنشأه مؤلفو المقالة للمعلمة الإحصائية لنصوص اللغة الأوكرانية باستخدام مجموعة متعددة المعايير من المؤشرات الإحصائية التي تصف أسلوب نص المؤلف وتُطبَّق على مهام إسناد التأليف، كما تقدم خوارزمياته وتنفيذه ونتائجه التجريبية. واستناداً إلى الموارد اللغوية والبرمجيات المُنشأة، يولّد النظام تحليلاً لغوياً وفقاً للمؤشرات الإحصائية المحسوبة، ويجري تحليلاً مقارناً لنصين. ويتمثل معيار إضافي للفهرسة الإحصائية في مؤشر النص المثير للمشاعر السلبية، المحسوب بتطبيق منهج التعرف اللفظي إلى المشاعر السلبية. وتُحلّ مهمتا تحديد التأليف والعدائية باستخدام طريقتين: الحسابات الإحصائية القائمة على القاموس والقواعد، والتعلم الآلي. وقد دُرست بالتفصيل النتائج الحالية المتحصّل عليها باستخدام النسخة التجريبية من TextAttributor.
الكلمات الأساسية: اللسانيات الحاسوبية، اللغة الأوكرانية، تحليل المشاعر، إسناد التأليف، الأسلوبية الإحصائية، تصنيف النصوص.
1. المقدمة
اكتسبت البحوث النصية أهمية علمية جديدة مع تقدّم أساليب اللسانيات الحاسوبية، التي أسهمت في نشوء اتجاه جديد يمكن اعتباره علم النص الرقمي. وفي إطار هذا التخصص الناشئ، نتصور علم النص الرقمي بوصفه توظيفاً لتقنيات لسانيات المدونات المؤتمتة مقترنةً بنماذج رياضية للتحليل الكمي للنصوص. واستناداً إلى المهام الراهنة لعلم اللغة الكمي الحديث ومعالجة اللغة الطبيعية، طوّر فريقنا نظاماً للتحليل اللغوي-الإحصائي الآلي للنصوص الإعلامية، ونُفّذ هذا النظام في صورة تطبيق ويب يحمل اسم TextAttributor (TextAttributor 1.0 2024). ويعمل النظام في أربع مهام: 1) المعلمة الإحصائية للنص؛ 2) الأسلوبية الإحصائية: تحديد السمات اللغوية-الإحصائية للهُوِيّة اللغوية؛ 3) الإسناد: تحديد درجة التشابه بين النصوص؛ و4) تحليل المشاعر: تحديد معجم المشاعر السلبية في النصوص. وإضافةً إلى ذلك، يُنشئ النظام آلياً استنتاجين لغويين خبيرين استناداً إلى نتائج المهمتين الثانية والرابعة. وتتطلب تعددية وظائف نظام TextAttributor أن يتعرّف المستخدمون إلى مبادئ تشغيله. وتهدف هذه المقالة إلى تعريف المجتمع الفيلولوجي الأكاديمي والتعليمي بمنهجية إنشاء النظام، وبنيته، ونتائج تشغيله، لتوفير فهم واضح لوظائفه وقدراته التحليلية، وهي أمور ذات صلة خاصة. وتكتسب هذه المقاربة أهمية خاصة لتحليل كميات كبيرة من الاتصالات عبر الإنترنت و
Straipsniai / Articles
225
NATALIIA DARCHUK، OKSANA ZUBAN، VALENTYNA RОBEIKO، YULIIA TSYHVINTSEVA، VICTOR SOROKIN، MYKOLA SAZHOK
تعزيز استراتيجيات الدفاع عن المعلومات أثناء الحرب الروسية–الأوكرانية المستمرة. نشأ مفهوم تطوير نظام آلي لإسناد النصوص باللغة الأوكرانية من تحليل البحوث في مجال لسانيات المدونات الأوكرانية (Darčuk 2013) والدراسات الإحصائية لأسلوب المؤلف (Darčuk et al. 2021؛ Darchuk, Sorokin 2022؛ Zuban 2019) التي أُجريت باستخدام أدوات مدونة اللغة الأوكرانية (KUM) من قبل مؤلفي المشروع.
أثناء تطوير نظام TextAttributor، استُخدمت الأساليب التالية: التحليل المكوّني، والتحليل التوزيعي، وتحليل المحتوى. وقد وظّف تحليل المحتوى، وهو أسلوب كمي وكيفي لاستخراج المعلومات من النص، معالجة اللغة الطبيعية والتقنيات الإحصائية. كما طُبّق التكميم وتحليل المشاعر. ويحدّد تحليل المشاعر آلياً نبرة النص استناداً إلى كل من التلوين العاطفي وتقييم المؤلف للأحداث أو الأشياء، وقد تحقق ذلك باستخدام الحسابات الإحصائية القائمة على القاموس والقواعد.
وبالإضافة إلى ذلك، أُدرجت أساليب التعلّم الآلي، ومنها التعلّم العميق. ويتيح التركيب الإحصائي للنص، المفهوم بوصفه نموذجه الكمي، تحديد أسلوبه الوظيفي وتأليفه وفترة إنشائه. وفي هذا العمل، استُخلصت مكوّنات التركيب الإحصائي بتحليل السمات الإحصائية المعجمية والنحوية باستخدام تقنيات الفهرسة ومقاييس المسافة الإقليدية. والمسافة الإقليدية، التي تقيس المسافة بين نقطتين في فضاء إقليدي ذي n بُعداً، هي إحدى أكثر المقاييس استخداماً في اللسانيات الإحصائية للتحليل العنقودي في الأسلوبية الإحصائية وإسناد التأليف.
تتمثل جدة النتائج في أول تطبيق في اللسانيات الحاسوبية لنموذج أسلوبي آلي صرفي-تركيبي-دلالي لتحليل النصوص، يستند إلى 15 مؤشراً إحصائياً تُمعْلِم أساساً البنية الصرفية للنص، وكذلك بنيته التركيبية والدلالية. والنموذج الأسلوبي هو مجموعة من المعلمات الإحصائية للنص (المعجمية، والصرفية، والتركيبية، وغيرها)، يُجرى على أساسها تحليل مقارن لهذا النص مع النموذج الأسلوبي للأسلوب الوظيفي. ونرى أنه يمكن، باستخدام الأساليب الساكنة في بناء نموذج أسلوبي، الحصول على نظام صارم وحتمي ومؤسس علمياً للسمات المشتركة والمميزة في الأساليب والأنواع، وغير ذلك. ولأول مرة، يُدخل النموذج الأسلوبي معلمة مؤشر السمّية، التي تميّز النصوص الإعلامية أثناء الحرب الروسية–الأوكرانية. ولا يُنفَّذ هذا النموذج في وظيفة المعلمة الإحصائية للنصوص، وهي وظيفة نموذجية للأنظمة من هذا النوع فحسب، بل أيضاً في وظيفة مقارنة النص المُحلَّل بالأسلوب الإعلامي للغة الأوكرانية، وفي مهام الأسلوبية الإحصائية والإسناد التي تشمل نصين أو أكثر. وتمتد الأهمية النظرية إلى التحقق من طريقتين لتحديد سمّية النص و
226
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
التأليف باللغة الأوكرانية: 1) من خلال المقاربات القائمة على القاموس والقواعد، و2) عبر التعلّم الآلي، بما في ذلك التعلّم العميق.
2. الأعمال ذات الصلة
في اللسانيات الأوكرانية الحديثة، أُجريت دراسات لغوية-إحصائية واسعة على اللهجات الفردية للكتّاب والشعراء الأوكرانيين، ومنهم Taras Shevchenko وLesya Ukrainka وVasyl Stus (Zuban’ 2019)، وIvan Franko (Buk 2021)، وRoman Ivanychuk (Lototska 2022)، وValerii Shevchuk (Volos, Levchenko 2023)، وMariia Matios وYurii Andrukhovych وOksana Zabuzhko (Karasov, Levchenko 2024)، وIvan Drach وMykola Vingranovsky (Darchuk et al. 2024)، وLina Kostenko (Zuban’ 2019; Darchuk et al. 2024)، وغيرهم. أُجريت هذه الدراسات على عينات نصية تمثيلية (نصوص طويلة)، باستخدام معلمة إحصائية واحدة أو بضع معلمات إحصائية (لا يزيد عددها غالبًا على خمس)، ومن دون تطبيق المقارنة الأسلوبية في كثير من الأحيان. وعلاوة على ذلك، وبسبب الطبيعة الشاقة لإجراء التجارب اللغوية-الإحصائية، أهملت اللسانيات الأوكرانية إلى حد كبير التمَعْيَر الإحصائي الشامل، ومقارنة النصوص المُحلَّلة بالمعلمات الإحصائية المعيارية للأساليب الوظيفية، وتحديد درجة تشابه النصوص، فضلًا عن التحليل الأسلوبي والإسنادي للنصوص القصيرة. إن استخدام نظام TextAttributor في البحوث اللغوية-الإحصائية، بهدف تنفيذ هذه المهام تلقائيًا، لن يوفّر الخصائص التواترية للظواهر اللغوية فحسب، بل سيتيح أيضًا إجراء تحليل أسلوبي فعّال يُفضي إلى رأي خبير.
يتمتع نظام TextAttributor بمزايا مقارنةً بنظرائه في العلم العالمي. كما تركّز معظم الأنظمة والنماذج الموجودة على استخدام وحدات لغوية-إحصائية فردية لتحديد معلمة نصية واحدة أو بضع معلمات، معظمها شكلية (n-grams، والكلمات الأكثر تكراراً، والحروف) (Eder 2015؛ Canhasi et al. 2022؛ LIWC-22؛ Khomytska et al. 2023؛ ALIAS). وعلى النقيض من ذلك، يقدّم TextAttributor 1.0 مقاربة شاملة تشمل التحليل الإحصائي التفاعلي للبنية المعجمية والصرفية والتركيبية والدلالية للنص في الزمن الحقيقي عبر 15 معلمة.
يُطوَّر إسناد النصوص بنشاط في الدراسات النصية الأجنبية، ولا سيما اختبار فعالية طريقة Burrows (Burrows 2002؛ Argamon 2007؛ Eder, Rybicki 2013؛ Burrows et al. 2014) في دراسات عديدة على أحجام كبيرة من البيانات النصية ذات الأساليب المتنوعة، مثل: النثر الإنجليزي في أوائل القرن العشرين (Hoover 2004)؛ والشعر الإنجليزي الحديث (Hoover 2005)؛ والأعمال الشعرية باللاتينية (Rybicki, Eder 2011)؛ والأعمال النثرية من الأنواع الكبرى بالإنجليزية والفرنسية والإيطالية والألمانية والبولندية والمجرية، وكذلك باللاتينية والعربية (Rybicki, Eder 2011؛ Evert et al. 2015؛ Jannidis et al. 2015)؛ والنصوص السياسية بالإنجليزية، بما في ذلك
Straipsniai / Articles
227
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
إسناد خطب الرؤساء الأمريكيين (Savoy 2015). وثمة طريقة أخرى للتحليل اللغوي الآلي تُسمّى «الاستقصاء اللغوي وعدّ الكلمات» (LIWC)، وقد نُفّذت في صورة تطبيق تجاري وكُيّفت لعدة لغات (Meier et al. 2019؛ LIWC-22).
في السنوات الأخيرة، استخدمت مهام إسناد النصوص الآلي في الغالب إما أساليب أسلوبية إحصائية قائمة على القواعد أو أساليب التعلّم العميق (Eder 2015؛ Canhasi et al. 2022). وقد طُبّقت كلتا الطريقتين في نظام TextAttributor، وهما تعملان بفعالية لكنهما تنتجان نتائج مختلفة: 1) تتيح الطريقة القائمة على القواعد أتمتة توليد الاستنتاجات اللغوية حول الهُوِيّة اللغوية وسمّية النص؛ 2) تحدد طريقة التعلّم الآلي درجة السمّية وتشابه النصوص فقط، ويمكن استخدامها في مهام التصنيف لرصد المحتوى النصي.
تستند أساليب التعلّم الآلي الحديثة لتحليل المشاعر وتحديد مؤلفي النصوص إلى مقاربات إحصائية (TF-IDF، والتخصيص الكامن لديريشليه) وتقنيات التعلّم العميق ذات البنى المتنوعة (CNN، وLSTM، وBERT) بالاقتران مع الأساليب الأسلوبية الإحصائية (Gupta et al. 2019؛ Canhasi et al. 2022؛ Bonetti et al. 2023). وتعتمد النتائج المبلّغ عنها اعتماداً شديداً على عدد الفئات (أنواع السمّية، والمؤلفون)، والنوع الأدبي، وطول النص، والأهم من ذلك، حجم مدونة النصوص المشروحة على نحو صحيح والمستخدمة في إجراء التدريب. ومن ثم، تتجاوز معدلات الدقة العالية في مهمتي كشف السمّية وخطاب الكراهية 90% باستخدام مدونة تضم عشرات الآلاف من الوثائق (Alkomah, Ma 2022). فعلى سبيل المثال، تتحقق دقة تزيد على 90% في إسناد التأليف للأعمال الأدبية باللغة الإنجليزية عبر 1000 مؤلف، باستخدام مدونة تضم 6000 وثيقة لـ15 مؤلفاً. وفي المقابل، تبلغ الدقة المبلّغ عنها نحو 70% في المدونات التي تحتوي على أقل من 1500 وثيقة (Khan et al. 2023). أما بالنسبة إلى اللغة الأوكرانية، فما زال تحديد مؤلفي النصوص وتحليل المشاعر/السمّية من المسائل قليلة الدراسة (Lupei et al. 2020)، فضلاً عن أن هذه الأنظمة لا تنتج خبرة لغوية ولا يمكن استخدامها أدواتٍ للبحث اللغوي.
3. الخصائص العامة لتشغيل نظام TextAttributor
أثناء تطوير TextAttributor، أُنجزت المهام التالية: 1) اللسانيات النظرية: وُضعت منهجية للتحليلات الصرفية والإحصائية والأسلوبية الإحصائية والإسنادية وتحليل المشاعر بصيغة رسمية؛ 2) هندسة البرمجيات: طُوّرت بنية قواعد البيانات اللغوية والبرمجيات اللازمة للتحليلات الآلية المذكورة أعلاه؛ 3) اللسانيات التجريبية: اختُبر النظام على نصوص إعلامية أوكرانية، و
228
Acta Linguistica Lithuanica XCI
نظام التحليل الأسلوبي الآلي للنصوص الإعلامية الأوكرانية TextAttributor 1.0 (التقنيات، والوسائل، والوظائف)
نُفّذت وحدة تحليلية للفحص الأسلوبي الإحصائي الآلي. ويعالج النظام اللغوي الآلي، المنفّذ كتطبيق ويب، النصوص ذات الأسلوب الإعلامي التي يُدخلها المستخدم، مولّداً قيماً عددية للمعلمات الإحصائية التي تميّز خصائص النص. ويتبع النظام تسلسلاً منظماً للتشغيل:
1. تقطيع النص إلى وحدات: تقسيم النص إلى جمل وكلمات بغرض التحليل.
2. الوسم الصرفي: إسناد وسوم إلى الكلمات استناداً إلى صيغها النحوية.
3. التحليل السياقي: تحديث الوسوم الصرفية بما يتوافق مع السياق.
4. التحليل التركيبي: إقامة علاقات ثنائية بين الكلمات في الجمل لفهم بنيتها النحوية.
5. إقامة العلاقات التركيبية: تحديد الروابط التركيبية استناداً إلى قواعد محددة مسبقاً.
6. مطابقة المفردات ذات الشحنة الانفعالية السلبية: تحديد الكلمات من مجموعة محددة مسبقاً من المفردات السلبية.
7. تقييم المعلمات الإحصائية: تقييم المعلمات الإحصائية للنص المُدخل باستخدام معاجم تكرارية مُجمَّعة آلياً.
8. تصوير النتائج: عرض نتائج المعلمة الإحصائية بيانياً، مع القيم التجريبية وفواصل الثقة.
9. مقارنة النتائج: تصوير نتائج المعلمة الإحصائية لنصين ذوي أسلوب إعلامي، بما ييسّر المقارنة.
10. تقييم المسافة الإقليدية: قياس مقدار التباين بين نصين ذوي أسلوب إعلامي.
11. توليد رأي خبير: توليد رأيين خبيرين: أحدهما حول إسناد النص، والآخر حول سمّية النص من خلال الفحص اللغوي.
12. كشف السمّية وتحديد المؤلف: توظيف تقنيات التعلّم الآلي، ولا سيما نماذج الشبكات العصبية، لكشف السمّية وتحديد المؤلفين.
تُنظَّم نتائج النظام في الأقسام التالية: مجموعة مؤشرات إسناد النص، ورأي خبير في إسناد النص، ومقارنة إسناد النص، والخبرة اللغوية لسمّية النص، وآراء الشبكة العصبية.
في مجموعة مؤشرات إسناد النص (الشكل 1)، تُنظَّم المعلمات الإحصائية استناداً إلى النص المُدخل: يعرض العمود 1 عنوان المؤشر، ويعرض العمود 2 القيمة العددية التجريبية، ويوفّر العمود 3 مرجعاً بصرياً من خلال مقارنة القيمة التجريبية للمؤشر بفاصل الثقة
Straipsniai / Articles
229
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
الحدود (الدنيا والعليا) المستخلصة من نصوص الأسلوب الإعلامي الأوكراني. وتمثَّل القيمة العددية التجريبية على المقياس بمثلث مقلوب مملوء.
الشكل 1: جزء من نتيجة إسناد النص
في رأي خبير في إسناد النص (الشكل 2)، نعرض استنتاجات بشأن السمات اللغوية-الإحصائية النموذجية أو الفردية المستخلصة من النص المُحلَّل لكل مؤشر مُقدَّر. وتُشتق هذه الاستنتاجات من الإجابات عن السؤال التالي: هل تقع القيمة العددية للمؤشر ضمن فاصل الثقة لأسلوب اللغة الأوكرانية الإعلامي؟ واستناداً إلى مقارنة القيم العددية بقيم الحدود لفاصل الثقة، يولّد النظام ثلاث إجابات ممكنة (سمات نموذجية للأسلوب الإعلامي، وسمات للهُوِيّة اللغوية أدنى من الأسلوب الإعلامي المعتاد، وسمات للهُوِيّة اللغوية أعلى من الأسلوب الإعلامي المعتاد).
في مقارنة إسناد النص (الشكل 4، القسم الفرعي 4.2)، عند اختيار «حساب المسافة المتجهية»، تُحدَّث البيانات الجدولية فوراً على النحو الآتي: يسرد العمود 1 النصوص التي أدخلها المستخدم إلى جانب النص الذي جرى تحليله سابقاً؛ ويعرض العمود 2 عدد الجمل في كل نص؛ ويبيّن العمود 3 عدد الكلمات؛ ويعرض العمود 4 المسافة الإقليدية بين النص المُحلَّل وكل نص في الجدول؛ ويبدأ العمود 5، الموسوم «مقارنة»، مقارنةً آلية للمؤشرات الإحصائية بين النص المُحلَّل والنص المحدد. وعند تفعيل عنصر «مقارنة» المناظر، تُقدَّم معلومات شاملة عن المقارنة الإحصائية بين نصين في مجموعة «مؤشرات إسناد النص» (الشكل 3).
230
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
الشكل 2: مثال على رأي خبير مُولَّد
في الخبرة اللغوية لسمّية النص (القسم الفرعي 4.3)، يُقدَّم تفسير معجمي-دلالي لمؤشر السمّية المحسوب (الشكل 6).
في آراء الشبكة العصبية نعرض مخرجات نموذجنا للتعلّم العميق، الذي يكمّم سمّية النص على مقياس من 0 (غير سام) إلى 1 (سمّية مرتفعة). ونقيّم أيضاً تشابه النص مع مؤلفين معروفين، بقيم تتراوح من 0 (لا تشابه) إلى 1 (تشابه مرتفع)، استناداً إلى المؤلفين الذين دُرّب عليهم النموذج. ولا تُعرض النتائج إلا للاختبارات التي يتجاوز فيها مقياس التشابه 0.1. ويعمل نظامنا الحالي في الوضع التجريبي، مستخدماً مدونة محدودة من نصوص المؤلفين لقياس التشابه مع النص الذي يدخله المستخدم.
4. إسناد النصوص باللغة الأوكرانية: التجارب والنتائج والمناقشات
4.1. مؤشرات المعلمة الإحصائية
يحل النموذج الأسلوبي الإحصائي المطوَّر مهمتين: 1) تحديد السمات الفردية لأسلوب المؤلف (الأسلوبية الإحصائية)؛ 2) تقييم التشابه بين نصين استناداً إلى المعلمات اللغوية والإحصائية (الإسناد).
Straipsniai / Articles
231
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
تُستخدم 19 معلمة لتحليل النص الذي يُدخله المستخدم إحصائياً (انظر الشكل 1 للاطلاع على مجموعة مؤشرات إسناد النص). وتشمل المعلمات الأربع الأولى بيانات كمية أساسية: عدد الكلمات، والكلمات غير المعالجة، وحجم المعجم، وعدد الجمل. ولا يشمل عدد الكلمات المفردات التي لا يعالجها النظام، مثل اللهجات، والروسية الموسكوفية، والألفاظ العرضية، وغير ذلك. أما المعلمات الـ15 المتبقية فتتكون من مؤشرات قابلة للحساب تنتج كميات قياسية.
بالنسبة إلى التحليل الأسلوبي الإحصائي، سنختبر الفرضية 1. وتنص هذه الفرضية على أنه يمكن، من خلال تحليل البيانات التجريبية التي تشمل المعلمات الإحصائية الواقعة داخل فاصل الثقة لأسلوب اللغة الأوكرانية الإعلامي وخارجه، تمييز السمات الفريدة للمؤلف داخل نص إعلامي معين. وحُسب فاصلان للثقة لكل معلمة لغوية استناداً إلى عينات من النصوص الإعلامية الأوكرانية: أحدهما للنصوص التي تتجاوز 1000 كلمة (حجم العينة: 124,576 كلمة)، والآخر للنصوص التي تصل إلى 1000 كلمة (حجم العينة: 15,635 كلمة).
حُدِّد فاصل الثقة لكل معلمة إحصائية باستخدام الانحراف المعياري، σ، لمتوسط القيمة العددية للمؤشر (ANVI) داخل عينة النص، ويُرمز إليه بـ ANVI ± σ. ويقدّر الانحراف المعياري مقدار إمكانية انحراف القيم العددية التجريبية للمؤشرات الإحصائية عن متوسط قيمة المؤشر العددية داخل الأسلوب الإعلامي. ولضمان الدقة، حُدّد فاصل الثقة لـ σ من خلال تجربة لغوية وإحصائية. وبناءً على ذلك، يقدّم النظام ثلاثة استنتاجات محتملة عند اختبار الفرضية 1: 1) تقع القيمة العددية للمؤشر داخل فاصل الثقة؛ 2) تكون القيمة العددية للمؤشر أدنى من الحد الأدنى للفاصل؛ أو 3) تتجاوز القيمة العددية للمؤشر الحد الأعلى للفاصل.
لننظر في النتائج المستخلصة من معلمة النص 1 الذي ألّفه المدون Oleksii Honcharenko (انظر الشكل 1). ويستند هذا التحليل إلى المعلمات الإحصائية وتفسيرها اللاحق المضمَّن في رأي الخبير المُولَّد كما هو موضح في الشكل 2.
تكشف المقاييس الإحصائية المتعلقة بالمفردات وحجم النص عن علاقة كمية. ففي النص 1، تقع جميع هذه المؤشرات ضمن النطاق المعتاد للأسلوب الإعلامي:
1) مؤشر التنوع (IB) يمثّل نسبة الكلمات الفريدة إلى الحجم الكلي للنص، ويُستخدم مقياساً للثراء المعجمي. وتقع قيمة IB البالغة 0.54 ضمن نطاق 30%–60%، ما يشير إلى مستوى متوسط من التنوع المعجمي؛
2) مؤشر حصرية النص (IVT) يعبّر عن نسبة عدد الكلمات الفريدة التي ترد مرة واحدة في النص إلى حجم النص. وتقع قيمة IVT البالغة 0.36 ضمن نطاق 20%–40%، ما يشير إلى انخفاض الحصرية المعجمية؛
232
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
3) مؤشر حصرية المفردات (IVL) يعبّر عن نسبة عدد الكلمات الفريدة التي لا ترد إلا مرة واحدة في النص إلى إجمالي حجم المفردات. وتقع قيمة IVL البالغة 0.66 ضمن نطاق 60%–76%، ما يشير إلى درجة مرتفعة من الحصرية المعجمية.
لننظر بعد ذلك في المعلمات الإحصائية للترابط الكمي بين الفئات المعجمية والنحوية للكلمات في النص 1:
1) مؤشر الصفات الاسمية، أو الوصف بالنعوت، (IIO) يعبّر عن نسبة عدد الأسماء إلى عدد الصفات. وتبلغ قيمة IIO 1.07، وهي أعلى من معيار الأسلوب الإعلامي البالغ 1.0، مما يشير إلى غلبة الأسماء على الصفات، وينتج عن ذلك عدد أقل من النعوت في النص؛
2) مؤشر صفات الأفعال (IDO) يعبّر عن نسبة عدد الظروف إلى عدد الأفعال. وتبلغ قيمة IDO 0.57، وهي أعلى من معيار الأسلوب الإعلامي البالغ 0.56. وتشير هذه النسبة من الظروف إلى انخفاض درجة صفات الأفعال في النص؛
3) درجة الاسمية (STN) تعبّر عن نسبة عدد الأسماء إلى عدد الأفعال. وتبلغ قيمة STN 1.76، وهي أقل من معيار الأسلوب الإعلامي البالغ 3.00. ويشير انخفاض هذا المؤشر إلى غلبة الأفعال على الأسماء وانخفاض درجة الاسمية في النص؛
4) مؤشر الإضماريّة (IPRO) يعبّر عن نسبة عدد ضمائر المتكلم والمخاطب والغائب إلى حجم الاستخدام الكلمي في النص. وتبلغ قيمة IPRO 0.09، وهي أعلى من معيار الأسلوب الإعلامي، وتشكل علامة على الأسلوب الفردي. وتشغل الضمائر الشخصية أكثر من 7% من النص، مما يشير إلى درجة الترابط فيه؛
5) مؤشر النمطية (MOD) يعبّر عن نسبة عدد الجسيمات إلى عدد الكلمات في النص. وتبلغ قيمة IMOD 0.07، وهي أعلى من معيار الأسلوب الإعلامي البالغ 4%، وتشكل علامة على الأسلوب الفردي. وتشغل الجسيمات أكثر من 4% من النص، مما يحدد درجة تعبير المؤلف عن مختلف التقييمات للظواهر والمواقف في النص؛
6) مؤشر الجوهرية (ISUB) يعبّر عن نسبة عدد الأسماء إلى حجم الاستخدام الكلمي في النص. وتبلغ قيمة ISUB 0.26، وهي أقل من معيار الأسلوب الإعلامي. وتشغل الأسماء أقل من 30% من النص، مما يحدد انخفاض درجة سكونية النص.
لنشرح المعلمات الإحصائية للنسبة الكمية بين العبارات والجمل في النص 1:
1) مؤشر الديناميكية (IDYN) يعبّر عن نسبة عدد العبارات الفعلية إلى عدد العبارات الاسمية. وتبلغ قيمة IDYN 0.74، وهي أعلى من معيار الأسلوب الإعلامي البالغ 0.6، وتشكل علامة على الأسلوب الفردي. وتحدد غلبة العبارات الفعلية على العبارات الاسمية (IDYN أكبر من 1.0) الان unfolding الديناميكي والسريع للأحداث في معنى النص؛
Straipsniai / Articles
233
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
2) مؤشر الترابط (IZV) يعبّر عن نسبة عدد حروف الجر وأدوات العطف إلى عدد الجمل في النص. وتقع قيمة IZV 0.66 ضمن النطاق المعتاد من 0.45 إلى 0.90 للأسلوب الإعلامي، مما يشير إلى غلبة عدد الجمل على عدد حروف الجر وأدوات العطف. ويحدد ذلك الدرجة المتوسطة من الترابط بين الوقائع والظواهر والمواقف الموصوفة في النص 1.
سيولى اهتمام خاص للمعلمات الإحصائية النفسية-اللغوية (Chuhunov 2009) في النص 1:
1) معامل ترايغر (KT) يعبّر عن نسبة عدد الأفعال إلى عدد الصفات في النص، مما يشير إلى الاستقرار/عدم الاستقرار الانفعالي للمتحدث. وتبلغ قيمة KT 0.61، وهي أعلى من معيار الأسلوب الإعلامي البالغ 0.5، وتشكل علامة على الأسلوب الفردي. ووفقًا للتفسير النفسي، يشير ذلك إلى انخفاض انفعالية المؤلف/المتحدث، وتردده في اتخاذ إجراءات عملية نشطة، وشعوره بالقلق. وتحدد القيمة الواقعة ضمن النطاق 1.35 ± 0.05 الاستقرار الانفعالي والتنظيم الطبيعيين لدى المؤلف؛
2) معامل يقين الفعل (KOD) يعبّر عن نسبة عدد الأفعال إلى عدد الأسماء في النص. وتشير هذه النسبة إلى درجة اندماج المؤلف اجتماعيًا واكتمال العبارة نحويًا. وتقع قيمة KOD 0.57 ضمن النطاق المعتاد من 0.30 إلى 0.60 للأسلوب الإعلامي، مما يشير إلى انخفاض درجة معامل الفعل الموضوعي. ووفقًا للتفسير النفسي، يدل ذلك على انخفاض مستوى انفعالية المؤلف/المتحدث، وتردده إزاء الأفعال العملية النشطة، وشعوره بالقلق. وتحدد القيمة الواقعة ضمن النطاق 1.35 ± 0.05 الاستقرار الانفعالي الطبيعي وتنظيم المؤلف لانفعالاته، وهو ما يشير، استنادًا إلى السمات اللغوية، إلى درجة طبيعية من الاكتمال النحوي في الجمل وبنية نحوية صحيحة؛
3) معامل العدوانية (KA) يعبّر عن نسبة عدد الأفعال واستخدامها إلى العدد الإجمالي للكلمات في النص، مما يحدد عدوانية اللغة من المنظور النفسي-اللغوي. وتبلغ قيمة KA 0.15، وهي أعلى من معيار الأسلوب الإعلامي البالغ 13%، وتشكل علامة على الأسلوب الفردي. ووفقًا للتفسير النفسي، تشير القيم الأقل من 60% إلى انخفاض درجة العدوانية، وكبت المؤلف لانفعالاته، وتردده. ويحدد الاقتراب من 60% الدرجة الطبيعية لعدوانية المؤلف واستقراره الانفعالي، في حين تشير القيم التي تتجاوز 60% إلى ارتفاع عدوانية المؤلف وإثارته الانفعالية.
أخيرًا، لننظر في المعلمة الإحصائية الدلالية للنص 1: يُحسب مؤشر سُميّة النص (ITOX) من تكرار المفردات السلبية في النص (لمزيد من التفاصيل، انظر القسم 4.3). وتقع قيمة ITOX البالغة 0.36 ضمن النطاق المعتاد من 0.1 إلى 0.7 للأسلوب الإعلامي. ويشكّل ITOX المواقف المعرفية والبراغماتية تجاه الانفعالات السلبية.
234
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
4.2. مقارنة النصوص وفقًا للمعلمات الإحصائية
تضمنت مهمة تقييم درجة التشابه بين نصين اختبار الفرضية 2. وتنص هذه الفرضية على أنه إذا أظهرت البيانات التجريبية الناتجة عن التوصيف الإحصائي لنصين فرقًا صغيرًا فقط في القيم العددية للمؤشرات، فإن النصين ينتميان إلى المؤلف نفسه. وتُختبر هذه الفرضية داخل النظام بطريقتين: 1) مقارنة القيم العددية لكل مؤشر في النصين؛ 2) تحديد المسافة المتجهية بين النصين. وقد نُفذت هاتان المسألتان في قسم مقارنة إسناد النصوص. وتتمثل المهمة الأولى في مقارنة البيانات التجريبية للنصوص باستخدام المؤشرات على مقياس فترة الثقة للأسلوب الإعلامي (الشكل 3). وكما هو موضح في الشكل 3، تُعرض الخصائص الكمية لمعلمات كلا النصين بألوان مختلفة لتيسير استخدام النظام. وتقارن المرئية القيم التجريبية لمؤشرات النصين بحدود فترة الثقة (الدنيا والعليا) المستمدة من نصوص الأسلوب الإعلامي الأوكراني.
الشكل 3: مقارنة المسافة المتجهية بين النصوص
تتمثل المهمة الثانية في حساب المسافة المتجهية بين نصين باستخدام صيغة المسافة الإقليدية. ويشمل ذلك جمع مربعات الفروق بين القيم العددية لـ15 معلمة إحصائية للنصين. ثم يُحسب الجذر التربيعي لهذا المجموع. أما القيم العددية
Straipsniai / Articles
235
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
للمسافة المتجهية فتشير إلى مدى عدم التشابه الإحصائي بين النصوص، وتوفر مقياسًا للمسافة الفاصلة بينها. ومع أن تقلبات قيمة المسافة المتجهية في النصوص الإعلامية غير معروفة جيدًا، فإن المسافة يمكن أن تساوي 0 عند مقارنة نصوص متطابقة. وهذا يعني أن النصين مختلفان إذا كانت المسافة المتجهية أكبر من 0. وعلاوة على ذلك، كلما زادت القيمة العددية للمسافة المتجهية، زادت الفروق اللغوية والإحصائية بين النصين. وتُعرض مقارنة المسافة الإقليدية في شكل جدول. وفي العمود 4 من الشكل 4، تمثل القيم العددية المسافات الإقليدية. ويعرض الشكل 4 مقارنة النص الذي حلله Oleksii Honcharenko (النص 1) بثلاثة نصوص أخرى للمؤلف نفسه: السطر 1 للنص 2 (المسافة 0.44)؛ والسطر 2 للنص 3 (المسافة 0.56)؛ والسطر 3 للنص 4 (المسافة 0.77). وتبين البيانات التجريبية أن التشابه بين نصوص المؤلف الواحد يبقى ضمن 1، في حين تُظهر نصوص المؤلفين الآخرين (الأسطر 4–10) مسافات أكبر من 1.
الشكل 4. تنظيم المسافة الإقليدية بين النصوص
تقنعنا مقارنة المعلمات الإحصائية للنصوص بأن منهجية الإسناد المقترحة تكشف نموذجًا أسلوبيًا للنصوص الأوكرانية اللغة. ويمكن استخدام هذا النموذج أيضًا لتحديد مؤلف النص. وسنؤكد ذلك بعرض مرئي لإسناد 7 نصوص لثلاثة مؤلفين مختلفين وفقًا لـ15 معلمة إحصائية باستخدام طريقة التقريب والإسقاط المنتظمين للمتشعب (UMAP) (McInnes et al. 2020)، التي خوارزميتها منفذة أيضًا في نظام TextAttributor. وهذا
236
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
تتيح هذه التقنية خفض أبعاد فضاء السمات بإسقاط فضاء ذي 15 بُعدًا على المستوى. وفي الشكل 5، تقابل النقاط ذات الأشكال المختلفة (P1–P7 للمؤلف 1، وF1–F7 للمؤلف 2، وM1–M7 للمؤلف 3) 7 نصوص مختارة عشوائيًا من مؤلفين مختلفين.
كما نرى، بعد خفض الأبعاد، يمكن فصل إسقاطات نصوص المؤلفين الثلاثة بصريًا إلى مناطق متميزة. ويؤكد هذا المثال أن المعلمات التي يحددها TextAttributor مهمة لوصف السمات الأسلوبية للنصوص وتحديد مؤلف النص (حتى في صورة مختزلة).
الشكل 5: تمثيل بياني لإسناد النصوص باستخدام طريقة UMAP
4.3. فهرسة المشاعر السلبية في النص
أثناء تطوير نظام من المعلمات الإحصائية لتحديد أسلوب النص ومؤلفه، أدركنا أن سُميّة النص يمكن أن تكون مؤشرًا للإسناد. ولذلك أنشأنا وحدة منفصلة لتحديد مؤشر السُميّة آليًا في TextAttributor.
Straispsniai / Articles
237
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
أصبح المكوّن المعلوماتي اليوم مهمًا بوجه خاص في الحرب الهجينة. ولذلك كانت مادة دراستنا مدونةً بحثيةً لنصوص إعلامية إلكترونية من الخطاب السياسي، يبلغ حجمها 10 ملايين كلمة. ونستخدم مصطلح «النص السام» بمعنى واسع. وتتميز هذه النصوص بالتحرش والتهديدات والفحش والتنمر الإلكتروني والاستفزاز ونصوص الكراهية القائمة على الهوية، كما تحتوي على رموز تعبيرية، وهي ظواهر وموضوعات تثير مشاعر سلبية لدى الشخص (مثل war, air raid, corruption).
هدف هذا المشروع إلى تحديد إمكان تحقق المشاعر السلبية في النصوص الأوكرانية وتطوير نظام آلي للتعرف على المحتوى السام. وتضمنت هذه المهمة مهمتين فرعيتين متتاليتين: أولًا، تطوير نظام للفحص اللغوي للنصوص السامة مع تحديد مؤشرات السُميّة من خلال تحليل القواميس والأساليب القائمة على القواعد؛ وثانيًا، إنشاء مجموعة بيانات تدريب لأغراض التعلم الآلي وتطوير شبكة عصبية للتنبؤ بمؤشرات سُميّة النصوص.
لننظر في إنجاز المهمة الأولى. وقد شمل ذلك إنشاء قاعدة بيانات معجمية تضم ثلاثة قواميس متميزة:
1) قاموس Emotiogen: مجموعة من 5000 كلمة (وفقًا لمعاني المتغيرات المعجمية-الدلالية) ذات نبرات شعورية سلبية، مقيمة على مقياس من −2. ومن أمثلتها immoral, impunity, bribery وsteal؛
2) قاموس خطاب الكراهية: يضم 3000 كلمة، منها أسماء أفراد (1620)، ومصطلحات بذيئة (613)، ولغة مسيئة (787). ومن أمثلته westerner (западенець: اسم ازدرائي للأشخاص من المناطق الغربية في Ukraine) وhuckster؛
3) العبارات السامة: مجموعة من 1500 تعبير اصطلاحي ينقل مشاعر سلبية. ومن أمثلتها grimaces like a monkey, kisses his arse and opens his mouth.
وُسِمت كل مدخلة في هذه القوائم بسمات دلالية، إذ يضم قاموس خطاب الكراهية 18 سمة، وتضم قائمة العبارات السامة 26 سمة. فعلى سبيل المثال، وُسِمت كلمات قاموس خطاب الكراهية بخصائص مثل «s» للتمييز على أساس الجنس، و«r» للعنصرية، و«e» للتمييز على أساس السن. وتُسند قاعدة البيانات المعجمية هذه، وهي نظام متعدد المعلمات، سمات دلالية إلى الوحدات (الكلمات أو العبارات)، مما يتيح، بالاقتران مع بيانات التكرار المستخرجة من النص المحلل، إجراء تحليل للسُميّة.
يُحسب مؤشر سُميّة النص باستخدام الصيغة:
Itox = (e + |K| (m + t)) / n * 10,
هنا، n هو حجم النص؛ وe هو عدد الكلمات الانفعالية؛ وm هو عدد كلمات خطاب الكراهية؛ وt هو عدد العبارات السامة؛ وK معامل يساوي −2، وهو يبرز كلمات خطاب الكراهية والعبارات السامة، التي تقابل، على مقياس مكوّن من
238
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
خمس خانات (+2، +1، 0، −1، −2)، القيمة −2. وتتراوح قيم المؤشر من 0 إلى +1.
فعلى سبيل المثال، يبلغ مؤشر سُميّة النص «أشخاص ذوو قلم أحمر (Люди з червоною ручкою)» (12 جملة، و129 كلمة) 1.01، مما يشير إلى سُميّته العالية، إذ يتراوح الحد الفاصل لهذه النصوص القصيرة بين 0.1 و0.7. وفي الوقت نفسه، يولد النظام نتائج فحص لغوي آلي لسُميّة النص (انظر الشكل 6)، تتألف من: 1) خريطة إحصائية للفئات الدلالية للمفردات السلبية وفقًا لعلامات تصنيف القوائم المعجمية (المولدات الشعورية – 5، والألفاظ السوقية – 2، والتمييز على أساس الجنس – 2)؛ 2) نص يتضمن كلمات محددة ذات مشاعر سلبية، وتُعبّر هذه الكلمات عن فئات الخريطة الإحصائية. ولنلقِ نظرة على مقتطف من النص الواقعي المحلل (الشكل 6):
أولئك الأشخاص الذين يتجولون حاملين قلمًا أحمر ويصححون الأخطاء في منشورات الآخرين: من أنتم أصلًا؟ هل لديكم أي فكرة عن مدى إزعاجكم لي؟ أدرس ملفاتكم الشخصية عمدًا، فأنا فضولي لمعرفة العالم الذي تعيشون فيه. هذا العالم يخيفني كثيرًا. وآمل مخلصًا ألا تتقاطع طرقنا في الحياة الواقعية تحت أي ظرف. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося ні за яких обставин).
هنا يبرز النظام آليًا بالخط العريض الكلمات التالية ذات المكوّن السلبي: الأخطاء (помилки)، ومنشورات الآخرين (чужих)، ومزعجون (бісите)، ويخيف (лякає).
الشكل 6: مقتطف من الفحص اللغوي الآلي لسُميّة النص
Straipsniai / Articles
239
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
5. مناهج التعلم الآلي: التجارب والنتائج والمناقشات
لنركّز على نمط التشغيل الثاني لنظام TextAttributor المخصص لتقنيات التعلم الآلي. وعند إدخال البيانات لتدريب النموذج، لدينا مدونات نصية موسومة وفقًا لهدف كل مهمة فرعية: (أ) معلومات نصية لاكتشاف السُميّة، و(ب) تحديد المؤلف. وتنقسم كل مدونة إلى مجموعتي تدريب وضبط، فضلًا عن مجموعة تحقق في حالة المدونات الكبيرة بما يكفي. وتُقدّر معلمات نموذج حل المشكلة المختار على مجموعة التدريب. وتُضبط المعلمات الفائقة للنموذج باستخدام مجموعة التحقق. وتُقاس مؤشرات الأداء النهائية للنموذج على مجموعة الضبط، مع مراعاة توافر موارد الحوسبة اللازمة لتشغيل النموذج. وقد طُوّرت مدونة لكل مهمة فرعية بالتوازي مع مكوّن التعلم الآلي في TextAttributor، ولذلك دُرّبت النماذج الحالية على بيانات صغيرة نسبيًا، تشمل نصوصًا قصيرة من مدونات أوكرانية اللغة على الإنترنت، وتعليقات، ومقالات، وغير ذلك.
5.1. اكتشاف السُميّة
نتيجةً لسلسلة من الدراسات التجريبية، اختيرت بنية فعّالة حسابيًا تستند إلى طريقة fastText وأدواتها (Joulin et al. 2016). وتوفر هذه الطريقة تمثيلات متجهية للكلمات وتقدّر توزيع احتمالات الوثائق وفقًا لفئات محددة مسبقًا. وتُمثّل الكلمات في صورة متجهات استنادًا إلى التقسيم الآلي للكلمات إلى أجزاء (كلمات فرعية)، مما يحاكي انفتاح القاموس. ويمثل تمثيل الكلمات الفرعية أهمية لأن اللغة الأوكرانية شديدة التصريف، ولأنه يجب تغطية عدد كبير من الكلمات غير المرئية، فضلًا عن الكلمات التي تحتوي على أخطاء إملائية. كما تتحدد فعالية النهج المستخدم بالظروف التقنية لتشغيل النظام والموارد النصية المتاحة لتدريب النموذج.
استُخدمت مدونة مُعدّة تضم نحو 12,000 وثيقة نصية للتصنيف الثنائي بهدف اكتشاف المحتوى السام. وأفضل نتيجة، استنادًا إلى المقياس الموحّد (F1 = 79.4%)، تحققت باستخدام إعدادات المعلمات الفائقة الآتية: بُعد متجه الكلمة 56، ومعدل تعلم ابتدائي 0.15، و500 دورة تدريب، وسياق معجمي ممثل بثنائيات الكلمات، وأطوال كلمات فرعية تتراوح من حرفين إلى 5 أحرف، وعتبة قرار قدرها 0.4. إضافةً إلى ذلك، أظهر النموذج حساسية بلغت 85%، مع تحقيق دقة تقارب 70%.
240
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
5.2. تحديد المؤلف
أُجري البحث التجريبي في نماذج تحديد مؤلف النص باستخدام جزء من مدونة نصوص اجتماعية-سياسية متاحة للعامة، يمكن فيها تحديد الشخص مؤلف الوثيقة. واختير ما مجموعه 702 نصًا لأربعة مؤلفين نشروا أكبر عدد من الوثائق، ويتراوح طول النصوص بين 60 و1000 حرف. وكان أكبر عدد من منشورات المؤلف 304 (115 ألف حرف)، وأصغرها 109 (49 ألف حرف). ولأغراض الاختبار، أُخذت عشوائيًا 25 نصًا لكل مؤلف مختار. وشكلت بقية الوثائق مجموعة التدريب.
تحققت أفضل نتيجة، وفقًا للمقياس الموحّد (F1 = 81%)، باستخدام قيم المعلمات الفائقة الآتية: بُعد فضاء تمثيل الكلمات 50، ومعدل تعلم ابتدائي 0.1، و50 دورة تدريب، وسياق معجمي ممثل بثنائيات الكلمات، وأطوال كلمات فرعية تتراوح من حرفين إلى 5 أحرف، وعتبة لاتخاذ القرار قدرها 0.5. ومن اللافت أنه، في بعض تهيئات النموذج، بلغت الحساسية تجاه المؤلف صاحب أكبر عدد من الوثائق في مجموعة البيانات 100%، مع تجاوز الدقة 90%. وتبرهن هذه النتائج على إمكانية تطوير نظام فعّال قادر على تغطية نصوص المؤلفين الممثلين تمثيلًا كافيًا في مجموعة التدريب بدقة.
دُمجت نماذج الشبكات العصبية المدرّبة في نظام TextAttributor ضمن بنية «العميل-الخادم»، حيث تُعرض نتائج مهمتين: (أ) تحديد السُميّة و(ب) اكتشاف المؤلف. وكانت نتيجة عمل النظام على نص «قانون Ukraine بشأن التعليم العالي» كما يلي: مؤشر السُميّة (تقدير في صورة احتمال: مدى سُميّة النص) – 0.04، والتشابه مع المؤلفين (تقديرات في صورة احتمال التأليف للمؤلفين المعروفين للنظام): 0.49 لـ I. Farion، و0.30 لـ Oleksii Honcharenko، و0.22 لـ Mariana Bezugla.
6. الاستنتاجات
يخضع نظام TextAttributor حاليًا لمراحل اختبار لمعالجة مسائل إسناد النصوص وتحديد سُميّتها داخل النصوص الأوكرانية اللغة. وهذا النظام مريح وفعّال في مختلف الدراسات التكنولوجية. وخلال 5 أشهر، حلل تطبيق TextAttributor على الويب آليًا 784 نصًا أوكرانيًا أرسلها 226 مستخدمًا.
تُظهر نتائجنا فعالية طريقتنا، التي تتضمن تكميم العناصر اللفظية استنادًا إلى معلمات نحوية رسمية ودلالية، ولا سيما بالنسبة إلى الانفعالية السلبية. ويتحقق ذلك من خلال الجمع بين المناهج المعجمية والمناهج القائمة على القواعد، مع استكمالها بالتعلم الآلي
Straipsniai / Articles
241
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
التقنيات. وقد أتاح البحث التجريبي في التعلم الآلي لاكتشاف السُميّة وتحديد المؤلف من خلال النص الحصول على نتائج قابلة للمقارنة مع نتائج تجارب ذات خصائص نموذجية مماثلة (عدد الوثائق والمؤلفين) أُبلغ عنها في لغات أخرى. وأظهرت نماذج الكلمات الفرعية متانة محسّنة في مواجهة الانفتاح المعجمي والأخطاء النصية.
يمهّد البحث الذي أُجري الطريق لحل مسائل من هذا النوع في اللغة الأوكرانية، مثل اكتشاف المحتوى السام وخطاب الكراهية والمعلومات المضللة ومراقبتها، والتحقق من المؤلف وفكّ التعمية، وتنميط المؤلف وتقسيم كلامه، والتنميط النفسي-اللغوي، ونمذجة الأسلوب، وتتبع مصدر المحتوى الزائف، وغير ذلك. ويمكن أيضًا تطبيق مخطط تحليل النصوص وإسنادها المطوّر على لغات أخرى.
نتطلع مستقبلًا إلى دمج أداة إسناد النصوص الآلية واكتشاف السُميّة لدينا مع التحليل الدلالي والنحوي والنفسي-اللغوي والاجتماعي-اللغوي. وسيمنحنا هذا الدمج فهمًا أعمق للتأثير في القارئ. ومن خلال استخدام التحليل الدلالي للتصنيف المعجمي، نهدف إلى تحديد العناصر السردية المتأصلة في النص، مما يزيد موثوقية إسناد النصوص في إجراءات تحديد المؤلف. بالإضافة إلى ذلك، نخطط لتوسيع مدوناتنا النصية واستخدام نماذج لغوية كبيرة متعددة اللغات لتوسيع قدرات نظامنا، فضلًا عن تنفيذ أدوات للمقارنة الإحصائية للنصوص في جميع أساليب اللغة الأوكرانية.
شكر وتقدير
أُنشئ النظام ضمن مشروع دعمته السفارة البريطانية في Kyiv ونفذه فريق من المدرسين والباحثين في كرسي اللغة الأوكرانية واللسانيات التطبيقية في Taras Shevchenko National University of Kyiv.
نود أن نعرب عن تقديرنا الصادق للسفارة البريطانية في Kyiv على دعمها المالي لهذا المشروع البحثي. ونشكر Svitlana Yavorska وIryna Bezkorovayna على توجيههما ومساعدتهما طوال المشروع. ونقدم شكرًا خاصًا إلى Kostiantyn Goncharenko على التنظيم والدعم الوثائقي للمشروع. وعلاوة على ذلك، نعرب عن امتناننا لطلاب البرنامج التعليمي «اللسانيات التطبيقية (الحاسوبية) واللغة الإنجليزية» في Taras Shevchenko National University of Kyiv. فقد أسهموا بوقتهم وخبرتهم وجهودهم في تشكيل مدونة النصوص الأوكرانية السامة. ونشكر Oksana Tolochko، وهي خريجة برنامج البكالوريوس لدينا، على إنشاء قاموس نبرات اللغة الأوكرانية، الذي استخدمناه لتجميع قائمة معجمية من الرموز التعبيرية السلبية. كما نعرب عن تقديرنا العميق للجهود التي بذلها Mykola Kostikov في عملية جمع البيانات. ونود أن نعرب عن امتناننا الصادق لجميع أعضاء مجتمع البحث الذين أسهموا في هذه الدراسة بنصائحهم واستشاراتهم.
242
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
REFERENCES
ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/.
Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273.
Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003.
Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038.
Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv].
Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267.
Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146.
Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100.
Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka.
Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265.
Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of
Straipsniai / Articles
243
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01.
Darčuk Natalija 2013: Komp’juterne anotuvannja ukrajin’s’koho tekstu: rezul’taty i perspektyvyj, Kyiv: Osvita Ukrajiny.
Darčuk Natalija, Vasyl’jeva Iryna, Vasyl’jev Oleksij 2021: Vektorna model’ analizu stylistyku tekstiv. – Ukrajins’kyj fizičnyj žurnal 66(5), 373–378.
Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066.
Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036.
Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308.
Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935.
Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453.
Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80.
Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296.
Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, Jégou Hervé, Mikolov Tomas 2016: FastText.zip: Compressing text classification models. – ArXiv e-prints 1612.03651. DOI: 10.48550/arXiv.1612.03651.
244
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264.
Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565.
Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf.
KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx.
LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app.
Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500.
Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041.
McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426.
Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt.
Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031.
Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047.
Straipsniai / Articles
245
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK
TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts. Available at: ta.mova.info.
Volos Yana, Levchenko Olena 2023: Statistical profile of Valerie Shevchuk’s idiostyle (morphological level). – Slobozhan Scientific Bulletin, Ser. Philology, 3, 32–36. DOI:10.32782/philspu/2023.3.6.
Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15.
Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas)
SANTRAUKA
Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą.
246
Acta Linguistica Lithuanica XCI
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Įteikta 2024 m. lapkričio 25 d.
NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine
[email protected]
OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine
[email protected]
VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine
[email protected]
YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine
[email protected]
VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine
[email protected]
MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine
[email protected]
Straipsniai / Articles
247