Full text
135 “Al-Farg‘oniy avlodlari” elektron ilmiy jurnali ISSN 2181-4252. Tom: 1 | Son: 3 | 2025-yil "Descendants of Al-Farghani" electronic scientific journal. ISSN 2181-4252. Vol: 1 | Iss: 3 | 2025 year Электронный научный журнал "Потомки АльФаргани" ISSN 2181-4252. Том: 1 | Выпуск: 3 | 2025 год https://al-fargoniy.uz/ O‘zbek tili matnlarining universal bog‘liqlik daraxti korpusiga asoslangan neyron semanatik tahlili Matlatipov San’atbek G‘ayratovich, Ph.D., yetakchi ilmiy xodim, Mirzo Ulug‘bek nomidagi O‘zbekiston Milliy universiteti. [email protected] Fayzullayev Xurshid, O‘zbekiston Milliy universitetining UzUDT loyihasi stajyoro‘quvchisi. Annotatsiya. O’zbek tili morfologik jihatdan boy qoʻshimchalarga ega boʻlib, gapda ot, fe’l va boshqa soʻz turkumlarining qator qoʻshimchalari orqali ma’no ifodalanadi. Soʻnggi 5 yillikda, oʻzbek tilining rivojlanishiga e’tibor sababli, sezilarli strukturaga egan bo‘lgan korpuslar va morfologik vositalar paydo boʻla boshladi, ammo toʻliq annotatsiyalangan bog’liqlik daraxti korpusi va yuqori sifatli semantik parserlash hali ham mavjud emas. Ushbu maqolada, Universal Dependencies (UD) korpusi asosida yaratilgan daraxtlar toʻplamiga tayangan holda Oʻzbek tili matnlarining neyron semantik tahlilini taqdim etamiz. Mazkur korpus 686 ta jumla va 7 950 ta tokenni oʻz ichiga oladi, har bir jumla oʻrtacha 11,6 tokenni tashkil etadi. Biz ikki bosqichli arxitektura – BiLSTM asosidagi kontekstual enkoder va bosh/bog‘lovchi (head/dependent) proyeksiyalarini birlashtirgan biaffin funksiyasi bilan ishlaydigan graflarga asoslangan parserni quramiz. Sinovlar UAS/LAS koʻrsatkichlari, gap uzunligi bo‘yicha tafsilotlar bilan taqdim etiladi. Kalit so’zlar: universal bog‘liqlik daraxti korpusi, o‘zbek tili, neyron semantik tahlil, tabiiy tillar jarayoni Kirish. Oʻzbek tili bugun dunyoda taxminan 40 million kishiga ona tili boʻlib, turkiy tillar ichida turk tilidan keyin ikkinchi eng koʻp soʻzlashuvchilar soniga ega[1]. Til agglutinativ xususiyatga ega, shuning uchun sintaktik vazifalarni ifodalash uchun tahrirlanmaydigan koʻplab morfemalar qoʻshiladi. Mavjud kompyuter lingvistik manbalar orasida Prolog asosidagi morfologik analizatorlar[5], bosh uchun qoidaviy belgilovchi POS teggarlar va FST asosidagi analizatorlar ishlab chiqildi[1]. Biroq toʻliq qoʻlda annotatsiyalangan sintaktik daraxtli korpuslarning yetishmasligi Oʻzbek tili uchun avtomatik parserlar qurishni qiyinlashtirdi. Universal Dependencies (UD) loyihasi turli tillar uchun yagona morfosintaktik skelet taklif etadi, bu esa darslikdan foydalanuvchilarni tahlil natijalarini solishtirishga imkon beradi. UD tilida 17 ta umumiy soʻz turkumlari (UPOS) mavjud boʻlib, ularning barchasi Oʻzbek tilida qoʻllaniladi: PRON, PUNCT, VERB, NOUN, AUX, ADP, CCONJ, SCONJ, ADV, PROPN, DET, ADJ, NUM, INTJ, PART, SYM va X[4]. Oʻzbek tili sintaksisi hamda morfologiyasini toʻliq ifodalash uchun UD korpusidagi munosabat turlarining alt‑turlari (masalan, advcl:cond, compound:lvc, nmod:poss va obl:agent) keng qoʻllaniladi[4]. Adabiyotlar tahlili. Oʻzbek tili boʻyicha dastlabki korpuslar asosan morfologik tahlil va POS teglashga qaratilgan boʻlib, [5] Prolog asosida morfologik analizatorni yaratishgan[1]. [6] bir necha yillik ishlar davomida qoʻshimcha teglar toʻplamini yaratish hamda qoidaviy POS teglovchini ishlab chiqishdi. Shuningdek, soʻnggi yillarda uzbekcha WordNet, sentiment tahlil toʻplamlari, semantik baholash, matn tasnifi va transformer asosidagi til modellari (masalan, UzBERT[3] va BERTbek[2]) paydo boʻldi[1]. Biroq, sintaktik bogʻliqlik daraxti korpuslari bir necha yuz jumla bilan cheklanib qolgan; masalan, UD Uzbek‑UT korpusi 500 jumla (5850 token) bilan taqdim etilgan[1]. Biz foydalanayotgan UD_Uzbek‑UzUDT (https://github.com/UniversalDependencies/UD_Uzbe
136 “Al-Farg‘oniy avlodlari” elektron ilmiy jurnali ISSN 2181-4252. Tom: 1 | Son: 3 | 2025-yil "Descendants of Al-Farghani" electronic scientific journal. ISSN 2181-4252. Vol: 1 | Iss: 3 | 2025 year Электронный научный журнал "Потомки АльФаргани" ISSN 2181-4252. Том: 1 | Выпуск: 3 | 2025 год https://al-fargoniy.uz/ k-UzUDT/tree/dev) korpusi esa joriy ishimiz uchun kengroq ma’lumot bazasini beradi (686 jumla). Korpus. UzUDT korpusi lingvistik jihatdan qoʻlda toʻliq belgilangan koʻp qatlamli daraxtlar toʻplamidir. Korpus 686 ta jumla va 7 950 ta tokenni oʻz ichiga oladi; har bir jumla oʻrtacha 11,6 tokenni tashkil etadi[2]. Korpusning yaratilishi grammatik misollar, dialoglar hamda nasriy matnlardan iborat boʻlib, har bir jumla uchun lemmatizatsiya, universallashtirilgan soʻz turkumlari (UPOS), morfologik xususiyatlar, ustunga mos kirish (head) va bogʻlanma (dependent) munosabatlari qoʻlda tekshirilgan. Oʻzbek tili uchun asosiy soʻz tartibi subyekt‑obyekt‑predikat boʻlishiga qaramay, UD korpusida mavzu birikmalari (advcl), egasiz gaplar (null‑subject) va koʻplab qoʻshimcha apparatlar tufayli non‑projective bogʻlanishlar tez‑tez uchraydi[1]. Oʻzbek tilida egalik va genitiv munosabatlari nmod:poss orqali, yengil fe’l konstruktsiyalari esa compound:lvc orqali ifodalanadi[4]. Korpusdagi ma’lumotlar train va test toʻplamlariga boʻlingan. Ushbu ma’lumotlarning muvofiqligi uchun biz UD formati (CoNLL‑U)dagi barcha ustunlarni, jumladagi koʻp soʻzli tokenlar va bo‘sh nuqtali tugunlarni ham e’tiborsiz qoldirmasdan qayta ishladik. Tahlillarimizda punktuatsiya tokenlarini UAS va LAS hisoblashdan chetlashtirdik va root (0 bosh tugun) → ROOT munosabatini aniq ravishda belgiladik. Metodologiya. Biz Kiperwasser va Goldberg, shuningdek Dozat va Manningning ishlari asosida graflarga asoslangan neyron parsherdan foydalanamiz. Arxitekturani quyidagi komponentlar tashkil etadi: 1. Kirish qatlamlari. Har bir token uchun biz statik belgilangan word embedding va morfoologik xususiyat embeddinglarini birlashtirib, yaxlit vektor hosil qilamiz. Ushbu vektor 2‑yoʻnalishli LSTM (BiLSTM) orqali kontekstual ma’noda boyitiladi. 2. Proyeksiyalar. BiLSTM chiqishlari ikki alohida MLP orqali bosh (head) va bogʻlanma (dependent) fazolariga proyeksiya qilinadi. Har bir token uchun ℎ𝑖 head = MLPhead(𝑟𝑖) va ℎ𝑖 dep = MLPdep(𝑟𝑖) vektorlar olinadi. 3. Biaffine bogʻlanish bahosi. Har bir potensial yoy 𝑗 → 𝑖 uchun baho quyidagicha hisoblanadi: 𝑠(𝑗 → 𝑖)=(ℎ𝑗 head)⊤𝑈 ℎ𝑖 dep +(ℎ𝑗 head)⊤𝑢, bu yerda 𝑈 – ikki oʻlchamli tensorga ega matritsa va 𝑢 – bias vektori. Har bir tokenning potensial boshini tanlash uchun softmax normalizatsiyasi qoʻllaniladi. Oʻzbek tilidagi non‑projective bogʻlanishlarni qayta tiklash uchun Chu–Liu/Edmonds maksimal spanning tree (MST) algoritmidan foydalanamiz; u har bir jumla uchun yuqori ballga ega yagona daraxt hosil qiladi. Bir nechta ROOT farzandlari yuzaga kelganda, ular orasidan eng yuqori umumiy ballga ega daraxt tanlanadi. 1. Labeler. Baholangan yoylar uchun sintaktik munosabat etiketini aniqlash maqsadida boshqa MLPdan foydalaniladi. Label MLP kirishiga ℎ𝑗 head ⊕ ℎ𝑖 dep concatenatsiya qilinib, uni yumshoqmax bilan normalizatsiya qilish orqali munosabat ehtimoli olinadi. 2. Oʻqitish va optimallashtirish. Modellar kross‑entropiya yoʻqotishi asosida qoʻshma tarzda oʻqitiladi: yoyning mavjud‑yoki‑mavjud emasligi va uning tegini birgalikda minimallashtiramiz. Optimallashtirish uchun Adam optimizeridan foydalanamiz; o‘qitish jarayonida droupout qatlamlari (giriluv 0.33) va 3 urinishli nasl (batch) normalizatsiyasi qoʻllaniladi. Modelning umumlashganlik qobiliyatini oshirish uchun sinov pogʻonasida beam search o‘rniga MSTga tayanamiz. Natijalar. Trening uchun korpusning 80 foizi, sinov uchun esa 20 foizi ajratildi. Trening vaqtida har bir epochda modellarning samaradorligi dev toʻplamida kuzatildi va 3 epoch davomida yaxshilanish kuzatilmaganida erta toʻxtash qoʻllanildi. Natijalar UAS (yozuv qoʻyilmagan yetakchi bogʻlanishlar toʻgʻriligini) va LAS (bogʻlanishning etiketi ham toʻgʻri boʻlishini) koʻrsatkichlari bilan baholandi. Natijalarning umumiy koʻrinishi quyidagi jadvalda keltirilgan. Qisqa gaplar (< 12 token) toʻplamida modellarning natijasi sezilarli darajada yuqori boʻlishini kuzatdik; bu Oʻzbek tili morfologik
137 “Al-Farg‘oniy avlodlari” elektron ilmiy jurnali ISSN 2181-4252. Tom: 1 | Son: 3 | 2025-yil "Descendants of Al-Farghani" electronic scientific journal. ISSN 2181-4252. Vol: 1 | Iss: 3 | 2025 year Электронный научный журнал "Потомки АльФаргани" ISSN 2181-4252. Том: 1 | Выпуск: 3 | 2025 год https://al-fargoniy.uz/ murakkabliklari uzun gaplarda ko‘proq xatolarga olib kelishini ko‘rsatadi. Toʻplam UAS (%) LAS (%) Barcha gaplar (test) 84.7 79.3 Qisqa gaplar (<12 token) 88.2 82.1 Modelimiz o‘zbek tilining agglutinativ xususiyatlari va SOV soʻz tartibini muvaffaqiyatli oʻrgandi. Biroq, non‑proyektive bogʻlanishlar soni ortgan sari xatoliklar ham ko‘paydi. Koʻplab xatolar egalik nisbati (nmod:poss) va yengil fe’l konstruktsiyalari (compound:lvc) etiketlarida kuzatildi, chunki bu munosabatlarda soʻzlarning turli qoʻshimchalar orqali bogʻlanishi modelni chalkashtiradi. Shuningdek, ba’zi uzoq masofali bogʻlanishlar (masalan, kiritma gaplar) ancha murakkab boʻlib, MST dekoderi notoʻgʻri boshlarni tanladi. Top‑5 xatolarni tahlil qilishda nsubj vs obl, obj vs nmod, va advcl vs xcomp o‘rtasidagi chalkashliklar yetakchi rol o‘ynadi. Xatoliklar tahlili. Modellarimizning xatolarini yanada chuqurroq tahlil qilish uchun quyidagi jihatlarga e’tibor qaratdik: • Masofa bo‘yicha xatolar. Yoy uzunligi (bosh va boĝlovchi orasidagi soʻzlar soni) oshgani sari xato darajasi ham oshdi. 1–2 token masofadagi bogʻlanishlarda xato ulushi 5 foizdan kam boʻlsa, 7 token va undan uzun masofalarda bu ko‘rsatkich 18 foizga yetdi. • Noproyektivlik. Korpusdagi noaniq bogʻlanishlar umumiy yoylarning taxminan 3 foizini tashkil etdi. Model bu yoylarni chuqur bosh‑boĝlovchi proyeksiyalari yordamida tiklasa‑da, ayrim holatlarda MST bir nechta ROOT farzandini tanlab, notoʻgʻri daraxtga olib kelgan. • Munosabatlar aralashishi. Eng koʻp chalkashgan etiketlar – obl va nmod kabi umumiy munosabatlar hamda advcl:cond va xcomp kabi qoʻshimcha holatlardir. Bu xatolar, asosan, gapda qoʻshimchalar tomonidan shartlangan bogʻlanishlar toʻgʻri aniqlanmaganida paydo boʻlgan. • Sifatli misollar. Ba’zi gaplarda model hech qanday qiyinchiliksiz toʻgʻri daraxt qurdi; masalan, “Sen oʻz sahnangda har xil odamlarni rol oʻynatib, ularga yurakni larzaga soladigan komediya va tragediyalarni oʻynatasan” misolida barcha asosiy munosabatlar toʻgʻri topildi[2]. Boshqa gaplarda esa genitiv ega tarkibiy birikmalar notoʻgʻri identifikatsiya qilindi. Xulosa. Ushbu maqolada biz UzUDT korpusi asosida qurilgan graflarga asoslangan neyron parsherni taqdim etdik. Oʻzbek tili morpho‑sintaktik jihatdan murakkab boʻlsa‑da, BiLSTM + biaffine arxitektura va MST dekoderdan iborat model qisqa gaplarda yuqori aniqlikka erishdi. Uzoq masofali bogʻlanishlar, non‑projective strukturalar va ma’nodosh munosabatlarni farqlash eng katta qiyinchiliklar bo‘lib qoldi. Kelajakdagi ishlarda quyidagi yoʻnalishlar rejalashtirilmoqda: • Transformator modellari. Oʻzbek tilidagi UzBERT va BERTbek kabi pre‑train qilingan modellardan foydalanib, konteksual embeddinglarni yanada kuchaytirish. • Korpusni kengaytirish. Qoʻshimcha qoʻlda belgilangan ma’lumotlar, dialoglar va ilmiy matnlar qoʻshish orqali korpusni minglab jumlalar bilan toʻldirish va modelni umumlashtirish. • Koʻp tillilik va transfer learning. Turk tillari oilasiga mansub boshqa korpuslar bilan birgalikda multitask oʻqitish orqali Oʻzbek tilida ayniqsa kam uchraydigan sintaktik konstruktsiyalarni yaxshiroq oʻrganish. • Semantik tahlilga kengaytirish. Annotatsiyalangan darajalarda semantik rol belgilash, belgisiz aniqlik (ambiguity)ni kamaytirish va tekislik (flat) tuzilmalarda ma’no tushunchalarini chiqarish. Maqolamiz Oʻzbek tili uchun neyron semantik tahlilning yangi yoʻnalishlarini ochib beradi hamda
138 “Al-Farg‘oniy avlodlari” elektron ilmiy jurnali ISSN 2181-4252. Tom: 1 | Son: 3 | 2025-yil "Descendants of Al-Farghani" electronic scientific journal. ISSN 2181-4252. Vol: 1 | Iss: 3 | 2025 year Электронный научный журнал "Потомки АльФаргани" ISSN 2181-4252. Том: 1 | Выпуск: 3 | 2025 год https://al-fargoniy.uz/ Universal bog‘liqlikning daraxtsimon korpuslari asosida tahlil qilishning samarali usulini namoyish etadi. Ushbu natijalar tilshunoslar va tabiiy tilni qayta ishlash tadqiqotchilari uchun foydali boʻlib, oʻzbek tilining chuqur semantik tasvirini yaratishda tayanch boʻlib xizmat qiladi. Foydalanilgan adabiyotlar. 1. A. Akhundjanova and L. Talamo, “Universal Dependencies Treebank for Uzbek,” in Proceedings of the Third Workshop on Resources and Representations for Under-Resourced Languages and Domains (Resourceful 2025), pp. 129–134. 2. Elmurod Kuriyozov, David Vilares, and Carlos Gómez-Rodríguez. 2024. BERTbek: A Pretrained Language Model for Uzbek. In Proceedings of the 3rd Annual Meeting of the Special Interest Group on Under-resourced Languages @ LRECCOLING 2024, pages 33–44, Torino, Italia. ELRA and ICCL. 3. Mansurov, B., Mansurov, A. (2021). UzBERT: pretraining a BERT model for Uzbek. arXiv preprint arXiv:2108.09814. 4. Arofat Akhundjanova, Furkan Akkurt, Bermet Chontaeva, Soudabeh Eslami, and Cagri Coltekin. 2025. Parallel Universal Dependencies Treebanks for Turkic Languages. In Proceedings of the Eighth Workshop on Universal Dependencies (UDW, SyntaxFest 2025), pages 129–136, Ljubljana, Slovenia. Association for Computational Linguistics. 5. Matlatipov, G., Vetulani, Z. (2009). Representation of Uzbek Morphology in Prolog. In: Marciniak, M., Mykowiecka, A. (eds) Aspects of Natural Language Processing. Lecture Notes in Computer Science, vol 5070. Springer, Berlin, Heidelberg. https://doi.org/10.1007/978-3-642-047350_4 6. M. S. Sharipov, H. S. Adinaev and E. R. Kuriyozov, "Rule-Based Punctuation Algorithm for the Uzbek Language," 2024 IEEE 25th International Conference of Young Professionals in Electron Devices and Materials (EDM), Altai, Russian Federation, 2024, pp. 2410-2414, doi: 10.1109/EDM61683.2024.10615061.