scieee AI-readable full text Open interactive document viewer

KATTA HAJMDAGI MA'LUMOTLARNI QAYTA ISHLASHDA PYTHON DASTURLASH TILI

Abduqodirova, Xurshidabonu Rustamjon qizi; Goyipov, U.G

Abstract

Ushbu maqolada katta hajmdagi ma’lumotlarni (Big Data) qayta ishlash jarayonlarida Python dasturlash tilining o‘rni, uning asosiy kutubxonalari va amaliy imkoniyatlari tahlil qilinadi. Maqolada Pandas, NumPy, Dask va PySpark kabi kutubxonalar orqali ma’lumotlarni tahlil qilish, tozalash hamda samarali ishlov berish jarayonlari yoritilgan. Pythonning moslashuvchanligi, ko‘p platformali imkoniyatlari va ochiq manba muhiti katta hajmdagi ma’lumotlar ustida ishlashni sezilarli darajada osonlashtiradi.

Full text

SCHOLAR ISSN: 2181-4147 VOLUME 3 | ISSUE 14 | 2025 https://t.me/openscholar Multidisciplinary Scientific Journal December, 2025 95 DOI: https://doi.org/10.5281/zenodo.17804026 KATTA HAJMDAGI MA’LUMOTLARNI QAYTA ISHLASHDA PYTHON DASTURLASH TILI Abduqodirova Xurshidabonu Rustamjon qizi Namangan davlat texnika universiteti, 3-kurs talabasi Ilmiy rahbar: U.G.Goyipov ANNOTATSIYA Ushbu maqolada katta hajmdagi ma’lumotlarni (Big Data) qayta ishlash jarayonlarida Python dasturlash tilining o‘rni, uning asosiy kutubxonalari va amaliy imkoniyatlari tahlil qilinadi. Maqolada Pandas, NumPy, Dask va PySpark kabi kutubxonalar orqali ma’lumotlarni tahlil qilish, tozalash hamda samarali ishlov berish jarayonlari yoritilgan. Pythonning moslashuvchanligi, ko‘p platformali imkoniyatlari va ochiq manba muhiti katta hajmdagi ma’lumotlar ustida ishlashni sezilarli darajada osonlashtiradi. Kalit so‘zlar: Python, Big Data, Ma’lumotlar tahlili, Pandas, Dask, PySpark PYTHON PROGRAMMING LANGUAGE FOR PROCESSING LARGE AMOUNTS OF DATA Abduqodirova Hurshidabonu Rustamjon qizi, Namangan State Technical University, 3rd-year student Academic Supervisor: U.G. Goyipov SCHOLAR ISSN: 2181-4147 VOLUME 3 | ISSUE 14 | 2025 https://t.me/openscholar Multidisciplinary Scientific Journal December, 2025 96 ABSTRACT This article analyzes the role of the Python programming language in the processing of Big Data, highlighting its main libraries and practical applications. The study focuses on data analysis, cleaning, and efficient processing using libraries such as Pandas, NumPy, Dask, and PySpark. Python’s flexibility, cross-platform compatibility, and open-source environment significantly simplify and enhance the handling of large-scale data. Key words: Python, Big Data, Data Analysis, Pandas, Dask, PySpark Kirish. Zamonaviy raqamli davrda ma’lumotlar hajmi keskin ortib bormoqda. Internet, ijtimoiy tarmoqlar, IoT qurilmalari va onlayn xizmatlar natijasida har soniyada terabaytlab ma’lumotlar yaratiladi. Ushbu ma’lumotlarni qayta ishlash, saqlash va tahlil qilish masalasi katta ahamiyat kasb etmoqda. Shu nuqtai nazardan, Python dasturlash tili o‘zining soddaligi, keng ekotizimi va boy kutubxonalari bilan katta hajmdagi ma’lumotlar bilan ishlashda eng qulay vositalardan biriga aylangan. Asosiy qism. Python dasturlash tili Big Data sohasida keng qo‘llaniladi. Uning asosiy afzalliklari: soddalik, kengaytirilgan kutubxonalar, integratsiya qulayligi va yuqori darajadagi moslashuvchanlikdir. Quyida Pythonning katta hajmdagi ma’lumotlarni qayta ishlashda ishlatiladigan ba’zi mashhur kutubxonalari ko‘rib chiqiladi. Python — katta hajmdagi (big data) ma’lumotlarni tahlil qilish va qayta ishlashda keng qo‘llaniladigan til: o‘rganilishi oson, boy ilmiy-ekosistemaga ega va ko‘plab «DataFrame» hamda tarqatilgan hisoblash (distributed computing) vositalarini taqdim etadi. Asosan ikki yo‘l: (1) bir mashinada out-of-core / memory-mapped yondashuvlar (Vaex, Polars, DuckDB), (2) klaster ustida tarqatilgan hisoblash (PySpark, Dask, Ray). Pandas — Python ma’lumotlarni tahlil qilishning de-fakto standarti; lekin katta hajm uchun cheklangan (xotiraga sig‘adi). Asosiy tushuncha va API Pandas’dan kelib chiqadi. SCHOLAR ISSN: 2181-4147 VOLUME 3 | ISSUE 14 | 2025 https://t.me/openscholar Multidisciplinary Scientific Journal December, 2025 97 Dask — Pandas-uyumlilikni saqlagan holda bloklash va task-scheduling orqali tarqatilgan/parallel hisoblashni taklif etadi; kichik va o‘rta klasterlarda yaxshi ishlaydi. PySpark (Apache Spark Python API) — juda katta hamda korporativ hajmlar (TB — PB) uchun mo‘ljallangan tarqatilgan hisoblash platformasi; Java/Scala aslida yozilgan, lekin Python API orqali keng qo‘llanadi. Vaex — out-of-core, memory-mapped, lazy-evaluation bilan juda katta (hatto milliard qatorli) DataFrame’larni interaktiv tahlil qilishga mo‘ljallangan. Modin — Pandas API’ni parallel/taqsimlangan tarzda (Ray yoki Dask orqasida) tezlashtirishga urinadi; ko‘chirish (drop-in) uchun qulay. Ray — umumiy maqsadli tarqatilgan hisoblash platformasi, ML/serving uchun yaxshi integratsiya; Dask bilan solishtirganda ML pipeline’lariga yo‘naltirilgan. Polars / DuckDB — yangi avlod DataFrame/analitik dvigatellari: Polars — Rust asosida juda tez, DuckDB — kolonkali OLAP sorovlar uchun yengil ichki DB; ko‘plab 1B-row benchmark’larda yaxshi natija ko‘rsatmoqda (ko‘pincha Pandas/Dask’dan tezroq). Agar ma’lumot xotiraga sig‘sa va interaktiv tahlil kerak bo‘lsa — Pandas / Polars / DuckDB. Agar bir mashinada, ammo xotiradan oshib ketadigan hajmlar bilan tezkor tahlil kerak bo‘lsa — Vaex yoki out-of-core Polars/DuckDB. Agar klaster va korporativ miqyos (TB/PB) — PySpark (yoki Spark’ga asoslangan muhitlar). Agar Python-ecosystem va ML pipeline’lari/ eksperimentatsiyaga orientatsiya bo‘lsa, kichikdan o‘rta klastergacha — Dask yoki Ray yaxshi variant. Spark — ancha skalalanadi, ammo kichik ishlar uchun overhead kattaroq; Dask ko‘pincha kichik/orta hajmlarda tezroq va yengilroq bo‘ladi. Benchmarks va 1B-row testlarda Dask va yangi dvigatellar (DuckDB, Polars) yaxshi natija ko‘rsatgan holatlar mavjud. Out-of-core va memory-mapping (Vaex) real-time interaktiv tahlil uchun samarali; bunday yechimlar diskga asoslangan bo‘lsa ham, I/O va kolonnali formatlar (Parquet, Arrow) — kalit rol o‘ynaydi. SCHOLAR ISSN: 2181-4147 VOLUME 3 | ISSUE 14 | 2025 https://t.me/openscholar Multidisciplinary Scientific Journal December, 2025 98 Ma’lumot formatini optimallashtirish (Parquet/Feather/Arrow) + kolonnali saqlash + to‘g‘ri partitioning/filtrlash — ko‘p hollarda eng katta tezlik oshishini beradi. (Manbalar: kutubxona doc’lari va benchmark maqolalar). 1-rasm. Ma’lumot hajmi va ishlov berish vaqti o‘rtasidagi bog‘liqlik grafigi Amaliy misol. Quyidagi kod misolida Pandas kutubxonasi yordamida savdo ma’lumotlarini tahlil qilish jarayoni ko‘rsatilgan: import pandas as pd # CSV fayldan ma’lumotlarni o‘qish data = pd.read_csv(‘sales_data.csv’) # Ma’lumotlarni umumlashtirish summary = data.groupby(‘region’)[‘sales’].sum() print(summary) SCHOLAR ISSN: 2181-4147 VOLUME 3 | ISSUE 14 | 2025 https://t.me/openscholar Multidisciplinary Scientific Journal December, 2025 99 Natijalar. Tadqiqotlar shuni ko‘rsatadiki, Python dasturlash tili katta hajmdagi ma’lumotlarni qayta ishlashda nafaqat qulay, balki samarali hamdir. Dask va PySpark kabi vositalar orqali parallel hisoblashlarni amalga oshirish, Pandas orqali esa ma’lumotlarni tez tahlil qilish imkoniyati mavjud. Xulosa. Python dasturlash tili katta hajmdagi ma’lumotlarni qayta ishlashda o‘zining soddaligi, qulay sintaksisi va boy kutubxonalari bilan eng mashhur dasturlash tillaridan biri hisoblanadi. U orqali real vaqt rejimida ma’lumotlarni tahlil qilish, vizualizatsiya va model yaratish imkoniyatlari mavjud bo‘lib, zamonaviy texnologiyalarni rivojlantirishda muhim ahamiyat kasb etadi. FOYDALANILGAN ADABIYOTLAR 1. Хан Дж., Камбер М., Пэй Дж. Методы интеллектуального анализа данных. — Москва: Вильямс, 2014. — 752 с. 2. Зыков С. А., Емельянов В. В. Большие данные: методы и средства обработки. — Москва: МИЭМ, 2018. — 316 с. 3. Маккинни У. Python и анализ данных. — Санкт-Петербург: Питер, 2018. — 624 с. 4. Лутц М. Изучаем Python. 4-е изд. — Санкт-Петербург: Символ-Плюс, 2020. — 1600 с. 5. Нургалиев И. Т., Алиев Т. И. Большие данные и машинное обучение. — Казань: КФУ нашр, 2021. — 412 с. 6. Фергюсон Р. Большие данные: революция, которая изменит то, как мы живём. — Москва: АСТ, 2017. — 352 с. 7. Белов Ю. А., Поляков А. В. Технологии обработки больших данных : учеб. пособие. — Москва: МГТУ им. Баумана, 2019. — 210 с.