O'RGATUVCHI TANLAMA: TRAIN, VALIDATION VA TEST SETLARI
Full text
YOSH OLIMLAR ILMIY-AMALIY KONFERENSIYASI in-academy.uz/index.php/yo 141 O’RGATUVCHI TANLAMA: TRAIN, VALIDATION VA TEST SETLARI ОБУЧАЮЩАЯ ВЫБОРКА: ОБУЧАЮЩИЙ, ВАЛИДАЦИОННЫЙ И ТЕСТОВЫЙ НАБОРЫ TRAINING SAMPLE: TRAIN, VALIDATION AND TEST SETS Tojimamatov Israil Nurmamatovich Farg‘ona Davlat Universiteti Amaliy matematika va informatika kafedrasi katta o’qituvchisi E-mail: [email protected] Sharipova Shohsanam Shokirjon qizi Farg‘ona Davlat Universiteti Amaliy matematika yoʻnalishi 3-bosqich 23.09-guruh talabasi E-mail: [email protected] https://doi.org/10.5281/zenodo.17999952 Annotatsiya: Ushbu maqola mashina o‘rganish jarayonida ma’lumotlarni training (o‘rgatuvchi), validation (tekshiruvchi) va test (sinov) setlarga bo‘lishning nazariy va amaliy jihatlarini yoritadi. Har bir setning asosiy vazifalari, ulardan foydalanish tamoyillari va model sifatiga ko‘rsatadigan ta’siri chuqur tahlil qilinadi. Shuningdek, maqolada ma’lumotlarni foizlar bo‘yicha optimal taqsimlash, overfitting va underfitting muammolarining oldini olish, model umumlashma qobiliyatini oshirish bo‘yicha metodlar ko‘rib chiqiladi. Turli ML algoritmlari uchun setlarni shakllantirish bo‘yicha tavsiyalar ham keltiriladi. Ushbu mavzu mashina o‘rganish loyihalarida ishonchli natijaga erishish uchun muhim nazariy asos bo‘lib xizmat qiladi. Kalit so‘zlar: Mashina o‘rganish,Ma’lumotlar to‘plami,O‘rgatuvchi tanlama (Training set),Tekshiruvchi tanlama (Validation set),Sinov tanlamasi (Test set),Modelni o‘qitish jarayoni,Overfitting (ortiqcha moslashish),Underfitting (kam moslashish),Umumlashma qobiliyati,Ma’lumotlarni taqsimlash,Hyperparameter tuning,Model baholash,Crossvalidation,Test natijalarining aniqligi,Model tanlash (Model selection),O‘qitish jarayonidagi xatoliklar,Epoch, batch size,Ma’lumotlar balansligi,Ma’lumotlarni oldindan qayta ishlash (Preprocessing),Performance metrics (aniqlik, F1-score, recall, precision),Machine learning pipeline,Data splitting strategy. Аннотация: В данной статье подробно рассматривается процесс разделения данных в машинном обучении на training (обучающую), validation (валидационную) и test (тестовую) выборки. Раскрываются их функции, принципы применения и влияние на итоговое качество модели. Особое внимание уделяется вопросам оптимального распределения данных, предотвращению переобучения и недообучения, а также повышению способности модели к обобщению. В статье представлены рекомендации по формированию наборов данных для различных типов ML-алгоритмов, обсуждаются практические проблемы и современные подходы к их решению. Материал служит важной теоретической и практической основой для построения надежных моделей машинного обучения. Ключевые слова: Машинное обучение,Набор данных,Обучающая выборка (Training set),Валидационная выборка (Validation set),Тестовая выборка (Test set),Процесс обучения модели,еобучение (Overfitting),Недообучение
YOSH OLIMLAR ILMIY-AMALIY KONFERENSIYASI in-academy.uz/index.php/yo 142 (Underfitting)Способность к обобщению,Разделение ,данныхНастройка гиперпараметров,Оценка модели,Кросс-валидация,Точность тестирования,Выбор модели,Ошибки обучения,Эпоха, размер батчаБаланс данных,Предварительная обработка данных,Метрики эффективности (accuracy, F1-score, recall, precision),Конвейер машинного обучения (ML pipeline),Стратегии разделения данных. Annotation: This article provides an in-depth overview of the process of splitting data into training, validation, and test sets in machine learning. It explains their individual roles, the principles behind their usage, and how they impact overall model performance. The paper discusses optimal data-splitting ratios, techniques to prevent overfitting and underfitting, and strategies for improving model generalization. It also offers recommendations for constructing these datasets for various types of ML algorithms and highlights common challenges experienced in practice. This topic forms a crucial theoretical and practical foundation for building reliable and accurate machine learning models. Keywords: Machine learning,Dataset,Training set, Validation set, Test set, Model training process, Overfitting, Underfitting Generalization ability, Data splitting,Hyperparameter tuning, Model evaluation, Cross-validation, Test accuracy,Model selection, Training errors,Epoch, batch size, Data balance, Data preprocessing, Performance metrics (accuracy, F1-score, recall, precision), Machine learning pipeline,Data splitting strategy. Kirish So‘nggi o‘n yilliklarda sun’iy intellekt va mashina o‘rganish texnologiyalari ilm-fan, sanoat, tibbiyot, transport, moliya, ta’lim va boshqa ko‘plab sohalarda muhim o‘rin egallab, inson faoliyatining turli jabhalarini avtomatlashtirish va samaradorligini oshirish imkoniyatini berdi. Bu texnologiyalar katta hajmdagi ma’lumotlar (big data) bilan ishlash, murakkab naqshlarni aniqlash va prognozlar tuzish imkoniyatini yaratadi. Shu bilan birga, mashina o‘rganish modellarining muvaffaqiyati ko‘pincha ularga beriladigan ma’lumotlar sifatiga, ularning to‘g‘ri taqsimlanishiga va o‘qitish jarayonining nazoratga olinishiga bog‘liq. Mashina o‘rganishning samarali ishlashi uchun ma’lumotlar odatda uch asosiy qismga ajratiladi: o‘rgatuvchi tanlama (training set), tekshiruvchi tanlama (validation set) va sinov tanlamasi (test set). Har bir setning o‘ziga xos vazifasi va ahamiyati mavjud bo‘lib, ular birgalikda modelni o‘qitish, sozlash va baholash jarayonini tizimli ravishda tashkil qiladi. O‘rgatuvchi tanlama (training set) — modelni o‘qitishning asosiy manbai bo‘lib, unda model naqshlar va bog‘lanishlarni o‘rganadi, parametrlarni moslashtiradi va ichki vaznlarni (weights) optimallashtiradi. Shu orqali model ma’lumotlarning ichki tuzilishini va xususiyatlar orasidagi munosabatlarni tahlil qiladi. Tekshiruvchi tanlama (validation set) — model o‘qitish jarayonida uning ish faoliyatini nazorat qilish, hyperparametrlarni optimallashtirish va overfitting (ortiqcha moslashish) yoki underfitting (kam moslashish) kabi muammolarni aniqlash uchun ishlatiladi. Validation set yordamida turli model arxitekturasi variantlari solishtiriladi va eng samarali model tanlanadi. Sinov tanlamasi (test set) — model to‘liq o‘qitilgach, uning yangi va ilgari ko‘rilmagan ma’lumotlarga nisbatan umumlashma qobiliyatini mustaqil baholash uchun ajratiladi. Bu tanlama modelning haqiqiy hayotdagi ishlash samaradorligini, aniqligi va barqarorligini o‘lchashda hal qiluvchi rol o‘ynaydi. Ma’lumotlarni uch qismga ajratish bir qator muhim masalalarni hal qilish imkonini beradi:
YOSH OLIMLAR ILMIY-AMALIY KONFERENSIYASI in-academy.uz/index.php/yo 143 • modelning ortiqcha moslashish va kam moslashish holatlarini nazorat qilish; • ma’lumotlar balansini saqlash va tabaqalashgan taqsimot (stratification)ni ta’minlash; • ma’lumotlar yetishmovchiligi va shovqinli ma’lumotlar bilan ishlash; • turli algoritmlar uchun optimal taqsimot strategiyasini aniqlash; • mashina o‘rganish jarayonining nazoratli va ilmiy asoslangan bo‘lishini ta’minlash. Shu sababli, training, validation va test setlarning to‘g‘ri tashkil etilishi mashina o‘rganish jarayonining asosiy poydevorini tashkil qiladi va modelning umumlashma qobiliyati, aniqligi hamda barqarorligini oshirishda hal qiluvchi ahamiyatga ega. Ushbu maqolada ma’lumotlarni uch qismga ajratishning nazariy asoslari, har bir setning vazifalari, ularning mashina o‘rganish modellariga ta’siri, optimal taqsimot strategiyalari va zamonaviy ML amaliyotida qo‘llaniladigan ilg‘or yondashuvlar keng va chuqur tahlil qilinadi. Shuningdek, maqolada amaliy misollar, turli algoritmlar uchun mos yondashuvlar va mashina o‘rganish jarayonida uchraydigan muammolar ham ko‘rib chiqiladi. Mazkur kirish qismi mavzuni ilmiy asosda keng qamrovli tarzda yoritadi va maqolaning keyingi bo‘limlari uchun mustahkam poydevor yaratadi. Xulosa Mashina o‘rganish jarayonida ma’lumotlarni o‘rgatuvchi (training), tekshiruvchi (validation) va sinov (test) tanlamalariga ajratish modelning umumiy sifatini belgilovchi eng muhim bosqichlardan biridir. Ushbu tanlamalarning har biri o‘ziga xos vazifani bajarib, modelning to‘g‘ri o‘qitilishi, optimal sozlanishi va real sharoitda ishonchli ishlashini ta’minlaydi. O‘rgatuvchi tanlama modelning bilim manbai sifatida uning ichki tuzilishini o‘rgatadi; tekshiruvchi tanlama modelni nazorat qilish, hyperparametrlarni tanlash va ortiqcha moslashishni oldini olishda muhim vosita bo‘lib xizmat qiladi; sinov tanlamasi esa modelning haqiqiy samaradorligini baholashda ishonchli mezon vazifasini bajaradi. Ma’lumotlarning to‘g‘ri taqsimlanishi mashina o‘rganish modellarining aniqligi, barqarorligi va umumlashma qobiliyatini keskin oshiradi. Aksincha, noto‘g‘ri taqsimot modelning haddan tashqari moslashib ketishiga, real ma’lumotlarda yomon natija berishiga yoki umuman o‘rganmasligiga olib keladi. Shuningdek, stratifikatsiya, ma’lumotlarning balansini ta’minlash, shovqinlarni kamaytirish, ma’lumotlar yetishmovchiligi kabi masalalarni ilmiy yondashuv bilan hal qilish model samaradorligini yanada mustahkamlaydi. Zamonaviy ML amaliyotida training, validation va test setlarga ajratishning turli ilg‘or metodlari — cross-validation, nested validation, hold-out validation, k-fold validation va uyg‘unlashtirilgan yondashuvlar — model sifatini oshirishda keng qo‘llaniladi. Bu usullar nafaqat optimal natijaga erishish, balki modelning real sharoitda qanday ishlashini oldindan baholash imkonini yaratadi. Umuman olganda, ma’lumotlarni mazkur uchlik asosida taqsimlash mashina o‘rganish jarayonining ilmiy jihatdan asoslangan, nazoratli va samarali tashkil etilishiga xizmat qiladi. Ushbu yondashuv modelni barqaror, aniqligi yuqori va umumlashtirish qobiliyati kuchli bo‘lishiga yordam beradi. Natijada, machine learning texnologiyalarining amaliy qo‘llanilishi yanada ishonchli va samarali bo‘ladi hamda real hayotdagi murakkab masalalarni hal qilish imkoniyatlari kengayadi.
YOSH OLIMLAR ILMIY-AMALIY KONFERENSIYASI in-academy.uz/index.php/yo 144 Adabiyotlar, References, Литературы: 1. Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press. (Mashina o‘rganish va chuqur o‘rganish bo‘yicha asosiy qo‘llanma.) 2. Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer. (Training/validation/test setlar, statistika va model baholash bo‘yicha fundamental asar.) 3. Murphy, K. P. (2012). Machine Learning: A Probabilistic Perspective. MIT Press. (Probabilistik modellar, overfitting, cross-validation haqida keng tahlil.) 4. Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning. Springer. (Mashina o‘rganishda ma’lumotlarni ajratish, baholash va optimallashtirish metodlari.) 5. Géron, A. (2019). Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow.O’Reilly Media. (Amaliy o‘qitish, validation strategiyalari va test setlar bilan ishlash bo‘yicha qo‘llanma.) 6. Kuhn, M., & Johnson, K. (2013). Applied Predictive Modeling. Springer. (Validation set, test set va model baholash metodlari bo‘yicha chuqur yondashuv.) 7. Raschka, S., & Mirjalili, V. (2017). Python Machine Learning. Packt Publishing. (Model ta’limi, test setlar va cross-validationning amaliy qo‘llanilishi.) 8. Zhang, Y., & Yang, Q. (2021). A Survey on Model Selection and Hyperparameter Tuning.