scieee AI-readable full text Open interactive document viewer

БИНАРНАЯ ДЕТЕКЦИЯ РАСТИТЕЛЬНЫХ ОБЪЕКТОВ С ИСПОЛЬЗОВАНИЕМ ГЛУБОКИХ НЕЙРОННЫХ СЕТЕЙ

БОТОВ, МИХАИЛ ЕВГЕНЬЕВИЧ; КУЧЕРЯВЫХ, НИКОЛАЙ СЕРГЕЕВИЧ

Abstract

Статья посвящена разработке метода автоматической детекции сельскохозяйственных культур и сорняков на основе глубокого обучения для систем точного земледелия. В работе представлена методология обучения глубоких нейронных сетей для задачи одновременной детекции и классификации множественных видов растений. Выполнены: сбор и аннотация репрезентативного датасета; адаптация и тонкая настройка предобученных детекторов; экспериментальное сравнение их эффективности. Ключевые результаты включают достигнутые значения средней точности ([email protected]) и анализ характерных ошибок (ложные срабатывания, пропуски, путаница классов). Полученные модели предлагаются как инструмент для поддержки решений в агрономии и экологических исследованиях.

Full text

Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 69 http://nauko-sfera.ru/ ИНФОРМАЦИОННЫЕ ТЕХНОЛОГИИ УДК 004.852 DOI 10.5281/zenodo.17452587 Научная статья БИНАРНАЯ ДЕТЕКЦИЯ РАСТИТЕЛЬНЫХ ОБЪЕКТОВ С ИСПОЛЬЗОВАНИЕМ ГЛУБОКИХ НЕЙРОННЫХ СЕТЕЙ BINARY DETECTION OF PLANT OBJECTS USING DEEP NEURAL NETWORKS БОТОВ МИХАИЛ ЕВГЕНЬЕВИЧ, техник, «Ресурсный центр робототехники»; Донской государственный технический университет. КУЧЕРЯВЫХ НИКОЛАЙ СЕРГЕЕВИЧ, программист научно-исследовательской лаборатории, «Интеллектуальные электрические сельскохозяйственные машины и комплексы»; Донской государственный технический университет. BOTOV MIKHAIL EVGENYEVICH, technician, «Robotics Resource Centre»; Don State Technical University. KUCHERYAVYKH NIKOLAI SERGEYEVICH, programmer of the scientific research laboratory, «Intelligent electric agricultural machines and complexes»; Don State Technical University. Статья посвящена разработке метода автоматической детекции сельскохозяйственных культур и сорняков на основе глубокого обучения для систем точного земледелия. В работе представлена методология обучения глубоких нейронных сетей для задачи одновременной детекции и классификации множественных видов растений. Выполнены: сбор и аннотация репрезентативного датасета; адаптация и тонкая настройка предобученных детекторов; экспериментальное сравнение их эффективности. Ключевые результаты включают достигнутые значения средней точности ([email protected]) и анализ характерных ошибок (ложные срабатывания, пропуски, путаница классов). Полученные модели предлагаются как инструмент для поддержки решений в агрономии и экологических исследованиях. The article is devoted to the development of a method for automatic detection of crops and weeds based on deep learning for precision farming systems. The paper presents a methodology for training deep Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 70 http://nauko-sfera.ru/ neural networks for the task of simultaneous detection and classification of multiple plant species. Performed: collection and annotation of a representative dataset; adaptation and fine-tuning of pre-trained detectors; experimental comparison of their effectiveness. The key results include the achieved values of average accuracy ([email protected]) and analysis of characteristic errors (false positives, omissions, class confusion). The resulting models are offered as a tool for decision support in agronomy and environmental research. Ключевые слова: детектирование, классификация, сверточная нейронная сеть (CNN), точность, аугментация. Key words: detection, classification, convolutional neural network (CNN), accuracy, augmentation. втоматическая идентификация и локализация различных видов растений на изображениях представляют собой фундаментальную задачу компьютерного зрения с широким спектром практических приложений [3]. В сельском хозяйстве это необходимо для мониторинга состояния посевов, точного учета урожайности, раннего обнаружения болезней и сорняков в системах точного земледелия. В экологии и ботанике автоматическая детекция растений критически важна для оценки биоразнообразия, картирования растительных сообществ, мониторинга инвазивных видов и изучения динамики экосистем. Традиционные методы, основанные на ручном сборе данных или применении спектральных индексов, часто оказываются трудоемкими, масштабируемыми с ограничениями и недостаточно точными для различения близкородственных видов в сложных естественных сценах. Научная новизна исследования заключается в том, что был разработан и проверен на практике целостный подход к обучению нейросети для распознавания именно сельскохозяйственных растений — ростков кукурузы и сорняков — в реальных полевых условиях. Вместо того чтобы просто использовать готовую модель, был построен процесс, который постоянно улучшал ее точность. Сначала был применен метод «авторазметки с последующей проверкой человеком», что позволило быстро и качественно увеличить базу данных для обучения с 350 до 2000 изображений. Затем прошел эксперимент с разными версиями нейросетей — YOLOv8n и YOLOv11n — и была выбрана та, что показала себя лучше для нашей задачи. Наконец, было использовано не просто стандартное увеличение данных (аугментацию), но и подобраны специальные настройки, которые имитируют реальные сложности: менялись цвета, наклонялись изображения и собирались в мозаику. Это помогло научить модель уверенно работать с разным освещением, ракурсами и фоном. Такой поэтапный и продуманный подход и составляет основную новизну нашей работы. Задача детекции растительных объектов сопряжена с рядом существенных сложностей [10]: 1. Высокая внутриклассовая вариабельность: особи одного вида могут значительно различаться по размеру, форме, цвету и текстуре в зависимости от стадии роста, условий освещения, угла съемки и состояния здоровья. 2. Межклассовое сходство: многие виды растений, особенно в пределах одного рода или семейства, обладают визуально схожими признаками (листья, цветы), что затрудняет их различение. 3. Сложные фоны и окклюзии: растения часто снимаются в естественной среде с перекрывающими их элементами (другие растения, почва, камни, тени), создающими шум и затрудняющими точную сегментацию и локализацию объекта. 4. Масштабируемость: для одновременного обнаружения и классификации широкого спектра видов необходимы модели, которые способны надежно обобщать информацию, будучи обученными на обширных и разнородных данных. Традиционные алгоритмы обработки изображений, основанные на ручном конструировании признаков (например, цветовые гистограммы, текстуры, контуры), демонстрируют А Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 71 http://nauko-sfera.ru/ ограниченную эффективность в решении этих проблем, особенно при увеличении числа классов и сложности сцен. Глубокие нейронные сети (ГНС), и, в особенности, сверточные нейронные сети (Convolutional Neural Networks, CNN), совершили революцию в области компьютерного зрения, продемонстрировав выдающиеся результаты в задачах классификации, детекции и сегментации объектов. Их ключевое преимущество заключается в способности автоматически извлекать иерархические и репрезентативные признаки непосредственно из данных в процессе обучения, что делает их чрезвычайно мощным инструментом для анализа сложных визуальных сцен, характерных для ботанических изображений [5–6]. Архитектуры детекторов объектов, такие как Faster R-CNN, YOLO (You Only Look Once), SSD (Single Shot MultiBox Detector) и их современные модификации, доказали свою эффективность в локализации и классификации множества объектов на изображении, что напрямую соответствует требованиям задачи детекции растений [11]. Выбор архитектуры модели был обусловлен задачами детекции и семантической сегментации изображений. Для решения данных задач была выбрана архитектура YOLO ввиду ее признанной эффективности и высоких показателей скорости и точности при обработке изображений в реальном времени. В качестве основы использовалась предобученная модель. Работа модели была реализована на языке программирования Python с применением специализированных библиотек для глубокого обучения. Ключевым этапом исследования являлось создание репрезентативного аннотированного набора данных (датасета). Датасет включает изображения, содержащие целевые объекты — различные виды растений, подлежащие распознаванию. Создание датасета началось с нахождения необходимых изображений в сети Интернет. Изначально было найдено и аннотированы около 100 фотографий для первоначального обучения модели. После этого было снято видео (1920*1080 пикселей, 30 кадров в секунду) на поле, на котором будут проводиться в дальнейшем испытания. Видео было снято под разными ракурсами и изначально в дневную, солнечную погоду. После этого видео было разложено на кадры, которые уже и аннотировались. Данные были разделены на обучающую и валидационную выборки случайным образом, но так, чтобы количество изображений в валидационной выборке составляло 20 % от общего числа изображений. Аннотации для каждого изображения были подготовлены в формате, соответствующем требованиям архитектуры YOLO: для каждого объекта на изображении в отдельном текстовом файле (.txt) указан идентификатор класса и нормализованные координаты ограничивающего прямоугольника (bounding box). Для процесса аннотирования использовался инструмент с открытым исходным кодом LabelImg. Пример аннотированного изображения представлен на рис. 1 [1]. Рис. 1. Пример аннотированного изображения с выделенными объектами Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 72 http://nauko-sfera.ru/ В рамках исследования был аннотирован датасет, содержащий 350 изображений. Целевыми объектами выступали ростки кукурузы и сорные растения (объединенные в общий класс «сорняк»), что соответствует постановке задачи бинарной классификации для последующего применения в системах автоматизированного мониторинга сельскохозяйственных полей. Для проведения экспериментов были импортированы библиотеки ultralytics (предоставляющая реализации моделей YOLO различных поколений) и torch (фреймворк для работы с тензорными операциями и ускорения вычислений на GPU) [2; 8]. Была выбрана специфичная конфигурация модели — YOLOv8n (nano), как компактная и эффективная архитектура восьмого поколения. Программный код для обучения включал в себя задание ключевых гиперпараметров:  количество эпох обучения (epochs);  размер пакета (batch size);  путь к директории с обучающими и валидационными данными;  разрешение входных изображений (imgsz);  имя сохраняемой версии модели. В результате обучения была получена модель, способная детектировать и классифицировать ростки кукурузы и сорные растения [9]. В процессе обучения фреймворк автоматически фиксировал и логировал метрики качества, включая кривые обучения (loss curves), precision-recall кривые, а также такие показатели, как mean Average Precision (mAP) и Intersection over Union (IoU), что предоставляет исчерпывающую информацию для оценки работоспособности и сходимости модели (рис. 2). В данном случае можно увидеть, что модель плохо определяет bounding box (box_loss примерно равен 0,7), присутствует довольно большой процент ложных срабатываний (precision примерно равен 0,9). При этом может показаться, что модель имеет большую точность, т.к. метрика mAP50 равна 0,8, но видно, что модель в данном случае явно не закончила свое обучение и метрики могли бы еще вырасти. Поэтому было принято решение увеличить число эпох и изображений. Рис. 2. Графики метрик первого обучения Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 73 http://nauko-sfera.ru/ После этого был начат процесс автообучения с человеческим контролем. Для этого было записано еще одно видео в более позднее время, так как необходимо считывать видеопоток с камер, установленных на движущемся объекте именно на этом поле, поэтому было важно, чтобы нейросеть смогла верно определить растения на данной почве при разном освещении и при различной высоте растений. Из данного видео было получено около 1700 изображений поля с актуальными данными. Было несколько вариантов решения данной задачи: первый — написать код для авторазметки, после чего загрузить данные в LabelImg и вручную исправлять их; второй — воспользоваться готовым решением с открытым исходным кодом при использовании онлайн-платформы CVAT. Был выбран второй вариант из-за своей простоты. После этого было размечено в общей сложности 2000 фотографий с полей кукурузы и было выполнено дообучение модели на базе YOLOV8N. Для повышения точности работы нейронной сети было решено перейти на модель YOLOV11N. Переход осуществлялся заменой строчки в программном коде. Данное решение было принято в связи с более высокими показателями mAP, более высокой эффективностью и скоростью работы. Выводы о точности работы двух моделей можно сделать из графика, представленном на рисунке 3. В итоге были получены графики метрик второго обучения нейронной сети (рис. 4). На данных метриках видно, что модель «чувствует себя более уверенно», т. к. метрики выросли и стабилизировались, но при этом заметны признаки переобучения модели, а значит, что модель «запомнила» данные, и ее способность обобщать ухудшается. Данный признак обозначает, что необходимо либо уменьшать число эпох, либо изменять изображения (затенять или засветлять, масштабировать, поворачивать и т. д.) для усложнения условий обучения. Рис. 3. Сравнительный график двух моделей YOLO После перехода модели на более новую версию для повышения точности была добавлена аугментация изображений при обучении. Аугментация в данном контексте — это изменение параметров изображения. Например, изменение яркости или контраста изображения будет являться аугментацией. Для того чтобы добавить аугментацию в программный код были добавлены следующие строчки: hsv_v, hsv_s, hsv_h, shear, mosaic. Первые 3 параметра отвечают за цветокоррекцию фото, параметр shear искажает изображение по осям x и y, со- Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 74 http://nauko-sfera.ru/ храняя при этом параллельные линии, а параметр mosaic объединяет куски разных изображений из тренировочного датасета в одно фото [7–8]. Рис. 4. Графики метрик второго обучения После добавления аугментации увеличилась точность работы нейросети, графики метрик показаны на рис. 5. Рис. 5. Графики метрик после обучения с использованием аугментации Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 75 http://nauko-sfera.ru/ Визуально график стал менее плавным, что является нормой, т. к. была использована аугментация. При этом метрики слегка снизились, что свидетельствует о том, что модель можно еще дообучить для получения большей точности. Итоговая модель, полученная на данном этапе, имеет следующие характеристики: mAP50 = 0,89, mAP = 0,65, precision = 0,9, recall = 0,78. Данная нейросеть уже способна обрабатывать информацию на видео практически без потери в скорости и качестве. Для обработки видеопотока достаточно представить видео в виде последовательности фото (чем оно и является), тогда остается создать цикл с обработкой каждого кадра видео [4]. В данной работе было проведено исследование, направленное на разработку и оценку эффективности методов глубокого обучения для решения задачи детекции растительных объектов. В качестве базового подхода были выбраны архитектуры семейства YOLO, показавшие наилучшее соотношение скорости и точности в задачах детекции в реальном времени. В ходе исследования была собрана и аннотирована база изображений, именуемая датасет, содержащая изображения ростков кукурузы и сорняков в разных условиях освещенности, фона и стадиях роста. Для борьбы с проблемой ограниченного объема данных успешно применялись методы аугментации. Таким образом, результаты работы подтверждают перспективность использования глубоких нейронных сетей для автоматизированного мониторинга состояния агрокультур, точного земледелия и роботизации сельскохозяйственных процессов. Основными направлениями для будущих исследований являются: увеличение датасета за счет изображений с дронов и спутников, эксперименты с другими, а также разработка механизмов для более точного распознавания слабоконтрастных и перекрывающихся объектов. СПИСОК ЛИТЕРАТУРЫ 1. Вильданов А. Н. Генерация датасетов для учебных задач компьютерного зрения // ИВД. 2023. №4 (100). 2. Друки А.А., Спицын В.Г., Аркалыков Е.У. Алгоритмы семантической сегментации снимков земной поверхности на основе нейронных сетей // Вестн. Том. гос. ун-та. Управление, вычислительная техника и информатика. 2020. №51. С. 72–78. DOI 10.17223/19988605/51/8. 3. Иванов К. В., Астафьев Н. Д., Долгова Т. Г. Преимущества компьютерного зрения // Актуальные проблемы авиации и космонавтики. 2022. Т. 2. С. 401–403. 4. Истратова Е. Е., Достовалов Д. Н., Бухамер Е. А. Разработка интеллектуальной системы для распознавания лиц на основе нейронных сетей // International Journal of Open Information Technologies. 2021. №4. С. 41–45. 5. Клименко В.А., Лебедев В.А. Компьютерное зрение: современное состояние и методы применения // Современные проблемы геометрического моделирования и информационные технологии. 2024. С. 178–183. 6. Костырко В.В. Обзор нейронных сетей: основные принципы работы, типы нейронных сетей, применение в области безопасности // Интеллектуальные ресурсы – региональному развитию. 2024. №2. С. 512–517. 7. Неваленная Ю.В. Аугментация данных для задачи сегментации колеи // Автоматика, связь, информатика. 2020. №8. С. 39–41. 8. Подробные руководства по Ultralytics YOLO: https://docs.ultralytics.com/ru/guides/ (дата обращения: 09.10.2025). 9. Фролов С.Н., Щитов А.Н. Принципы настройки гиперпараметров нейронной сети для прогнозирования возможных состояний сети из малых космических аппаратов // Инфокоммуникации и космические технологии: состояние, проблемы и пути решения. 2024. С. 382–393. Наукосфера. №10 (2), 2025 Информационные технологии ISSN 2542-0402 76 http://nauko-sfera.ru/ 10. Шевченко В.Д., Марьенков А.Н., Ханова А.А. Анализ методов компьютерного зрения для выявления запрещенной символики на изображениях в сети интернет // Прикаспийский журнал: управление и высокие технологии. 2022. №2 (58). С. 9–18. DOI 10.54398/20741707_2022_2_9. 11. Яковлев Г.Е. Распознавание образов с помощью искусственного интеллекта // Вестник Ессентукского института управления, бизнеса и права. 2023. №20. С. 154–174. Поступила в редакцию: 14.10.2025 © Ботов М. Е., Кучерявых Н. С., 2025. Принята в печать: 25.11.2025