A COMPARATIVE ANALYSIS OF COMPUTER VISION METHODS FOR THE AUTOMATED COUNTING OF OBJECTS ON SYNTHETIC IMAGES WITH VARIABLE DENSITY AND OVERLAYS
A COMPARATIVE ANALYSIS OF COMPUTER VISION METHODS FOR THE AUTOMATED COUNTING OF OBJECTS ON SYNTHETIC IMAGES WITH VARIABLE DENSITY AND OVERLAYS
Abstract
The work presents a comparative analysis of implementations of computer vision methods for the automated counting of objects on synthetic images characterised by varying densities, sizes and partial occlusion of objects. The research focuses on applied tasks in the visual monitoring of biological resources, where it is necessary to evaluate the number of objects in dense scenes and where individual instances are not fully visible.
Four methods were examined: connected component segmentation, a heuristic approach based on Harris corner detector, the RegressCNN regression convolutional neural network, and the YOLOv8n object detection model. A single synthetic dataset comprising 95,090 images was used to train the neural network models. Final validation was carried out on a separate test set comprising 6,030 images, which was not included in the training set and contained scenes with varying densities, aspect ratios, size distributions and object overlaps.
The mean absolute error (MAE) was chosen as the primary comparison metric, as the ultimate objective is to assess the number of objects in an image. The experimental results showed that the lowest mean error was achieved using YOLOv8n. The Harris method showed a lower error compared with the connected components method and RegressCNN; however, its result is based on a heuristic conversion of angular features into the number of rectangular objects. The connected components method and the simple RegressCNN regression model demonstrated a more significant dependence of the error on the density, geometry and overlap of objects.
1. Введение
Автоматизированный визуальный учет объектов является одной из прикладных задач компьютерного зрения , , . Подобные методы могут применяться в системах мониторинга биоресурсов, аквакультуры, экологического наблюдения и других областях, где требуется получать количественную оценку объектов по изображениям или видеопотоку. В таких условиях ручной подсчет оказывается трудоемким, плохо масштабируется и зависит от субъективности оператора.
Для задач визуального мониторинга особую сложность представляют плотные сцены, в которых объекты расположены близко друг к другу, частично перекрываются, имеют различные размеры и пропорции. В реальных условиях эти трудности дополнительно усиливаются изменением освещения, фона, качества изображения и положения объектов относительно камеры. Поэтому перед практическим применением алгоритмов важно оценить, насколько разные методы подсчета устойчивы к изменению структуры сцены.
В данной работе рассматривается модельная задача подсчета объектов на синтетических изображениях. Такой подход позволяет контролировать параметры сцены и сравнивать методы в одинаковых условиях: при заданном количестве объектов, изменяемой плотности, масштабе, пропорциях и наличии наложений.
Данная статья является экспериментальным продолжением предварительного анализа подходов компьютерного зрения к задаче подсчета объектов. В рамках настоящей работы из рассмотренных подходов выбраны четыре реализации, различающиеся принципом получения оценки количества объектов: связные компоненты, метод Харриса, RegressCNN и YOLOv8n.
Одной из основных проблем автоматического подсчета является взаимное наложение объектов. В таких случаях несколько отдельных экземпляров могут восприниматься алгоритмом как одна связная область. Это особенно критично для классических методов обработки изображений, основанных на бинаризации, выделении контуров или подсчете связных компонент.
Другой важный фактор — изменение геометрических характеристик объектов. Если объекты отличаются по размеру, вытянутости или степени перекрытия, методы подсчета могут давать различные ошибки. Например, регрессионная нейросеть может учитывать не только количество объектов, но и суммарную площадь изображения, а методы локальных признаков могут зависеть от выраженности углов и границ.
В работе используется модельная постановка задачи подсчета объектов на синтетических изображениях. Синтетическая генерация данных позволяет заранее задавать и контролировать параметры сцены: количество объектов, плотность размещения, размеры, пропорции и наличие наложений. За счет этого становится возможным сравнить разные методы подсчета в воспроизводимых условиях и проанализировать, как изменение геометрии сцены влияет на ошибку.
Целью данной работы является сравнительная оценка реализаций методов компьютерного зрения для автоматизированного подсчета объектов на синтетических изображениях в условиях вариативной плотности, изменения геометрических характеристик и частичного наложения объектов.
Для достижения поставленной цели решаются следующие задачи:
1. Сформировать синтетический набор данных с заданными параметрами сцены: количеством объектов, размерами, пропорциями, разбросом размеров и степенью наложения.
2. Обучить нейросетевые модели на едином синтетическом наборе данных и выполнить итоговую проверку на отдельной тестовой выборке, не входившей в обучение.
3. Реализовать и сравнить четыре метода подсчета: метод связных компонент, метод угловых признаков Харриса, регрессионную сверточную нейронную сеть RegressCNN и модель обнаружения объектов YOLOv8n.
4. Оценить точность подсчета с использованием средней абсолютной ошибки MAE и проанализировать зависимость ошибки от параметров сцены.
5. Сформулировать ограничения рассмотренных методов и определить условия, при которых каждый подход дает наименьшую ошибку подсчета.
2. Методы и принципы исследования
Для проведения эксперимента использовалась модельная постановка задачи подсчета объектов на синтетических изображениях. В качестве объектов применялись прямоугольные геометрические примитивы. Такой выбор позволил заранее задавать параметры сцены и контролировать количество объектов, их размеры, пропорции, плотность размещения и наличие наложений.
Для обучения нейросетевых моделей был сформирован единый синтетический набор данных объемом 95 090 изображений размером 608×608 пикселей. Для итоговой проверки использовалась отдельная тестовая выборка объемом 6030 изображений, не входившая в обучающий набор. Тестовая выборка включала пустые сцены, изображения с одним или двумя крупными объектами, сцены без наложения, а также сцены с частичным наложением объектов. В линейных сериях количество объектов изменялось от 1 до 100, для каждого варианта использовалось два повтора.
Разметка данных формировалась автоматически в ходе процедурной генерации изображений. Для RegressCNN использовалось табличное значение количества объектов на изображении. Для YOLOv8n применялась разметка в виде координат ограничивающих рамок. Классические методы не требовали обучения и применялись непосредственно к изображениям тестовой выборки.
В работе сравнивались четыре реализации методов подсчета. Метод связных компонент выполнял бинаризацию изображения и считал количество изолированных областей. Метод Харриса использовал угловые признаки ; итоговая оценка количества объектов рассчитывалась как число найденных угловых точек, деленное на четыре. RegressCNN представляла собой сверточную регрессионную модель, предсказывающую количество объектов напрямую. YOLOv8n , после предсказания ограничивающих рамок количество объектов определялось по числу найденных объектов.
Регрессионная модель RegressCNN включала три сверточных слоя с числом каналов 32, 64 и 128, после которых использовался полносвязный регрессионный блок. Выходной слой модели формировал одно числовое значение — прогнозируемое количество объектов на изображении. Для подхода на основе обнаружения объектов использовалась модификация YOLOv8n, обученная на том же синтетическом наборе данных, что и RegressCNN
Порядок эксперимента был одинаковым для всех методов. Каждое изображение тестовой выборки обрабатывалось четырьмя алгоритмами. Полученное значение количества объектов сравнивалось с эталонным значением, известным из процедуры генерации данных. Для каждого изображения вычислялась абсолютная ошибка подсчета, после чего рассчитывалось среднее значение ошибки по всей тестовой выборке.
Вычислительный эксперимент проводился на рабочей станции с графическим ускорителем AMD Radeon RX 7800 XT. Для выполнения тензорных вычислений использовалась библиотека DirectML, обеспечивающая работу с GPU через API DirectX 12 .
На рисунке 1 приведены примеры синтетических сцен, использованных при формировании тестовой выборки.

Примеры синтетических сцен, использованных при формировании тестовой выборки
3. Результаты и обсуждение
В данном разделе приводится детальный анализ результатов работы четырех алгоритмов. Оценка производилась на тестовой выборке с использованием метрики средней абсолютной ошибки (Mean Absolute Error, MAE) , :
где
Для анализа результатов была рассмотрена зависимость ошибки подсчета от истинного количества объектов на изображении. Для каждого значения количества объектов рассчитывалось среднее значение абсолютной ошибки по соответствующим изображениям тестовой выборки.

Зависимость средней абсолютной ошибки подсчета от истинного количества объектов на изображении
Сравнение методов по средней абсолютной ошибке подсчета
Метод | Средняя ошибка (MAE) | Интерпретация |
YOLOv8n | 10,47 | Наименьшая ошибка среди рассмотренных методов |
Метод Харриса | 16,78 | Приближенный подсчет через угловые признаки |
Связные компоненты | 28,20 | Ошибка возрастает при плотном расположении и наложении объектов |
RegressCNN | 31,22 | Прямая оценка количества без локализации объектов |
Наименьшая средняя абсолютная ошибка получена при использовании YOLOv8n. Это связано с тем, что модель обнаружения объектов формирует отдельные предсказания для объектов, а итоговый подсчет выполняется по числу найденных ограничивающих рамок.
Метод Харриса показал меньшую ошибку по сравнению со связными компонентами и RegressCNN. В данной постановке это объясняется тем, что угловые признаки сохраняют часть информации о количестве прямоугольных объектов. Вместе с тем результат метода остается приближенным, поскольку алгоритм выделяет угловые точки, а не объекты целиком.
Метод связных компонент оказался чувствителен к наложению объектов. При соприкосновении или перекрытии нескольких прямоугольников они могут восприниматься как одна связная область, что приводит к занижению результата подсчета. RegressCNN также показала высокую ошибку, поскольку модель предсказывает итоговое количество напрямую и не выполняет локализацию отдельных экземпляров.
На рисунке 3 обобщены основные факторы структуры сцены, влияющие на ошибку подсчета.

Факторы структуры сцены, влияющие на ошибку подсчета

Характерные особенности и ограничения рассматриваемых методов
Эксперимент проводился на синтетических изображениях, поэтому полученные результаты следует рассматривать как предварительную оценку поведения методов в контролируемых условиях.
4. Заключение
В работе выполнено сравнение четырех реализаций методов автоматизированного подсчета объектов на синтетической тестовой выборке. По результатам эксперимента наименьшую среднюю абсолютную ошибку показал YOLOv8n — MAE = 10,47. Метод Харриса показал MAE = 16,78, метод связных компонент — MAE = 28,20, RegressCNN — MAE = 31,22.
Полученные результаты показывают, что в условиях вариативной плотности, изменения размеров и частичного наложения объектов подход на основе обнаружения объектов оказался наиболее устойчивым среди рассмотренных методов. Метод Харриса может использоваться как приближенный классический способ подсчета, но его точность зависит от качества выделения угловых признаков. Связные компоненты и простая регрессионная модель сильнее зависят от структуры сцены.
Практическая значимость исследования заключается в разработке методики предварительного отбора алгоритмов компьютерного зрения для задач учета биоресурсов. Оценка алгоритмов на синтетических данных позволяет выявить их пределы устойчивости к наложению объектов и изменению плотности сцены, что дает возможность отсеять неэффективные подходы до перехода к работе с реальными изображениями. Такой подход существенно снижает затраты времени и вычислительных ресурсов при проектировании систем автономного визуального мониторинга.
