СРАВНИТЕЛЬНЫЙ АНАЛИЗ РЕАЛИЗАЦИЙ МЕТОДОВ КОМПЬЮТЕРНОГО ЗРЕНИЯ ДЛЯ АВТОМАТИЗИРОВАННОГО ПОДСЧЕТА ОБЪЕКТОВ НА СИНТЕТИЧЕСКИХ ИЗОБРАЖЕНИЯХ С ВАРИАТИВНОЙ ПЛОТНОСТЬЮ И НАЛОЖЕНИЯМИ

Научная статья
  • Проценко Игорь ГригорьевичКамчатский государственный технический университет, Петропавловск-Камчатский, Российская Федерация
  • Колесник Родион СергеевичКамчатский государственный технический университет, Петропавловск-Камчатский, Российская Федерация
https://doi.org/10.60797/IRJ.2026.170.38
DOI:
https://doi.org/10.60797/IRJ.2026.170.38
EDN:
JDPDEB
Предложена:
06.05.2026
Принята:
23.06.2026
Опубликована:
17.08.2026
Выпуск: № 8 (170), 2026
Выпуск: № 8 (170), 2026
Правообладатель:авторы.
Лицензия:Attribution 4.0 International (CC BY 4.0)
24
0
XML
PDF

Аннотация

В работе представлен сравнительный анализ реализаций методов компьютерного зрения для автоматизированного подсчета объектов на синтетических изображениях с вариативной плотностью, размерами и частичным наложением объектов. Исследование ориентировано на прикладные задачи визуального мониторинга биоресурсов, где требуется оценивать количество объектов в условиях плотных сцен и неполной видимости отдельных экземпляров.

Рассмотрены четыре метода: сегментация связных компонент, эвристический подсчет на основе угловых признаков Харриса, регрессионная сверточная нейронная сеть RegressCNN и модель обнаружения объектов YOLOv8n. Для обучения нейросетевых моделей использовался единый синтетический набор данных объемом 95 090 изображений. Итоговая проверка выполнялась на отдельной тестовой выборке объемом 6030 изображений, не входившей в обучающий набор и включавшей сцены с различной плотностью, пропорциями, разбросом размеров и наложениями объектов.

Основной метрикой сравнения выбрана средняя абсолютная ошибка подсчета (MAE), так как конечной задачей является оценка количества объектов на изображении. По результатам экспериментов наименьшая средняя ошибка получена при использовании YOLOv8n. Метод Харриса показал меньшую ошибку по сравнению с методом связных компонент и RegressCNN, однако его результат основан на эвристическом пересчете угловых признаков в количество прямоугольных объектов. Метод связных компонент и простая регрессионная модель RegressCNN продемонстрировали более выраженную зависимость ошибки от плотности, геометрии и наложений объектов.

1. Введение

Автоматизированный визуальный учет объектов является одной из прикладных задач компьютерного зрения

,
,
. Подобные методы могут применяться в системах мониторинга биоресурсов, аквакультуры, экологического наблюдения и других областях, где требуется получать количественную оценку объектов по изображениям или видеопотоку. В таких условиях ручной подсчет оказывается трудоемким, плохо масштабируется и зависит от субъективности оператора.

Для задач визуального мониторинга особую сложность представляют плотные сцены, в которых объекты расположены близко друг к другу, частично перекрываются, имеют различные размеры и пропорции. В реальных условиях эти трудности дополнительно усиливаются изменением освещения, фона, качества изображения и положения объектов относительно камеры. Поэтому перед практическим применением алгоритмов важно оценить, насколько разные методы подсчета устойчивы к изменению структуры сцены.

В данной работе рассматривается модельная задача подсчета объектов на синтетических изображениях. Такой подход позволяет контролировать параметры сцены и сравнивать методы в одинаковых условиях: при заданном количестве объектов, изменяемой плотности, масштабе, пропорциях и наличии наложений.

Данная статья является экспериментальным продолжением предварительного анализа подходов компьютерного зрения к задаче подсчета объектов. В рамках настоящей работы из рассмотренных подходов выбраны четыре реализации, различающиеся принципом получения оценки количества объектов: связные компоненты, метод Харриса, RegressCNN и YOLOv8n.

Одной из основных проблем автоматического подсчета является взаимное наложение объектов. В таких случаях несколько отдельных экземпляров могут восприниматься алгоритмом как одна связная область. Это особенно критично для классических методов обработки изображений, основанных на бинаризации, выделении контуров или подсчете связных компонент.

Другой важный фактор — изменение геометрических характеристик объектов. Если объекты отличаются по размеру, вытянутости или степени перекрытия, методы подсчета могут давать различные ошибки. Например, регрессионная нейросеть может учитывать не только количество объектов, но и суммарную площадь изображения, а методы локальных признаков могут зависеть от выраженности углов и границ.

В работе используется модельная постановка задачи подсчета объектов на синтетических изображениях. Синтетическая генерация данных позволяет заранее задавать и контролировать параметры сцены: количество объектов, плотность размещения, размеры, пропорции и наличие наложений. За счет этого становится возможным сравнить разные методы подсчета в воспроизводимых условиях и проанализировать, как изменение геометрии сцены влияет на ошибку.

Целью данной работы является сравнительная оценка реализаций методов компьютерного зрения для автоматизированного подсчета объектов на синтетических изображениях в условиях вариативной плотности, изменения геометрических характеристик и частичного наложения объектов.

Для достижения поставленной цели решаются следующие задачи:

1. Сформировать синтетический набор данных с заданными параметрами сцены: количеством объектов, размерами, пропорциями, разбросом размеров и степенью наложения.

2. Обучить нейросетевые модели на едином синтетическом наборе данных и выполнить итоговую проверку на отдельной тестовой выборке, не входившей в обучение.

3. Реализовать и сравнить четыре метода подсчета: метод связных компонент, метод угловых признаков Харриса, регрессионную сверточную нейронную сеть RegressCNN и модель обнаружения объектов YOLOv8n.

4. Оценить точность подсчета с использованием средней абсолютной ошибки MAE и проанализировать зависимость ошибки от параметров сцены.

5. Сформулировать ограничения рассмотренных методов и определить условия, при которых каждый подход дает наименьшую ошибку подсчета.

2. Методы и принципы исследования

Для проведения эксперимента использовалась модельная постановка задачи подсчета объектов на синтетических изображениях. В качестве объектов применялись прямоугольные геометрические примитивы. Такой выбор позволил заранее задавать параметры сцены и контролировать количество объектов, их размеры, пропорции, плотность размещения и наличие наложений.

Для обучения нейросетевых моделей был сформирован единый синтетический набор данных объемом 95 090 изображений размером 608×608 пикселей. Для итоговой проверки использовалась отдельная тестовая выборка объемом 6030 изображений, не входившая в обучающий набор. Тестовая выборка включала пустые сцены, изображения с одним или двумя крупными объектами, сцены без наложения, а также сцены с частичным наложением объектов. В линейных сериях количество объектов изменялось от 1 до 100, для каждого варианта использовалось два повтора.

Разметка данных формировалась автоматически в ходе процедурной генерации изображений. Для RegressCNN использовалось табличное значение количества объектов на изображении. Для YOLOv8n применялась разметка в виде координат ограничивающих рамок. Классические методы не требовали обучения и применялись непосредственно к изображениям тестовой выборки.

В работе сравнивались четыре реализации методов подсчета. Метод связных компонент выполнял бинаризацию изображения и считал количество изолированных областей. Метод Харриса использовал угловые признаки

; итоговая оценка количества объектов рассчитывалась как число найденных угловых точек, деленное на четыре. RegressCNN представляла собой сверточную регрессионную модель, предсказывающую количество объектов напрямую. YOLOv8n
,
после предсказания ограничивающих рамок количество объектов определялось по числу найденных объектов.

Регрессионная модель RegressCNN

включала три сверточных слоя с числом каналов 32, 64 и 128, после которых использовался полносвязный регрессионный блок. Выходной слой модели формировал одно числовое значение — прогнозируемое количество объектов на изображении. Для подхода на основе обнаружения объектов использовалась модификация YOLOv8n, обученная на том же синтетическом наборе данных, что и RegressCNN

Порядок эксперимента был одинаковым для всех методов. Каждое изображение тестовой выборки обрабатывалось четырьмя алгоритмами. Полученное значение количества объектов сравнивалось с эталонным значением, известным из процедуры генерации данных. Для каждого изображения вычислялась абсолютная ошибка подсчета, после чего рассчитывалось среднее значение ошибки по всей тестовой выборке.

Вычислительный эксперимент проводился на рабочей станции с графическим ускорителем AMD Radeon RX 7800 XT. Для выполнения тензорных вычислений использовалась библиотека DirectML, обеспечивающая работу с GPU через API DirectX 12

.

На рисунке 1 приведены примеры синтетических сцен, использованных при формировании тестовой выборки.

Примеры синтетических сцен, использованных при формировании тестовой выборки

Примеры синтетических сцен, использованных при формировании тестовой выборки

3. Результаты и обсуждение

В данном разделе приводится детальный анализ результатов работы четырех алгоритмов. Оценка производилась на тестовой выборке с использованием метрики средней абсолютной ошибки (Mean Absolute Error, MAE)

,
:

где

— предсказанное количество объектов на изображении, yi — истинное количество объектов, N — количество изображений в тестовой выборке.

Для анализа результатов была рассмотрена зависимость ошибки подсчета от истинного количества объектов на изображении. Для каждого значения количества объектов рассчитывалось среднее значение абсолютной ошибки по соответствующим изображениям тестовой выборки.

Зависимость средней абсолютной ошибки подсчета от истинного количества объектов на изображении

Зависимость средней абсолютной ошибки подсчета от истинного количества объектов на изображении

Анализ графиков на рисунке 2 демонстрирует общую тенденцию к росту ошибки подсчета при увеличении числа объектов. При этом алгоритмы обладают различной устойчивостью к уплотнению сцены. Модель YOLOv8n сохраняет минимальную ошибку на всем исследуемом диапазоне. Метод Харриса показывает промежуточный результат, тогда как точность связных компонент и модели RegressCNN резко снижается на плотных сценах. Сводные значения средней абсолютной ошибки (MAE) представлены в таблице 1.

Сравнение методов по средней абсолютной ошибке подсчета

Метод

Средняя ошибка (MAE)

Интерпретация

YOLOv8n

10,47

Наименьшая ошибка среди рассмотренных методов

Метод Харриса

16,78

Приближенный подсчет через угловые признаки

Связные компоненты

28,20

Ошибка возрастает при плотном расположении и наложении объектов

RegressCNN

31,22

Прямая оценка количества без локализации объектов

Наименьшая средняя абсолютная ошибка получена при использовании YOLOv8n. Это связано с тем, что модель обнаружения объектов формирует отдельные предсказания для объектов, а итоговый подсчет выполняется по числу найденных ограничивающих рамок.

Метод Харриса показал меньшую ошибку по сравнению со связными компонентами и RegressCNN. В данной постановке это объясняется тем, что угловые признаки сохраняют часть информации о количестве прямоугольных объектов. Вместе с тем результат метода остается приближенным, поскольку алгоритм выделяет угловые точки, а не объекты целиком.

Метод связных компонент оказался чувствителен к наложению объектов. При соприкосновении или перекрытии нескольких прямоугольников они могут восприниматься как одна связная область, что приводит к занижению результата подсчета. RegressCNN также показала высокую ошибку, поскольку модель предсказывает итоговое количество напрямую и не выполняет локализацию отдельных экземпляров.

На рисунке 3 обобщены основные факторы структуры сцены, влияющие на ошибку подсчета.

Факторы структуры сцены, влияющие на ошибку подсчета

Факторы структуры сцены, влияющие на ошибку подсчета

Представленные факторы по-разному влияют на рассматриваемые методы. Увеличение количества объектов и плотности сцены повышает вероятность соприкосновения и перекрытия прямоугольников. Разброс размеров и изменение пропорций дополнительно усложняют выделение устойчивых признаков. Поэтому средняя ошибка зависит не только от выбранного алгоритма, но и от структуры входного изображения.
Характерные особенности и ограничения рассматриваемых методов

Характерные особенности и ограничения рассматриваемых методов

Таким образом, в условиях проведенного эксперимента наиболее устойчивым оказался подход на основе обнаружения объектов YOLOv8n. Метод Харриса занял промежуточное положение, поскольку позволяет получить приближенную оценку количества объектов через угловые признаки. Связные компоненты и RegressCNN сильнее зависят от структуры сцены: первый метод — от слияния объектов, второй — от отсутствия локализации отдельных экземпляров.

Эксперимент проводился на синтетических изображениях, поэтому полученные результаты следует рассматривать как предварительную оценку поведения методов в контролируемых условиях.

4. Заключение

В работе выполнено сравнение четырех реализаций методов автоматизированного подсчета объектов на синтетической тестовой выборке. По результатам эксперимента наименьшую среднюю абсолютную ошибку показал YOLOv8n — MAE = 10,47. Метод Харриса показал MAE = 16,78, метод связных компонент — MAE = 28,20, RegressCNN — MAE = 31,22.

Полученные результаты показывают, что в условиях вариативной плотности, изменения размеров и частичного наложения объектов подход на основе обнаружения объектов оказался наиболее устойчивым среди рассмотренных методов. Метод Харриса может использоваться как приближенный классический способ подсчета, но его точность зависит от качества выделения угловых признаков. Связные компоненты и простая регрессионная модель сильнее зависят от структуры сцены.

Практическая значимость исследования заключается в разработке методики предварительного отбора алгоритмов компьютерного зрения для задач учета биоресурсов. Оценка алгоритмов на синтетических данных позволяет выявить их пределы устойчивости к наложению объектов и изменению плотности сцены, что дает возможность отсеять неэффективные подходы до перехода к работе с реальными изображениями. Такой подход существенно снижает затраты времени и вычислительных ресурсов при проектировании систем автономного визуального мониторинга.

Метрика статьи

Просмотров:24
Скачиваний:0
Просмотры
Всего:
Просмотров:24