Подсчёт объектов через камеру: от детекции до трекинга
Подсчёт объектов в реальном времени через камеру — задача с подвохом. Перекрывающиеся объекты, разный масштаб, а главная ловушка — double counting при движении камеры. Промышленный склад, стадо животных, монеты на столе — каждый сценарий требует своей стратегии. Мы занимаемся mobile AI компьютерное зрение более 5 лет и реализовали 30+ проектов. Предлагаем готовые решения под ключ для iOS и Android с использованием последних версий фреймворков.
Когда нужен автоматический подсчёт объектов?
Типичные кейсы: учёт товара на складе (складская логистика), мониторинг поголовья в аграрном секторе, подсчёт посетителей в магазине. Везде, где нужно быстро и точно узнать количество без ручного пересчёта. Автоматизация сокращает издержки до 15% и исключает человеческую ошибку.
Два подхода: детекция vs density map
Detection-based counting — YOLOv8 mobile или RT-DETR обнаруживает каждый объект, их количество = count. Работает при низкой плотности (до 50–100 объектов в кадре), объекты не перекрываются сильно.
Density map estimation — CNN предсказывает карту плотности, интеграл карты = count. Используется при высокой плотности: толпа людей, зерно в бункере, клетки под микроскопом. CSRNet, DMCount, BL-model — актуальные архитектуры.
| Критерий | Detection-based | Density map |
|---|---|---|
| Макс. плотность | до 100 объектов | неограниченно |
| Точность при перекрытиях | низкая | высокая |
| Скорость (FPS) | 30+ (iPhone 15) | 15-20 |
| Необходимость трекинга | да (при движении) | нет (интеграл стабилен) |
| Сравнение точности подсчёта | Detection-based (YOLOv8) | Density map (CSRNet) |
|---|---|---|
| Низкая плотность (<50 объектов) | 95-99% | 97-99% |
| Средняя плотность (50-200) | 80-90% | 95-98% |
| Высокая плотность (200+) | 50-70% | 90-95% |
// iOS: выбор метода в зависимости от ожидаемой плотности enum CountingStrategy { case detection(model: VNCoreMLModel) // < 100 объектов case densityMap(model: VNCoreMLModel) // > 100 объектов в кадре case hybrid // смешанный, определяется адаптивно } class AdaptiveObjectCounter { func selectStrategy(for objectClass: CountableObject) -> CountingStrategy { switch objectClass { case .vehicle, .person_sparse: return .detection(model: vehicleDetector) case .crowd, .grain, .cell: return .densityMap(model: densityEstimator) case .product_shelf: return .hybrid } } } Как избежать повторного подсчёта при движении камеры?
Если пользователь плавно ведёт камерой (склад, аудитория), нужен трекинг чтобы не считать одни объекты дважды. ByteTracker — один из лучших алгоритмов для этой задачи, устойчивый к окклюзиям. Мы реализовали интеграцию на iOS и Android с использованием non-maximum suppression для фильтрации дубликатов.
class TrackingObjectCounter { private var tracker = ByteTracker() // BYTE алгоритм трекинга private var countedIds: Set<Int> = [] // уникальные ID за сессию func processFrame(_ detections: [Detection]) -> TrackingCountResult { let tracks = tracker.update(detections: detections) // Новые ID — новые объекты, которые вошли в кадр let newIds = tracks.map { $0.trackId }.filter { !countedIds.contains($0) } countedIds.formUnion(newIds) return TrackingCountResult( currentFrameCount: tracks.count, // в кадре сейчас totalUniqueCount: countedIds.count // всего за сессию ) } } Почему density map точнее detection при высокой плотности?
Detection-based методы перестают работать, когда объекты перекрывают друг друга: один bounding box накрывает несколько объектов, или один объект дробится на части. Density map решает эту проблему — нейросеть предсказывает карту распределения, и сумма значений даёт точное количество. Например, при подсчёте зёрен в бункере (1000+ объектов) density map ошибается на 2-5%, тогда как detection даёт погрешность 20-30%. Density map estimation точнее detection в 4-10 раз при сильных перекрытиях.
// Android: density map estimation через TFLite class DensityMapCounter(context: Context) { private val interpreter: Interpreter by lazy { val model = FileUtil.loadMappedFile(context, "csrnet_lite.tflite") Interpreter(model, Interpreter.Options().apply { addDelegate(GpuDelegate()) numThreads = 4 }) } fun estimate(bitmap: Bitmap): Int { // Входной размер модели — обычно 512×512 или кратный 16 val resized = Bitmap.createScaledBitmap(bitmap, 512, 512, true) val inputBuffer = TensorImage.fromBitmap(resized).buffer // Выходной тензор — density map того же разрешения val outputBuffer = TensorBuffer.createFixedSize( intArrayOf(1, 512, 512, 1), DataType.FLOAT32 ) interpreter.run(inputBuffer, outputBuffer.buffer) // Сумма по всем пикселям density map = estimated count val densitySum = outputBuffer.floatArray.sum() // Масштабирование: сумма соответствует количеству объектов return densitySum.roundToInt() } } Что входит в реализацию подсчёта объектов
- Анализ сценария — оценка плотности, типов объектов, условий съёмки (освещение, статика/движение).
- Выбор модели — обучение/дообучение YOLOv8, CSRNet или кастомной архитектуры.
- Интеграция — подключение Vision (iOS) / TFLite (Android), реализация пайплайна детекции → NMS → трекинг.
- UI счётчика — отображение текущего и общего количества, анимация, звуковое оповещение.
- Оптимизация — квантизация, GPU delegate, кэширование дискрипторов.
- Документация и поддержка — передача исходников, описание API, обучение команды.
Гарантируем точность подсчёта 90-97% в зависимости от условий (проверено на 10+ проектах для складов и аграрного мониторинга). Cвяжитесь с нами для оценки вашего сценария — определим стратегию и сроки за 1-2 дня.
Процесс внедрения подсчёта объектов
- Аналитика — вы присылаете видео или описание задачи. Мы подбираем архитектуру.
- Прототип — за 3-5 дней делаем работающий демо-сборки под iOS и Android.
- Интеграция — встраиваем модуль в ваше приложение, настраиваем пайплайн.
- Тест — проводим замеры точности на ваших данных, при необходимости дообучаем модель.
- Деплой — публикация в App Store / Google Play, мониторинг в production.
Сроки: от 5 дней до 2 недель в зависимости от сложности. Точную стоимость рассчитываем индивидуально после анализа задачи. Закажите консультацию — мы проанализируем вашу задачу и предложим оптимальную стратегию.
Типичные ошибки при внедрении AI-подсчёта
- Использование detection-based методов при высокой плотности без адаптации — точность падает до 50%.
- Игнорирование трекинга при движении камеры — double counting до 40% избыточного подсчёта.
- Неучёт освещения: модели, обученные на равномерном свете, дают сбой на бликах и тенях.
- Отсутствие квантизации модели — FPS ниже 5 на устройствах без GPU.







