Подсчёт объектов через камеру: от детекции до трекинга
Подсчёт объектов в реальном времени через камеру — задача с подвохом. Перекрывающиеся объекты, разный масштаб, а главная ловушка — double counting при движении камеры. Промышленный склад, стадо животных, монеты на столе — каждый сценарий требует своей стратегии. Мы занимаемся mobile AI компьютерное зрение более 5 лет и реализовали 30+ проектов. Предлагаем готовые решения под ключ для iOS и Android с использованием последних версий фреймворков.
Когда нужен автоматический подсчёт объектов?
Типичные кейсы: учёт товара на складе (складская логистика), мониторинг поголовья в аграрном секторе, подсчёт посетителей в магазине. Везде, где нужно быстро и точно узнать количество без ручного пересчёта. Автоматизация сокращает издержки до 15% и исключает человеческую ошибку.
Два подхода: детекция vs density map
Detection-based counting — YOLOv8 mobile или RT-DETR обнаруживает каждый объект, их количество = count. Работает при низкой плотности (до 50–100 объектов в кадре), объекты не перекрываются сильно.
Density map estimation — CNN предсказывает карту плотности, интеграл карты = count. Используется при высокой плотности: толпа людей, зерно в бункере, клетки под микроскопом. CSRNet, DMCount, BL-model — актуальные архитектуры.
| Критерий | Detection-based | Density map |
|---|---|---|
| Макс. плотность | до 100 объектов | неограниченно |
| Точность при перекрытиях | низкая | высокая |
| Скорость (FPS) | 30+ (iPhone 15) | 15-20 |
| Необходимость трекинга | да (при движении) | нет (интеграл стабилен) |
| Сравнение точности подсчёта | Detection-based (YOLOv8) | Density map (CSRNet) |
|---|---|---|
| Низкая плотность (<50 объектов) | 95-99% | 97-99% |
| Средняя плотность (50-200) | 80-90% | 95-98% |
| Высокая плотность (200+) | 50-70% | 90-95% |
// iOS: выбор метода в зависимости от ожидаемой плотности
enum CountingStrategy {
case detection(model: VNCoreMLModel) // < 100 объектов
case densityMap(model: VNCoreMLModel) // > 100 объектов в кадре
case hybrid // смешанный, определяется адаптивно
}
class AdaptiveObjectCounter {
func selectStrategy(for objectClass: CountableObject) -> CountingStrategy {
switch objectClass {
case .vehicle, .person_sparse:
return .detection(model: vehicleDetector)
case .crowd, .grain, .cell:
return .densityMap(model: densityEstimator)
case .product_shelf:
return .hybrid
}
}
}
Как избежать повторного подсчёта при движении камеры?
Если пользователь плавно ведёт камерой (склад, аудитория), нужен трекинг чтобы не считать одни объекты дважды. ByteTracker — один из лучших алгоритмов для этой задачи, устойчивый к окклюзиям. Мы реализовали интеграцию на iOS и Android с использованием non-maximum suppression для фильтрации дубликатов.
class TrackingObjectCounter {
private var tracker = ByteTracker() // BYTE алгоритм трекинга
private var countedIds: Set<Int> = [] // уникальные ID за сессию
func processFrame(_ detections: [Detection]) -> TrackingCountResult {
let tracks = tracker.update(detections: detections)
// Новые ID — новые объекты, которые вошли в кадр
let newIds = tracks.map { $0.trackId }.filter { !countedIds.contains($0) }
countedIds.formUnion(newIds)
return TrackingCountResult(
currentFrameCount: tracks.count, // в кадре сейчас
totalUniqueCount: countedIds.count // всего за сессию
)
}
}
Почему density map точнее detection при высокой плотности?
Detection-based методы перестают работать, когда объекты перекрывают друг друга: один bounding box накрывает несколько объектов, или один объект дробится на части. Density map решает эту проблему — нейросеть предсказывает карту распределения, и сумма значений даёт точное количество. Например, при подсчёте зёрен в бункере (1000+ объектов) density map ошибается на 2-5%, тогда как detection даёт погрешность 20-30%. Density map estimation точнее detection в 4-10 раз при сильных перекрытиях.
// Android: density map estimation через TFLite
class DensityMapCounter(context: Context) {
private val interpreter: Interpreter by lazy {
val model = FileUtil.loadMappedFile(context, "csrnet_lite.tflite")
Interpreter(model, Interpreter.Options().apply {
addDelegate(GpuDelegate())
numThreads = 4
})
}
fun estimate(bitmap: Bitmap): Int {
// Входной размер модели — обычно 512×512 или кратный 16
val resized = Bitmap.createScaledBitmap(bitmap, 512, 512, true)
val inputBuffer = TensorImage.fromBitmap(resized).buffer
// Выходной тензор — density map того же разрешения
val outputBuffer = TensorBuffer.createFixedSize(
intArrayOf(1, 512, 512, 1), DataType.FLOAT32
)
interpreter.run(inputBuffer, outputBuffer.buffer)
// Сумма по всем пикселям density map = estimated count
val densitySum = outputBuffer.floatArray.sum()
// Масштабирование: сумма соответствует количеству объектов
return densitySum.roundToInt()
}
}
Что входит в реализацию подсчёта объектов
- Анализ сценария — оценка плотности, типов объектов, условий съёмки (освещение, статика/движение).
- Выбор модели — обучение/дообучение YOLOv8, CSRNet или кастомной архитектуры.
- Интеграция — подключение Vision (iOS) / TFLite (Android), реализация пайплайна детекции → NMS → трекинг.
- UI счётчика — отображение текущего и общего количества, анимация, звуковое оповещение.
- Оптимизация — квантизация, GPU delegate, кэширование дискрипторов.
- Документация и поддержка — передача исходников, описание API, обучение команды.
Гарантируем точность подсчёта 90-97% в зависимости от условий (проверено на 10+ проектах для складов и аграрного мониторинга). Cвяжитесь с нами для оценки вашего сценария — определим стратегию и сроки за 1-2 дня.
Процесс внедрения подсчёта объектов
- Аналитика — вы присылаете видео или описание задачи. Мы подбираем архитектуру.
- Прототип — за 3-5 дней делаем работающий демо-сборки под iOS и Android.
- Интеграция — встраиваем модуль в ваше приложение, настраиваем пайплайн.
- Тест — проводим замеры точности на ваших данных, при необходимости дообучаем модель.
- Деплой — публикация в App Store / Google Play, мониторинг в production.
Сроки: от 5 дней до 2 недель в зависимости от сложности. Точную стоимость рассчитываем индивидуально после анализа задачи. Закажите консультацию — мы проанализируем вашу задачу и предложим оптимальную стратегию.
Типичные ошибки при внедрении AI-подсчёта
- Использование detection-based методов при высокой плотности без адаптации — точность падает до 50%.
- Игнорирование трекинга при движении камеры — double counting до 40% избыточного подсчёта.
- Неучёт освещения: модели, обученные на равномерном свете, дают сбой на бликах и тенях.
- Отсутствие квантизации модели — FPS ниже 5 на устройствах без GPU.







