Raspberry Pi 5 значно швидший за попередника — 2–3x приріст CPU. Але для real-time інференсу детекції, класифікації або генерації тексту апаратний прискорювач часто обов'язковий. Ми займаємося розгортанням AI на Pi вже понад 5 років і допомогли десяткам проєктів перейти від прототипу до production. Наприклад, наш клієнт з електронної промисловості хотів детектувати подряпини на платі в реальному часі. Без прискорювача YOLOv8n видавав 15 FPS — недостатньо для конвеєра 30 см/с. Після оптимізації з Hailo-8 та квантизацією INT8 отримали стабільні 110 FPS. Згідно з Wikipedia, Edge AI — це підхід, який дозволяє обробляти дані локально без затримок, що критично для промислових задач. Нижче — практичні рекомендації.
У цій статті ми розглянемо розгортання AI на Raspberry Pi, включаючи апаратне прискорення Hailo-8 та інференс на краю. ML на Raspberry Pi можна розгортати з прискоренням за допомогою апаратного прискорювача для Raspberry Pi, такого як Hailo HAT+ або Coral USB Accelerator. Оптимізація моделі для Raspberry Pi включає квантизацію до INT8, що дозволяє використовувати тензорні ядра прискорювача. MLOps на краю (edge MLOps) забезпечує автоматизацію процесів розгортання.
Який прискорювач обрати для Raspberry Pi 5?
На ринку три основні варіанти:
| Прискорювач | Продуктивність (TOPS) | Споживання | Підтримка моделей | Підходить для Pi 5 |
|---|---|---|---|---|
| Hailo-8 M.2 HAT+ (Hailo HAT+) | 26 TOPS | 5 Вт | Будь-які (через Hailo SDK) | Так (M.2 слот через HAT) |
| Google Coral USB Accelerator | 4 TOPS | 2–3 Вт | Тільки INT8 TFLite | Так (USB, Pi 4/5) |
| Intel Neural Compute Stick 2 | 1 TOPS | 1–2 Вт | OpenVINO, застарів | Частково |
Hailo-8 — вибір сьогодні: 26 TOPS при мізерному енергоспоживанні. Він у 6.5 разів потужніший за Coral USB (26 TOPS проти 4 TOPS). У наших проєктах він дає 120+ FPS на YOLOv8n. Coral — бюджетний варіант для готових TFLite-моделей. Intel NCS2 зустрічається лише в legacy-системах.
Як Hailo-8 впливає на продуктивність?
| Модель | Без прискорювача (CPU Pi 5) | З Hailo-8 |
|---|---|---|
| YOLOv8n (детекція) | ~30 FPS | 120+ FPS |
| MobileNetV3 (класифікація) | ~15 FPS | 60+ FPS |
| Llama 3.2 1B (генерація) | 8–12 токенів/с | — (поки не підтримується) |
Різниця в 4–5 разів. Наприклад, YOLOv8 на малині з Hailo-8 працює в 4 рази швидше, ніж на CPU. Для real-time задач (відеоспостереження, робототехніка) прискорювач обов'язковий. Економія бюджету при такому підході може сягати 40% порівняно з хмарними рішеннями. Вартість наших послуг з розгортання починається від 500 доларів за проєкт.
Стек без прискорювача (Pure Pi 5)
Якщо задача не термінова, вистачає CPU з TFLite + XNNPACK (ARM Neon) на Raspberry Pi 5 (TFLite Raspberry Pi 5). Для NLP — Llama.cpp: Llama 3.2 1B видає 8–12 токенів/с. Цього достатньо для offline-асистента або простої класифікації. Для CV-задач можна використовувати MobileNetV3-SSD: 8–10 FPS на роздільній здатності 320x320. Але якщо потрібна latency < 100 мс, без Hailo-8 не обійтися.
Як ми оптимізуємо моделі та розгортаємо AI
З нашої практики: кейс з дефектоскопією
Наш клієнт — виробник електроніки. Потрібно детектувати подряпини на платі в реальному часі. Проблеми: модель YOLOv8n важка для Pi 5 (15 FPS), тепловиділення. Ми:
- Провели квантизацію INT8 за допомогою Hailo SDK — FPS виріс до 110.
- Налаштували пайплайн через GStreamer, знизивши latency p99 до 30 мс.
- Додали троттлінг CPU, щоб уникнути перегріву. Результат: стабільні 30 FPS на конвеєрі, відмовостійкість 99.9%.
Процес роботи
Етапи розгортання
- Аналітика: навантаження, вимоги до latency, вибір прискорювача.
- Проєктування: архітектура інференс-пайплайну.
- Реалізація: квантизація, конвертація моделі, налаштування SDK.
- Тестування: заміри FPS, latency p99, thermal stress.
- Деплой: розгортання на Pi, моніторинг, документація.
Що входить в роботу?
- Підбір апаратного прискорювача та комплектуючих.
- Оптимізація моделі (квантизація, конвертація) під конкретний SDK.
- Налаштування системи (ОС, драйвери, бібліотеки).
- Інтеграція інференс-пайплайну (GStreamer, OpenCV, тощо).
- Тестування продуктивності та стрес-тест.
- Документація та інструкції з експлуатації.
- Навчання вашої команди (до 2 годин).
- Підтримка після впровадження (1 місяць).
Типові помилки при розгортанні AI на Pi
- Ігнорування тепловиділення — троттлінг знижує FPS.
- Використання FP32 моделі замість INT8 — втрата продуктивності.
- Неоптимізований пайплайн введення/виведення (GStreamer обов'язковий).
- Неправильний вибір моделі: занадто важкі архітектури (YOLOv8m) дають 5 FPS навіть з прискорювачем через обмеження пропускної здатності пам'яті.
- Відсутність моніторингу температури — при 85°C Pi скидає частоту.
Чому варто довірити розгортання нам?
У нас понад 5 років досвіду в edge AI та більше 50 успішних проєктів на Raspberry Pi. Надаємо гарантію на продуктивність (документально). Отримайте консультацію — напишіть нам, оцінимо ваш проєкт за 1 день. Замовте оцінку вашого проєкту. Ми допоможемо підібрати прискорювач та оптимізувати модель під ваші вимоги.
Edge AI — це точка входу в розумні пристрої без хмари.







