Реалізація AI-класифікації фотографій у галереї мобільного додатку
Ми впроваджуємо on-device AI-класифікацію фотографій у галерею вашого мобільного додатку. Жодного завантаження фото на сервер — все працює локально, на iPhone або Android. Це про приватність і швидкість. За 5+ років ми реалізували такі рішення для десятків проєктів — від стартапів до великих медіапорталів. Apple Vision Framework і Google ML Kit — основа нашого стеку.
Користувачі очікують, що фотографії автоматично сортуються за категоріями, але реалізація on-device класифікації стикається з проблемами продуктивності, конфіденційності та точності. Без правильної архітектури додаток гальмує, батарея сідає, а фото залишаються невідсортованими. Наш підхід вирішує ці завдання через інкрементальну обробку, батчинг і використання вбудованих нейромережевих прискорювачів. Наша команда має 5 років досвіду в мобільній розробці та реалізувала понад 20 проєктів з on-device ML. Економія на хмарних обчисленнях може сягати значних сум, а дані користувачів залишаються під контролем.
Як оптимізувати класифікацію для великих галерей?
Ключовий виклик — не заблокувати головний потік і не перегріти пристрій. Працюємо через PHFetchResult з інкрементальною обробкою в DispatchQueue.global(qos: .background). Розмір батча — 50 фото, між батчами — пауза 0.1 с. Це дозволяє уникнути CPU throttle у 3–5 разів. Vision на iOS обробляє фото в 2–3 рази швидше, ніж ML Kit на Android (5–15 ms проти 10–30 ms).
func classifyGallery() {
let fetchOptions = PHFetchOptions()
fetchOptions.sortDescriptors = [NSSortDescriptor(key: "creationDate", ascending: false)]
let allPhotos = PHAsset.fetchAssets(with: .image, options: fetchOptions)
let batchSize = 50
let processingQueue = DispatchQueue(label: "photo.classification", qos: .background)
processingQueue.async {
var offset = 0
while offset < allPhotos.count {
let batch = (offset..<min(offset + batchSize, allPhotos.count))
.map { allPhotos.object(at: $0) }
self.processBatch(assets: batch)
offset += batchSize
Thread.sleep(forTimeInterval: 0.1) // Даємо системі перепочити
}
}
}
On-device класифікація: що доступно з коробки
На iOS працює Vision framework з VNClassifyImageRequest. Не потрібні сторонні моделі — вбудована класифікація покриває 1000+ категорій:
import Vision
func classifyPhoto(cgImage: CGImage, completion: @escaping ([String]) -> Void) {
let request = VNClassifyImageRequest { request, error in
guard let results = request.results as? [VNClassificationObservation] else { return }
// Беремо категорії з confidence > 0.5
let labels = results
.filter { $0.confidence > 0.5 }
.map { $0.identifier }
completion(labels)
}
try? VNImageRequestHandler(cgImage: cgImage, options: [:]).perform([request])
}
Час інференсу — 5–15 ms на фото. На iPhone 13+ Neural Engine обробляє всю галерею в 1000 фото за ~15–20 секунд.
На Android: ML Kit ImageLabeler з ImageLabelerOptions:
val labeler = ImageLabeling.getClient(
ImageLabelerOptions.Builder()
.setConfidenceThreshold(0.5f)
.build()
)
labeler.process(InputImage.fromBitmap(bitmap, 0))
.addOnSuccessListener { labels ->
val categories = labels.map { it.text }
// "Dog", "Outdoor", "Sky", "Food", etc.
}
ML Kit підтримує 400+ категорій без мережі.
Порівняння iOS та Android
| Параметр | iOS (Vision) | Android (ML Kit) |
|---|---|---|
| Кількість категорій | 1000+ | 400+ |
| Інференс на фото | 5–15 ms | 10–30 ms |
| Кастомні моделі | CoreML | TensorFlow Lite |
| Фонова обробка | DispatchQueue | Coroutines + WorkManager |
Порівняння on-device та серверної класифікації
| Параметр | On-device | Серверна |
|---|---|---|
| Приватність | Дані на пристрої | Передача фото на сервер |
| Затримка | Миттєво | 1–5 сек з урахуванням мережі |
| Вартість інфраструктури | Немає | Витрати на GPU/API |
| Робота офлайн | Так | Ні |
Чому on-device ML безпечніше ніж хмарні рішення?
Серверна класифікація вимагає передачі фото, затримки на мережу та витрат на інфраструктуру. On-device підхід працює офлайн, миттєво та безпечно. Ми гарантуємо, що користувацькі дані не покидають пристрій.
Які інструменти потрібні для кастомних категорій?
Вбудований Vision не завжди покриває всі потрібні категорії. Для кастомних (наприклад, «рецепт», «скріншот документа», «чек», «віза») — навчаємо CreateML модель:
let dataSource = MLImageClassifier.DataSource.labeledDirectories(at: trainingDir)
let model = try MLImageClassifier(trainingData: dataSource)
try model.write(to: modelURL)
Точність на кастомних категоріях при 20+ прикладах — 85–95%. Модель у CoreML форматі — 5–15 MB. Можна доставляти через Core ML Model Deployment без оновлення додатку.
Зберігання результатів класифікації
Результати зберігаємо локально — не на сервер. Core Data з NSPersistentContainer:
// Entity: PhotoClassification
// Attributes: assetLocalIdentifier (String), labels (Transformable: [String]), classifiedAt (Date)
Індекс на assetLocalIdentifier + індекс на labels для швидкого пошуку. При 50k фото таблиця важить ~5–10 MB.
Типові помилки
- Classifying на main thread — найчастіше.
VNImageRequestHandler.performвиконується синхронно. Завжди в background queue. - Запитувати full-resolution для класифікації — зайве. PHAsset requestImage з
targetSize: CGSize(width: 224, height: 224)достатньо. - Не оновлювати класифікації при зміні галереї —
PHPhotoLibraryChangeObserverповинен запускати інкрементальну обробку тільки для нових/змінених фото.
Що входить в роботу
- Розробка on-device класифікації (Vision / ML Kit)
- Інтеграція кастомних моделей CoreML / TFLite
- Інкрементальна обробка галереї з батчингом
- Зберігання результатів в CoreData / Room
- Тестування на пристроях (iOS 16+ / Android 12+)
- Документація та навчання команди
- Підтримка після релізу (2 тижні)
Строки та вартість
Базова класифікація з Vision + зберігання в Core Data — 4–6 днів. Повна реалізація з кастомними категоріями, інкрементальними оновленнями та швидким пошуком за тегами — 2–3 тижні. Вартість розраховується індивідуально після аудиту вашого проєкту.
Замовте розробку AI-галереї — отримайте консультацію по вашому проєкту. Зв'яжіться з нами, щоб оцінити можливості для вашого додатку.







