Реалізація сканування документів через камеру мобільного застосунку
Ми — команда мобільних інженерів з 7+ річним досвідом у комп'ютерному зорі на iOS та Android. За цей час ми реалізували оцифрування для паспортів, договорів, квитанцій та книжкових розворотів. Користувач тримає телефон над документом, застосунок автоматично знаходить краї аркуша, вирівнює перспективу та віддає чистий PDF. Це не «сфотографувати та обрізати» — всередині детектор контурів (Canny, Hough), гомографічна трансформація та пост-обробка для читаності. Кожен крок можна зіпсувати, якщо не врахувати особливості освітлення та типи документів. Пропонуємо інтеграцію під ключ від 3 днів, оцінка проекту безкоштовно. Зв'яжіться з нами, щоб оцінити ваш проект — ми допоможемо обрати оптимальне рішення.
Чому детектор країв ламається на відблисках та тінях
На iOS VNDetectRectanglesRequest (Vision) повертає VNRectangleObservation з чотирма corner points у нормалізованих координатах. Проблема — на глянцевому папері під прямим світлом алгоритм плутає відблиск із краєм аркуша. Рішення: перед детекцією застосовуємо CIFilter з CIColorControls (зменшуємо inputSaturation) та CIHighlightShadowAdjust. Це прибирає відблиски як артефакти кольору. Додатково можна збільшити контраст (рівень 1.2-1.5) для покращення розділення країв.
На Android ML Kit Document Scanner (com.google.android.gms:play-services-mlkit-document-scanner) справляється краще з тінями, але вимагає Google Play Services. Альтернатива без залежності від GMS — OpenCV findContours + approxPolyDP з фільтром за площею та співвідношенням сторін. Поріг minArea = 30% від площі кадру відсікає фонові об'єкти. Детальніше про алгоритм — у документації OpenCV. Для Flutter ми використовуємо нативний channel через cunning_document_scanner, який делегує детекцію на платформу.
Як обрати між нативним SDK та OpenCV?
Вибір залежить від екосистеми. Якщо застосунок використовує Google Play Services, ML Kit дає готовий UI та хорошу точність. Для пристроїв без GMS (наприклад, Huawei) — OpenCV. На iOS Vision — оптимальний вибір з 2017 року, підтримує Live Photo та Metal acceleration. Однак OpenCV вимагає ліцензійних застережень (BSD) та більше коду. Продуктивність: на iPhone 13 детекція Vision займає ~80 мс, OpenCV (~120 мс з оптимізацією NEON). Отже, Vision від Apple швидший за OpenCV на 50%.
Як правильно виконати корекцію перспективи
Після отримання чотирьох точок застосовуємо perspective transform. iOS: CIPerspectiveCorrection з явною передачею inputTopLeft, inputTopRight, inputBottomLeft, inputBottomRight у координатах зображення (не прев'ю). Часта помилка — використовувати координати прев'ю-шару напряму без перерахунку через VNImagePointForNormalizedPoint. Android: getPerspectiveTransform + warpPerspective з OpenCV або матрична трансформація через android.graphics.Matrix.setPolyToPoly. Другий варіант працює без OpenCV, але обмежений афінними перетвореннями — для сильного перспективного спотворення не підходить. На Flutter — ручний розрахунок гомографії за допомогою image пакета або нативний channel.
Технічна реалізація корекції перспективи
Для iOS: після отримання точок з VNRectangleObservation, перетворюємо їх у координати зображення через VNImagePointForNormalizedPoint. Потім передаємо в CIPerspectiveCorrection. Для налагодження малюємо контур на AVCaptureVideoPreviewLayer через CAShapeLayer з оновленням кожні 5 кадрів. На Android: використовуємо getPerspectiveTransform з OpenCV, але для не-OpenCV шляху — setPolyToPoly з PST (perspective transform) через Matrix. Важливо: при сильному спотворенні афінні перетворення дають помилку до 15% на краях.
Чому важлива постобробка для читаності?
Після випрямлення документ потрібно обробити для читаності при роздруку або OCR:
-
Адаптивна бінаризація —
cv::adaptiveThresholdз методом Gaussian краще ніж Otsu на документах з нерівномірним підсвічуванням. - Deskew — якщо документ повернутий на 1-2° після трансформації, Hough Lines знаходять нахил текстових рядків та коригують.
-
Різкість —
CISharpenLuminance(iOS) абоSharpnessfilter (Android) з помірним значенням (0.4-0.6), не більше.
Кольорові режими варто дати користувачеві: «Авто», «Документ» (чорно-білий), «Фото» (повний колір). У режимі «Документ» — бінаризація. У «Авто» — аналіз гістограми: якщо документ містить <5% насичених пікселів, застосовуємо монохромну обробку.
| Етап | iOS | Android | Flutter |
|---|---|---|---|
| Детекція | Vision (VNDetectRectanglesRequest) | ML Kit Document Scanner / OpenCV | cunning_document_scanner / channel |
| Трансформація | CIPerspectiveCorrection | OpenCV warpPerspective / Matrix.setPolyToPoly | Dart manual (image package) |
| Постобробка | CIFilters (Sharpen, Binarization) | OpenCV adaptiveThreshold + deskew | Platform channel / dart filters |
| Експорт PDF | PDFKit (UIGraphicsPDFRenderer) | android.graphics.pdf.PdfDocument | pdf package (pub.dev) |
Огляд продуктивності на різних платформах
| Параметр | iOS (iPhone 13) | Android (Pixel 6) | Flutter (нативний channel) |
|---|---|---|---|
| Час детекції | ~80 мс | ~110 мс | ~150 мс (з bridge overhead) |
| Розмір PDF (A4) | ~200 КБ | ~220 КБ | ~230 КБ |
| Частота прев'ю | 30 FPS | 30 FPS | 24 FPS |
Багатосторінковий скан та PDF
Збираємо UIImage[] / Bitmap[], експортуємо через PDFKit (iOS 11+) або android.graphics.pdf.PdfDocument. На Flutter — пакет pdf (pub.dev). Розмір PDF оптимізуємо: JPEG compression 85% достатньо для читаності, при цьому сторінка A4 займає ~150-250 КБ проти 2-4 МБ PNG. Прев'ю в реальному часі: показуємо контур поверх AVCaptureVideoPreviewLayer / PreviewView через CAShapeLayer / SurfaceView. Оновлюємо контур раз на 3-5 кадрів (не на кожен) — інакше детектор з'їдає CPU і прев'ю гальмує.
Що входить в роботу з інтеграції сканування
- Аудит вимог: аналіз типів документів, умов зйомки, цільових платформ.
- Вибір SDK: нативні Vision/ML Kit vs OpenCV vs готові рішення.
- Інтеграція прев'ю з динамічним оверлеєм контуру.
- Реалізація детекції, корекції перспективи та постобробки.
- Експорт у PDF з налаштуванням стиснення та кольорових режимів.
- Тестування на 10+ типах документів: паспорт, договір, квитанція, книжковий розворот.
- Документація по API та передача вихідного коду.
Кроки інтеграції для нового проекту:
- Аудит вимог.
- Вибір SDK.
- Інтеграція прев'ю.
- Реалізація детекції та корекції.
- Експорт PDF.
- Тестування.
Наш досвід: понад 7 років на ринку, 50+ успішних проектів зі сканування. Ми гарантуємо стабільну роботу на сучасних пристроях. Вартість інтеграції розраховується індивідуально. Замовте інтеграцію під ключ — зв'яжіться з нами для оцінки термінів та вартості. Терміни: від 3 до 5 робочих днів на одну платформу, з OCR — плюс 2-3 дні.
Додаткова інформація: гомографічна трансформація – ключовий елемент корекції перспективи.







