Більшість компаній не знають, де зберігаються їхні персональні дані. Регуляторні штрафи приходять саме за це незнання. Ми будуємо AI-систему виявлення PII, яка вирішує завдання інвентаризації за дні, а не місяці. Наш NLP-пайплайн знаходить прямі та непрямі ідентифікатори в будь-яких джерелах: від файлових серверів до хмарних баз даних. В одному з проектів для фінтех-стартапу ми просканували 2 ТБ даних за 4 дні та виявили 340 тис. записів із незахищеною PII, включаючи номери паспортів та медичні дані — все це витікало через логові файли.
Чому AI-детекція PII точніша за regex?
Regex-правила працюють лише для жорстких шаблонів — серій паспортів, ІПН, номерів телефонів. Вони пропускають непрямі ідентифікатори (поштовий індекс + дата народження визначають 87% особи), не відрізняють тестові дані від реальних і дають до 60% хибних спрацьовувань. AI-модель аналізує контекст: фраза «Приклад: Іван Іванов» не буде позначена як PII, а «Клієнт Іван Іванов оформив кредит» — буде. Ансамбль NER + regex + контекстний класифікатор піднімає F1 до 0.89–0.93.
Як AI-пайплайн перевершує традиційні методи?
Порівняємо наш пайплайн із популярними хмарними рішеннями (AWS Macie, Azure Purview) у сценарії змішаних даних: вони часто дорогі через плату за обсяг сканування та вимагають ручного прайсингу. Наш пайплайн не прив'язаний до вендора і може використовувати будь-які GPU-інстанси, що знижує вартість при масштабуванні. Крім того, хмарні сервіси не завжди коректно обробляють кириличні PII — у нас fine-tuning на російськомовних корпусах. Наш AI-пайплайн сканує 1 ТБ у 3 рази швидше, ніж хмарні API, і при цьому не поступається в точності.
| Параметр | Наш AI-пайплайн | Хмарні API |
|---|---|---|
| Швидкість (сканування 1 ТБ) | 2–4 години | 6–12 годин |
| Розпізнавання кирилиці | високе | середнє |
| Офлайн-режим | так | ні |
| Адаптація під домен | за 1-2 дні | неможлива |
Як ми будуємо NLP-пайплайн для детекції PII
Етап 1: Document ingestion
Підтримуємо всі поширені формати: TXT, DOCX, XLSX, PDF, CSV, JSON, XML, email (EML/MSG), SQL-дампи, об'єктні сховища (S3, MinIO). Для сканів та зображень підключаємо OCR — Tesseract, AWS Textract або Google Document AI. Сканування рекурсивне: обходимо папки, монтування, SMB-шари.
Етап 2: Named Entity Recognition
Використовуємо fine-tuned мультимовні BERT/RoBERTa з кастомними entity-типами:
Базові NER: PER, ORG, LOC, DATE Кастомні: PASSPORT_RU, INN, SNILS, PHONE_RU, CARD_PAN, EMAIL, IP_ADDR, MEDICAL_CONDITION Додатково — regex-патерни для структурованих даних (номери документів, карт, ІПН — з контрольними сумами). NER і regex працюють в ансамблі, перехресно перевіряючи знахідки.
Етап 3: Context classification
Окрема модель визначає, чи є знайдена сутність реальними PII або прикладом/тестовими даними. Наприклад, «John Doe» у шаблоні документу — не PII, а «Клієнт John Doe оформив кредит» — PII. Контекстний класифікатор дає F1 0.89–0.93 залежно від домену та мови.
Етап 4: Структуровані дані
Для баз даних і CSV застосовуємо column-level profiling: дивимося розподіл значень, типи даних, імена колонок. ML-класифікатор визначає тип колонки (наприклад, «email», «паспорт»). Вільні текстові поля (коментарі, примітки) обробляємо тим самим NLP-пайплайном.
Детекція непрямих ідентифікаторів
Особливу увагу приділяємо непрямим ідентифікаторам: комбінація поштового індексу та дати народження унікально ідентифікує до 87% американської популяції, а номер відділу + зарплата — до 63%. Наш пайплайн виявляє такі зв'язки, навіть якщо вони розкидані по різних колонках або документах.
Що входить у роботу з впровадження?
- Аудит інфраструктури: визначаємо джерела, розмежовуємо доступи, обираємо пріоритетні сховища.
- Розгортання пайплайну: контейнеризований сервіс (Docker, Kubernetes) з підтримкою GPU. Інтеграція з SIEM (Splunk, ELK) для алертингу.
- Налаштування моделей: адаптація NER під ваш домен (донавчання на 50–200 розмічених документах).
- Пілотний звіт: data map за обраним сегментом, risk score, приклади знахідок.
- Навчання команди: семінар з інтерпретації звітів та дій при виявленні витоку.
- Регулярне сканування: щотижневе або щомісячне, з інкрементальним завантаженням.
Наш досвід і гарантії
Понад 5 років ми впроваджуємо AI-рішення у сфері data privacy. Виконали 50+ проектів з інвентаризації PII для банків, страхових та e-commerce. Гарантуємо точність виявлення >90% на структурованих даних та F1 >0.85 на неструктурованих. При відхиленні від метрик — доопрацьовуємо модель без додаткової оплати. Маємо сертифікати про відповідність GDPR та 152-ФЗ. Наші рішення окупаються в середньому за 3 місяці завдяки зниженню ризиків витоків і витрат на комплаєнс.
Порівняння методів: regex vs AI-пайплайн
| Параметр | Тільки regex | AI-пайплайн |
|---|---|---|
| Точність (Precision) | ~60% | >90% |
| Повнота (Recall) | ~50% | >85% |
| Урахування контексту | ні | так |
| Хибні спрацьовування | високі | <5% |
| Адаптація під домен | ручні правки | auto-learning |
Скільки часу займає?
Пілотний проект — 1–2 тижні. Повне розгортання з інтеграцією та навчанням — від 4 до 8 тижнів. Вартість розраховується індивідуально, виходячи з обсягів даних і кількості джерел. Зв'яжіться з нами для аудиту ваших даних — ми покажемо, які PII витікають у тіні. Замовте консультацію: оцінимо ваш випадок за один робочий день.
Замовте пілотне сканування ваших даних — отримайте звіт за один тиждень. Зв'яжіться з нами, щоб домовитися про демонстрацію.







