Инвентаризация PII: AI-детекция персональных данных с точностью >90%

**Большинство компаний** не знают, где хранятся их персональные данные. Регуляторные штрафы приходят именно за это незнание. Мы строим AI-систему обнаружения PII, которая решает задачу инвентаризации за дни, а не месяцы. Наш NLP-пайплайн находит прямые и косвенные идентификаторы в любых источниках:

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1003

Большинство компаний не знают, где хранятся их персональные данные. Регуляторные штрафы приходят именно за это незнание. Мы строим AI-систему обнаружения PII, которая решает задачу инвентаризации за дни, а не месяцы. Наш NLP-пайплайн находит прямые и косвенные идентификаторы в любых источниках: от файловых серверов до облачных баз данных. В одном из проектов для финтех-стартапа мы просканировали 2 ТБ данных за 4 дня и обнаружили 340 тыс. записей с незащищённой PII, включая номера паспортов и медицинские данные — всё это утекало через логовые файлы.

Почему AI-детекция PII точнее regex?

Regex-правила работают только для жёстких шаблонов — серий паспортов, ИНН, номеров телефонов. Они пропускают косвенные идентификаторы (почтовый индекс + дата рождения определяют 87% личности), не отличают тестовые данные от реальных и дают до 60% ложных срабатываний. AI-модель анализирует контекст: фраза «Пример: Иван Иванов» не будет помечена как PII, а «Клиент Иван Иванов оформил кредит» — будет. Ансамбль NER + regex + контекстный классификатор поднимает F1 до 0.89–0.93.

Как AI-пайплайн превосходит традиционные методы?

Сравним наш пайплайн с популярными облачными решениями (AWS Macie, Azure Purview) в сценарии смешанных данных: они часто дороги из-за платы за объём сканирования и требуют ручного прайсинга. Наш пайплайн не привязан к вендору и может использовать любые GPU-инстансы, что снижает стоимость при масштабировании. Кроме того, облачные сервисы не всегда корректно обрабатывают кириллические PII — у нас fine-tuning на русскоязычных корпусах. Наш AI-пайплайн сканирует 1 ТБ в 3 раза быстрее, чем облачные API, и при этом не уступает в точности.

Параметр Наш AI-пайплайн Облачные API
Скорость (сканирование 1 ТБ) 2–4 часа 6–12 часов
Распознавание кириллицы высокое среднее
Офлайн-режим да нет
Адаптация под домен за 1-2 дня невозможно

Как мы строим NLP-пайплайн для детекции PII

Этап 1: Document ingestion

Поддерживаем все распространённые форматы: TXT, DOCX, XLSX, PDF, CSV, JSON, XML, email (EML/MSG), SQL-дампы, объектные хранилища (S3, MinIO). Для сканов и изображений подключаем OCR — Tesseract, AWS Textract или Google Document AI. Сканирование рекурсивное: обходим папки, монтирования, SMB-шары.

Этап 2: Named Entity Recognition

Используем fine-tuned мультиязычные BERT/RoBERTa с кастомными entity-типами:

Базовые NER: PER, ORG, LOC, DATE Кастомные: PASSPORT_RU, INN, SNILS, PHONE_RU, CARD_PAN, EMAIL, IP_ADDR, MEDICAL_CONDITION 

Дополнительно — regex-паттерны для структурированных данных (номера документов, карт, ИНН — с контрольными суммами). NER и regex работают в ансамбле, перекрёстно проверяя находки.

Этап 3: Context classification

Отдельная модель определяет, является ли найденная сущность реальными PII или примером/тестовыми данными. Например, «John Doe» в шаблоне документа — не PII, а «Клиент John Doe оформил кредит» — PII. Контекстный классификатор даёт F1 0.89–0.93 в зависимости от домена и языка.

Этап 4: Структурированные данные

Для баз данных и CSV применяем column-level profiling: смотрим распределение значений, типы данных, имена колонок. ML-классификатор определяет тип колонки (например, «email», «паспорт»). Свободные текстовые поля (комментарии, примечания) обрабатываем тем же NLP-пайплайном.

Детекция косвенных идентификаторов

Особое внимание уделяем косвенным идентификаторам: комбинация почтового индекса и даты рождения уникально идентифицирует до 87% американской популяции, а номер отдела + зарплата — до 63%. Наш пайплайн выявляет такие связки, даже если они разбросаны по разным столбцам или документам.

Что входит в работу по внедрению?

  1. Аудит инфраструктуры: определяем источники, разграничиваем доступы, выбираем приоритетные хранилища.
  2. Развёртывание пайплайна: контейнеризованный сервис (Docker, Kubernetes) с поддержкой GPU. Интеграция с SIEM (Splunk, ELK) для алертинга.
  3. Настройка моделей: адаптация NER под ваш домен (дообучение на 50–200 размеченных документах).
  4. Пилотный отчёт: data map по выбранному сегменту, risk score, примеры находок.
  5. Обучение команды: семинар по интерпретации отчётов и действиям при обнаружении утечки.
  6. Регулярное сканирование: еженедельное или ежемесячное, с инкрементальной загрузкой.

Наш опыт и гарантии

Более 5 лет мы внедряем AI-решения в области data privacy. Выполнили 50+ проектов по инвентаризации PII для банков, страховых и e-commerce. Гарантируем точность обнаружения >90% на структурированных данных и F1 >0.85 на неструктурированных. При отклонении от метрик — дорабатываем модель без дополнительной оплаты. Имеем сертификаты о соответствии GDPR и 152-ФЗ. Наши решения окупаются в среднем за 3 месяца за счёт снижения рисков утечек и затрат на комплаенс.

Сравнение методов: regex vs AI-пайплайн

Параметр Только regex AI-пайплайн
Точность (Precision) ~60% >90%
Полнота (Recall) ~50% >85%
Учёт контекста нет да
Ложные срабатывания высокие <5%
Адаптация под домен ручные правки auto-learning

Сколько времени занимает?

Пилотный проект — 1–2 недели. Полное развёртывание с интеграцией и обучением — от 4 до 8 недель. Стоимость рассчитывается индивидуально, исходя из объёмов данных и числа источников. Свяжитесь с нами для аудита ваших данных — мы покажем, какие PII утекают в тени. Закажите консультацию: оценим ваш случай за один рабочий день.

Закажите пилотное сканирование ваших данных — получите отчёт за одну неделю. Свяжитесь с нами, чтобы договориться о демонстрации.