Большинство компаний не знают, где хранятся их персональные данные. Регуляторные штрафы приходят именно за это незнание. Мы строим AI-систему обнаружения PII, которая решает задачу инвентаризации за дни, а не месяцы. Наш NLP-пайплайн находит прямые и косвенные идентификаторы в любых источниках: от файловых серверов до облачных баз данных. В одном из проектов для финтех-стартапа мы просканировали 2 ТБ данных за 4 дня и обнаружили 340 тыс. записей с незащищённой PII, включая номера паспортов и медицинские данные — всё это утекало через логовые файлы.
Почему AI-детекция PII точнее regex?
Regex-правила работают только для жёстких шаблонов — серий паспортов, ИНН, номеров телефонов. Они пропускают косвенные идентификаторы (почтовый индекс + дата рождения определяют 87% личности), не отличают тестовые данные от реальных и дают до 60% ложных срабатываний. AI-модель анализирует контекст: фраза «Пример: Иван Иванов» не будет помечена как PII, а «Клиент Иван Иванов оформил кредит» — будет. Ансамбль NER + regex + контекстный классификатор поднимает F1 до 0.89–0.93.
Как AI-пайплайн превосходит традиционные методы?
Сравним наш пайплайн с популярными облачными решениями (AWS Macie, Azure Purview) в сценарии смешанных данных: они часто дороги из-за платы за объём сканирования и требуют ручного прайсинга. Наш пайплайн не привязан к вендору и может использовать любые GPU-инстансы, что снижает стоимость при масштабировании. Кроме того, облачные сервисы не всегда корректно обрабатывают кириллические PII — у нас fine-tuning на русскоязычных корпусах. Наш AI-пайплайн сканирует 1 ТБ в 3 раза быстрее, чем облачные API, и при этом не уступает в точности.
| Параметр | Наш AI-пайплайн | Облачные API |
|---|---|---|
| Скорость (сканирование 1 ТБ) | 2–4 часа | 6–12 часов |
| Распознавание кириллицы | высокое | среднее |
| Офлайн-режим | да | нет |
| Адаптация под домен | за 1-2 дня | невозможно |
Как мы строим NLP-пайплайн для детекции PII
Этап 1: Document ingestion
Поддерживаем все распространённые форматы: TXT, DOCX, XLSX, PDF, CSV, JSON, XML, email (EML/MSG), SQL-дампы, объектные хранилища (S3, MinIO). Для сканов и изображений подключаем OCR — Tesseract, AWS Textract или Google Document AI. Сканирование рекурсивное: обходим папки, монтирования, SMB-шары.
Этап 2: Named Entity Recognition
Используем fine-tuned мультиязычные BERT/RoBERTa с кастомными entity-типами:
Базовые NER: PER, ORG, LOC, DATE Кастомные: PASSPORT_RU, INN, SNILS, PHONE_RU, CARD_PAN, EMAIL, IP_ADDR, MEDICAL_CONDITION Дополнительно — regex-паттерны для структурированных данных (номера документов, карт, ИНН — с контрольными суммами). NER и regex работают в ансамбле, перекрёстно проверяя находки.
Этап 3: Context classification
Отдельная модель определяет, является ли найденная сущность реальными PII или примером/тестовыми данными. Например, «John Doe» в шаблоне документа — не PII, а «Клиент John Doe оформил кредит» — PII. Контекстный классификатор даёт F1 0.89–0.93 в зависимости от домена и языка.
Этап 4: Структурированные данные
Для баз данных и CSV применяем column-level profiling: смотрим распределение значений, типы данных, имена колонок. ML-классификатор определяет тип колонки (например, «email», «паспорт»). Свободные текстовые поля (комментарии, примечания) обрабатываем тем же NLP-пайплайном.
Детекция косвенных идентификаторов
Особое внимание уделяем косвенным идентификаторам: комбинация почтового индекса и даты рождения уникально идентифицирует до 87% американской популяции, а номер отдела + зарплата — до 63%. Наш пайплайн выявляет такие связки, даже если они разбросаны по разным столбцам или документам.
Что входит в работу по внедрению?
- Аудит инфраструктуры: определяем источники, разграничиваем доступы, выбираем приоритетные хранилища.
- Развёртывание пайплайна: контейнеризованный сервис (Docker, Kubernetes) с поддержкой GPU. Интеграция с SIEM (Splunk, ELK) для алертинга.
- Настройка моделей: адаптация NER под ваш домен (дообучение на 50–200 размеченных документах).
- Пилотный отчёт: data map по выбранному сегменту, risk score, примеры находок.
- Обучение команды: семинар по интерпретации отчётов и действиям при обнаружении утечки.
- Регулярное сканирование: еженедельное или ежемесячное, с инкрементальной загрузкой.
Наш опыт и гарантии
Более 5 лет мы внедряем AI-решения в области data privacy. Выполнили 50+ проектов по инвентаризации PII для банков, страховых и e-commerce. Гарантируем точность обнаружения >90% на структурированных данных и F1 >0.85 на неструктурированных. При отклонении от метрик — дорабатываем модель без дополнительной оплаты. Имеем сертификаты о соответствии GDPR и 152-ФЗ. Наши решения окупаются в среднем за 3 месяца за счёт снижения рисков утечек и затрат на комплаенс.
Сравнение методов: regex vs AI-пайплайн
| Параметр | Только regex | AI-пайплайн |
|---|---|---|
| Точность (Precision) | ~60% | >90% |
| Полнота (Recall) | ~50% | >85% |
| Учёт контекста | нет | да |
| Ложные срабатывания | высокие | <5% |
| Адаптация под домен | ручные правки | auto-learning |
Сколько времени занимает?
Пилотный проект — 1–2 недели. Полное развёртывание с интеграцией и обучением — от 4 до 8 недель. Стоимость рассчитывается индивидуально, исходя из объёмов данных и числа источников. Свяжитесь с нами для аудита ваших данных — мы покажем, какие PII утекают в тени. Закажите консультацию: оценим ваш случай за один рабочий день.
Закажите пилотное сканирование ваших данных — получите отчёт за одну неделю. Свяжитесь с нами, чтобы договориться о демонстрации.







