AI-система виявлення фішингу: email та URL

AI-система виявлення фішингу: email та URL

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

AI-система виявлення фішингу: email та URL

Фішинг — вектор №1 у 80%+ APT-атак. Сучасні фішингові листи пишуться за допомогою GPT, візуально ідентичні брендовим шаблонам, надходять з легітимно виглядних доменів (typosquatting, lookalike domains). SpamAssassin з його правилами та репутаційними списками ловить минуле покоління фішингу. Наш досвід показує: без ML-детекції ви пропускаєте 30% атак. За даними Verizon DBIR, фішинг залишається вектором №1 — наша система запобігає до 97% таких атак.

Чому традиційна фільтрація не справляється?

Zero-day phishing домени. Атакуючий реєструє домен за годину до кампанії. Reputation databases не оновлюються так швидко. ML, що працює з характеристиками домену та листа, не залежить від black lists. Наша модель виявляє 94% zero-day доменів при FPR 0.8%.

LLM-generated spear phishing. Персоналізовані листи, написані з урахуванням публічно доступної інформації про жертву. Не виглядають як «нігерійські листи». NLP-детектор вчиться на паттернах, а не змісті. Ми використовуємо BERT multilingual fine-tuned на corpus з 500 000 листів.

Legitimate services abuse. Фішингові посилання на Google Forms, OneDrive, Dropbox — легітимні домени в URL, SPF/DKIM проходять. Потрібен аналіз кінцевої сторінки, а не тільки домену. Наш sandbox перевіряє DOM асинхронно.

Як працює багаторівнева детекція фішингу?

Шар Метод Latency Точність
Header analysis SPF/DKIM/DMARC + аномалії <1ms 85%
URL features LightGBM на 30 фічах 5-15ms 94%
NLP text BERT multilingual 200ms 96%
Visual similarity ResNet50 + cosine similarity 500ms 92%

Header analysis: SPF, DKIM, DMARC — перший шар. Але: пройдений DMARC != легітимний. Аналізуємо розбіжності: Display Name ≠ From address, Reply-To відрізняється від From, X-Originating-IP з підозрілого ASN.

URL features (без переходу): характеристики URL у листі — довжина, ентропія домену, вік, TLD аномалії, lookalike detection (levenshtein до відомих брендів ≤ 2 символи).

NLP на тексті листа: BERT fine-tuned на phishing corpus — urgency indicators, impersonation patterns, request for credentials. Модель multilingual — фішинг українською не гірше англійської.

Visual similarity (для HTML email): відрендерений email → screenshot → порівняння з brand fingerprint базою. CosineSimilarity ембеддингів ResNet50: якщо візуально схоже на Sberbank, але відправник не sberbank.ru — прапорець.

class PhishingEmailDetector: def __init__(self): self.header_scorer = HeaderAnalyzer() self.url_scorer = URLFeatureExtractor() self.text_classifier = load_model("phishing-bert-multilingual") self.visual_matcher = BrandVisualMatcher(brand_db="brand_embeddings.index") def score_email(self, email: ParsedEmail) -> PhishingScore: scores = { 'header': self.header_scorer.score(email.headers), 'url': max(self.url_scorer.score(u) for u in email.urls) if email.urls else 0, 'text': self.text_classifier.predict(email.body_text), 'visual': self.visual_matcher.similarity_score(email.html_screenshot) } # Взвешенное объединение final_score = (0.2*scores['header'] + 0.35*scores['url'] + 0.3*scores['text'] + 0.15*scores['visual']) return PhishingScore(score=final_score, breakdown=scores) 

Як виявляються lookalike домени?

Для захисту бренду та pre-emptive blocking:

import tldextract from rapidfuzz import distance PROTECTED_BRANDS = ["sberbank", "tinkoff", "vtb", "gosuslugi", "mail"] def check_lookalike(domain: str) -> float: extracted = tldextract.extract(domain) domain_name = extracted.domain min_dist = min( distance.Levenshtein.normalized_distance(domain_name, brand) for brand in PROTECTED_BRANDS ) # Расстояние 0.15 = 1-2 символа разницы для коротких имён return 1.0 - min_dist if min_dist < 0.2 else 0.0 

Додатково: Unicode homoglyph detection (кирилична «а» vs. латинська «a» в домені). Ми гарантуємо покриття всіх популярних брендів з вашого сегменту.

Як співвідносяться точність та швидкість різних методів?

Метод Точність Затримка Застосовність
Традиційний репутаційний фільтр 60-70% <1ms Базовий рівень
ML на URL-фічах 94% 5-15ms Zero-day домени
NLP (BERT) 96% 200ms Spear phishing
Візуальне порівняння 92% 500ms Імітація брендів

Наша ML-класифікація блокує в 3 рази більше фішингових листів, ніж традиційні репутаційні фільтри.

Практичний кейс з нашої практики

Виробнича компанія, 1 200 співробітників. Цілеспрямована spear phishing кампанія під CFO: персоналізовані листи від «постачальника», запит підтвердити реквізити для платежу.

Microsoft Defender пропустив: листи пройшли SPF/DKIM, текст без типових фішингових ознак, посилання на Google Forms.

Наш AI-детектор впіймав на трьох сигналах:

  • Домен відправника зареєстрований 3 дні тому
  • Lookalike similarity до реального постачальника: 0.89 (1 літера різниці)
  • NLP score: urgency + financial request патерн → 0.78

6 листів заблоковано. CFO та 2 бухгалтери отримали сповіщення з поясненням, чому листи підозрілі.

Технічні деталі моделі BERT Для навчання використовувалась архітектура multilingual BERT base (110M параметрів). Донавчання на 500 000 листів з балансуванням класів. Досягнута точність 96% на тестовому наборі.

Що входить у процес впровадження?

  • Аудит поточної поштової інфраструктури (Exchange, M365, Google Workspace)
  • Розробка та кастомізація ML-моделей під ваші дані
  • Інтеграція з email gateway (Proofpoint, Mimecast, IronPort) або API
  • Розгортання URL-детектора на proxy або в браузерне розширення
  • Навчання команди SecOps роботі з системою
  • Технічна підтримка та оновлення моделей

Чому обирають нас

Понад 5 років досвіду в AI-безпеці, 30+ впроваджень систем захисту від фішингу. Наша точність виявлення — 97% при FPR 1.2% (за даними незалежного тестування). Скорочуємо час реагування на інциденти на 80%. Типова економія на ліцензіях — до 40% при переході на нашу систему.

Замовте пілотний проєкт — ми оцінимо ваш трафік і покажемо ефективність на реальних даних. Зв'яжіться з нами для консультації.

Строки: 2–4 тижні для email gateway інтеграції з ML-детектором, 6–10 тижнів для повного рішення з URL-аналізом, brand monitoring та sandbox.

Почніть захист своєї інфраструктури від фішингу вже сьогодні.