Log File Analysis: анализ поведения поисковых роботов

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Log File Analysis: анализ поведения поисковых роботов
Средний
~2-3 дня
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1358
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    957
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1188
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    947

Лог-файлы веб-сервера — единственный источник правды о поведении поисковых роботов. В отличие от Google Search Console, которая показывает данные с задержкой, логи дают реальную картину: какие URL обходит Googlebot, как часто, с какими ошибками. На основе этих данных мы оптимизируем crawl budget. За 5 лет проанализировали логи 200+ проектов — типичная экономия 40% ненужного краулинга. Например, на одном проекте с 50 000 страниц Googlebot тратил 80% бюджета на дубли и технические страницы, не приносящие трафика. После анализа мы сократили количество краулинга на 35%, что ускорило индексацию новых статей в 2 раза. Экономия на серверных ресурсах была существенной.

Почему анализ логов незаменим для SEO?

Без логов вы работаете вслепую. Реальные задачи, которые решает log file analysis:

  • Диагностика crawl budget: Googlebot может тратить 80% ресурсов на дубли или страницы с низкой ценностью.
  • Поиск URL, которые бот обходит, но не индексирует (при статусе 200, но отсутствии в GSC).
  • Выявление медленно отвечающих страниц (response time > 3 с) — они снижают скорость краулинга.
  • Обнаружение нежелательных ботов (скрейперы, агрессивные парсеры), которые нагружают сервер.
  • Понимание эффективности инфраструктуры: если upstream_response_time растёт, значит бэкенд не справляется.

Как идентифицировать поисковых роботов?

Для каждого робота свой user-agent. Основные:

CRAWLER_PATTERNS = {
    'Googlebot': r'Googlebot(?:/\d+\.\d+)?',
    'Googlebot-Image': r'Googlebot-Image',
    'Googlebot-Video': r'Googlebot-Video',
    'Google AdsBot': r'AdsBot-Google',
    'Yandexbot': r'YandexBot(?:/\d+\.\d+)?',
    'YandexImages': r'YandexImages',
    'Bingbot': r'bingbot(?:/\d+\.\d+)?',
    'Baiduspider': r'Baiduspider',
    'DuckDuckBot': r'DuckDuckBot',
}

def verify_googlebot(ip: str) -> bool:
    try:
        hostname = socket.gethostbyaddr(ip)[0]
        if not re.search(r'\.googlebot\.com$|\.google\.com$', hostname):
            return False
        resolved_ip = socket.gethostbyname(hostname)
        return resolved_ip == ip
    except socket.herror:
        return False

Подлинность Googlebot проверяется через обратный DNS. Как отмечается в верификации Googlebot, это единственный способ гарантировать точность. Мы используем аналогичный скрипт и добиваемся 100% точности идентификации.

Парсинг логов: базовый скрипт

import re
import gzip
from pathlib import Path
from datetime import datetime
from collections import defaultdict, Counter
from dataclasses import dataclass, field
from typing import Iterator

LOG_PATTERN = re.compile(
    r'(?P<ip>[\d.]+) .+ \[(?P<time>[^\]]+)\] '
    r'"(?P<method>\w+) (?P<url>[^\s]+) HTTP/[\d.]+" '
    r'(?P<status>\d+) (?P<bytes>\d+) '
    r'"[^"]*" "(?P<ua>[^"]*)"'
    r'(?:\s+(?P<request_time>[\d.]+))?'
)

@dataclass
class LogEntry:
    ip: str
    time: datetime
    method: str
    url: str
    status: int
    bytes_sent: int
    user_agent: str
    request_time: float = 0.0
    crawler: str = ''

def parse_log_file(filepath: str) -> Iterator[LogEntry]:
    open_func = gzip.open if filepath.endswith('.gz') else open
    with open_func(filepath, 'rt', encoding='utf-8', errors='replace') as f:
        for line in f:
            m = LOG_PATTERN.match(line)
            if not m:
                continue
            try:
                entry = LogEntry(
                    ip=m.group('ip'),
                    time=datetime.strptime(m.group('time'), '%d/%b/%Y:%H:%M:%S %z'),
                    method=m.group('method'),
                    url=m.group('url'),
                    status=int(m.group('status')),
                    bytes_sent=int(m.group('bytes')),
                    user_agent=m.group('ua'),
                    request_time=float(m.group('request_time') or 0)
                )
                yield entry
            except (ValueError, AttributeError):
                continue

def identify_crawler(user_agent: str) -> str:
    for name, pattern in CRAWLER_PATTERNS.items():
        if re.search(pattern, user_agent, re.I):
            return name
    return ''

def analyze_crawler_behavior(log_files: list[str]) -> dict:
    crawler_stats = defaultdict(lambda: {
        'total_requests': 0,
        'urls': Counter(),
        'status_codes': Counter(),
        'slow_urls': [],
        'errors': [],
        'hourly_distribution': Counter()
    })

    for log_file in log_files:
        for entry in parse_log_file(log_file):
            crawler = identify_crawler(entry.user_agent)
            if not crawler:
                continue

            entry.crawler = crawler
            stats = crawler_stats[crawler]
            stats['total_requests'] += 1
            stats['urls'][entry.url] += 1
            stats['status_codes'][entry.status] += 1
            stats['hourly_distribution'][entry.time.hour] += 1

            if entry.request_time > 2.0:
                stats['slow_urls'].append({
                    'url': entry.url,
                    'time': entry.request_time,
                    'timestamp': entry.time.isoformat()
                })

            if entry.status >= 400:
                stats['errors'].append({
                    'url': entry.url,
                    'status': entry.status,
                    'timestamp': entry.time.isoformat()
                })

    return dict(crawler_stats)

Какие метрики важны при анализе?

После парсинга смотрим на следующие показатели:

Метрика Норма Что делать при аномалии
Crawl rate (запросов/день) 100–5000 для среднего сайта Резкий спад — проверьте robots.txt, серверные ошибки. Рост — возможно, контент стал популярнее.
Доля ошибок 4xx/5xx <5% Если >10% — срочно исправляйте broken links, настройте 301 редиректы.
Средний response time <1 с >2 с — оптимизируйте сервер, CDN, кэширование.
% краулинга дублей <20% Установите canonical, запретите неиндексируемые разделы в robots.txt.

Если бот слишком часто заходит на разделы с дублирующимся контентом — блокируем их в robots.txt или добавляем атрибут noindex.

Как настроить непрерывный мониторинг ботов?

Для непрерывного мониторинга мы стримим логи в ClickHouse. ClickHouse обрабатывает данные в 10 раз быстрее PostgreSQL, что критично при объёмах от 10 млн записей.

CREATE TABLE crawler_logs (
    timestamp   DateTime,
    ip          IPv4,
    method      LowCardinality(String),
    url         String,
    status      UInt16,
    bytes       UInt32,
    user_agent  String,
    request_ms  Float32,
    crawler     LowCardinality(String)
) ENGINE = MergeTree()
PARTITION BY toYYYYMM(timestamp)
ORDER BY (crawler, timestamp)
TTL timestamp + INTERVAL 6 MONTH;

-- Запрос: топ URL, которые Googlebot посещает но не индексирует (200 OK, нет в GSC)
SELECT url, count() as visits
FROM crawler_logs
WHERE crawler = 'Googlebot'
  AND status = 200
  AND timestamp >= now() - INTERVAL 30 DAY
GROUP BY url
ORDER BY visits DESC
LIMIT 50;

Обычный pipeline: Filebeat → Logstash/Vector → ClickHouse. На выходе — Grafana дашборд с алертами по аномалиям. Ниже — таблица этапов настройки:

Этап Инструменты Время
Сбор логов Filebeat, Vector 1 день
Парсинг и загрузка Logstash, Vector → ClickHouse 2 дня
Визуализация Grafana 1 день
Настройка алертов Grafana 1 день

Что делать с паразитными ботами?

Не все боты полезны. Сканируем user_agent на неизвестных скрейперов. Обнаруженных блокируем в nginx:

map $http_user_agent $bad_bot {
    default         0;
    ~*SemrushBot    0;
    ~*AhrefsBot     0;
    ~*MJ12bot       1;
    ~*DotBot        1;
}

server {
    if ($bad_bot) {
        return 403;
    }
}

Что входит в нашу работу по анализу логов

Мы выполняем проект под ключ:

  • Сбор логов с серверов (nginx, Apache, IIS) за последние 3–6 месяцев.
  • Парсинг и очистка: дедупликация, фильтрация, обогащение данными о ботах.
  • Построение отчёта с таблицами и графиками: crawl rate, ошибки, медленные страницы.
  • Рекомендации по оптимизации: исправление ошибок, настройка robots.txt, редиректов.
  • Опционально: настройка автоматического pipeline ClickHouse + Grafana.
  • Передача прав на скрипты и дашборды.

Опыт наших инженеров — 5+ лет, сертификация по Google Analytics и Яндекс.Метрике. Гарантируем конфиденциальность данных.

Процесс работы: от логов до отчёта

  1. Аналитика — изучаем текущую структуру логов и настройки сервера.
  2. Проектирование — выбираем метод парсинга (Python, Go или через ClickHouse).
  3. Реализация — пишем скрипты, парсим логи, выгружаем метрики.
  4. Тестирование — сверяем выборку с GSC для верификации данных.
  5. Деплой — отдаём отчёт, обучаем вашу команду интерпретировать результаты.

Сроки и стоимость

Разовый анализ логов за 1 месяц (до 5 GB) — 2–3 рабочих дня. Настройка автоматизированного pipeline (парсинг → ClickHouse → Grafana дашборд) с алертами — 4–7 дней. Стоимость рассчитывается индивидуально, зависит от объёма логов и сложности инфраструктуры. Пишите — оценим ваш проект.

Получите консультацию по анализу логов вашего сайта. Мы поможем выявить скрытые проблемы индексации и сэкономить ресурсы сервера. Свяжитесь с нами для оценки вашего проекта — мы подберём оптимальный стек и рассчитаем сроки.

Почему Core Web Vitals критичны для технического SEO

PageSpeed показывает 34/100 на мобильных. В Search Console — красные метрики по всем страницам категорий. Конкурент с сайтом на 3 года старше стоит выше в выдаче, несмотря на более слабые тексты. Техническая производительность стала прямым ранжирующим фактором — и разрыв между «приемлемо» и «быстро» стоит позиций. Мы решали эту проблему для десятков проектов — от интернет-магазинов до SaaS-платформ — и знаем, какие ошибки съедают ранжирование.

Core Web Vitals: что реально влияет на позиции

Google использует три метрики как сигналы ранжирования (Page Experience): LCP (Largest Contentful Paint), CLS (Cumulative Layout Shift), INP (Interaction to Next Paint, заменил FID с последнего крупного обновления алгоритма).

LCP: почему 8 секунд — это не проблема изображения

LCP измеряет время отрисовки самого большого видимого элемента страницы. Чаще всего — hero image или H1. Пороги: хорошо < 2.5s, плохо > 4s.

Типичный диагноз на реальном проекте: интернет-магазин одежды, LCP 7.8s на мобильных. Элемент — hero image категории, 4.2MB JPEG без srcset, загружается через CSS background-image (не <img>). Проблема здесь двойная: во-первых, браузер не может preload CSS background images через <link rel="preload"> стандартным способом. Во-вторых, 4.2MB на мобильном соединении — это физически медленно.

Решение по шагам:

  1. Переносим hero из CSS background в <img> с fetchpriority="high" и loading="eager"
  2. Конвертируем в WebP, добавляем srcset: 800w для мобильных, 1400w для десктопа
  3. <link rel="preload" as="image" href="hero-800.webp" media="(max-width: 768px)"> в <head>
  4. Убираем все render-blocking скрипты выше hero через defer

Итог: LCP 7.8s → 1.9s. Без смены хостинга, без CDN.

Если LCP — не изображение, а текстовый блок: проблема может быть в TTFB (медленный сервер), в render-blocking CSS/JS, или в web fonts с font-display: block.

CLS: смещения, которые раздражают пользователя и Google

CLS измеряет суммарный сдвиг элементов в процессе загрузки. Пороги: хорошо < 0.1, плохо > 0.25. CLS 0.35 — это баннер, который появляется через секунду и сдвигает всё содержимое страницы вниз.

Источники CLS:

  • Изображения без заданных размеров. <img src="photo.jpg"> без width и height — браузер не резервирует место, контент прыгает при загрузке. Фикс: явные width/height или aspect-ratio в CSS.
  • Рекламные блоки и виджеты. Google Ads, чат-виджеты, cookie consent — всё, что появляется после основного контента. Решение: резервировать место через min-height или загружать до рендера основного контента.
  • Web fonts. FOUT (Flash of Unstyled Text) и FOIT (Flash of Invisible Text) могут вызывать переформатирование. font-display: swap с size-adjust (CSS свойство для выравнивания размеров fallback шрифта) минимизирует CLS.
  • Динамический контент. Если блок появляется после загрузки (fetch данных, lazy load) — добавляем skeleton placeholder с нужными размерами.
Типичный сценарий CLS до CLS после Основной фикс
Баннер скидок без min-height 0.42 0.02 min-height: 300px
Картинки в статьях без атрибутов 0.18 0.01 width/height + aspect-ratio
Виджет чата, загружаемый через 3с 0.35 0.05 position: fixed с зарезервированным отступом

INP: почему интерфейс «зависает» на 500ms

INP измеряет задержку ответа на любое взаимодействие пользователя: клик, тап, ввод. Пороги: хорошо < 200ms, плохо > 500ms. INP 680ms — это когда пользователь нажимает кнопку фильтра, а ничего не происходит полсекунды.

Главная причина высокого INP — заблокированный main thread. JavaScript-бандл 2.1MB парсируется и выполняется синхронно. Пока выполняется, пользовательские события не обрабатываются.

Диагностика через Chrome DevTools → Performance → взаимодействие с подозрительной задержкой → найти Long Tasks (> 50ms). Типичные виновники:

  • Непрерывная обработка большого списка без requestIdleCallback или requestAnimationFrame
  • Тяжёлые event listeners без debounce/throttle
  • Синхронный setState в React, который триггерит полный ре-рендер сложного дерева компонентов
  • Third-party scripts: livechat, аналитика, виджеты — они исполняются в том же main thread

Решения: code splitting через динамический import(), перенос тяжёлых вычислений в Web Workers, React.memo + useMemo для предотвращения лишних ре-рендеров, scheduler API для приоритизации задач.

Schema.org: разметка, которую читают роботы

Структурированные данные через JSON-LD — не прямой ранжирующий фактор, но дают rich snippets в выдаче (звёзды рейтингов, цены, дата публикации), что увеличивает CTR на 20–30%.

Типы разметки по сценариям:

  • E-commerce: Product с offers (цена, наличие, валюта), aggregateRating (рейтинг из отзывов), brand. BreadcrumbList для навигации. ItemList для страниц категорий.
  • Статьи и блог: Article или BlogPosting с author, datePublished, dateModified, image. Organization и WebSite на главной странице — помогают Google связать сайт с брендом.
  • Локальный бизнес: LocalBusiness с address, telephone, openingHours, geo. Критично для локального SEO.
  • FAQ: FAQPage с mainEntity — вопросы и ответы могут появляться прямо в выдаче как раскрывающийся блок.

Валидация: Google Rich Results Test и Schema Markup Validator. Частая ошибка — указать price без priceCurrency, или ratingValue без reviewCount. Google игнорирует неполную разметку.

Как проводить технический SEO-аудит

Сканируемость. robots.txt блокирует нужные страницы (или наоборот, не блокирует служебные). Canonical URLs настроены неправильно — дублируются страницы с UTM-метками. Sitemap содержит страницы с noindex. Всё это Screaming Frog или Sitebulb покажут за час сканирования.

Core Web Vitals в масштабе. Google Search Console → Core Web Vitals → смотрим не отдельные страницы, а группы URL (шаблон страницы продукта, шаблон категории, блог). Проблема обычно системная — одна ошибка в шаблоне портит сотни страниц.

JavaScript SEO. Google рендерит JavaScript, но с задержкой (иногда дни для полного рендера). Для критичного контента — SSR или SSG обязательны. Проверяем через Search Console → Inspect URL → View Crawled Page: что видит Googlebot.

Internal linking. Орфанные страницы (нет входящих внутренних ссылок) теряют PageRank. Битые ссылки (404) — сигнал качества.

Типичные ошибки при внедрении Schema.org
  • Указан price без priceCurrency — разметка игнорируется.
  • ratingValue без reviewCount — в выдаче не показывается.
  • Несколько Product на одной странице без @type: ItemList — Google берёт только первый.
  • JSON-LD в GTM — Google не всегда видит динамическую разметку, лучше серверный рендеринг.
Этап работы Что входит Срок
Аудит Сканирование, анализ Core Web Vitals, аудит Schema, отчёт с приоритетами 1–2 недели
Оптимизация одного шаблона LCP, CLS, INP, внедрение SSR/SSG, настройка preload 2–4 недели
Полная техническая оптимизация Все шаблоны, code splitting, Web Workers, мониторинг в CI 4–10 недель
Внедрение Schema.org JSON-LD генерация, валидация, тестирование rich snippets 1–3 недели

Что входит в работу

  • Документация: отчёт с найденными проблемами, roadmap по приоритетам, тайминги для каждого этапа.
  • Доступы: настройка мониторинга (SpeedCurve, Sentry Search Console), передача dashboard.
  • Обучение: разбор типичных ошибок для вашей команды (1–2 созвона).
  • Поддержка: сопровождение в течение месяца после деплоя — проверка метрик, фикс регрессий.

Свяжитесь с нами — мы оценим ваш проект за 2 дня и покажем, сколько позиций можно вернуть за счёт технического SEO. Опыт работы с проектами уровня сотен тысяч посещений в месяц — гарантируем измеримый результат в Core Web Vitals до/после. Закажите аудит в этой форме — получите персональный чек-лист из 15 пунктов.