Краулер для сбора структуры сайтов конкурентов: автоматический анализ

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Краулер для сбора структуры сайтов конкурентов: автоматический анализ
Средний
~3-5 дней
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1252
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    958
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    949

Вы тратите дни на ручной сбор 200 URL конкурентов, выписывая заголовки и мета-описания. Через месяц ребрендинг — и всё сначала. Краулер решает это за минуты и воспроизводится автоматически. Мы — команда с 7-летним опытом в веб-скрапинге: реализовали 15+ таких решений для разных ниш. Одна из частых проблем — неполный сбор из-за JavaScript-рендеринга. Даже статичный сайт может содержать динамические элементы, которые не видны обычному HTTP-запросу. Краулер с headless-браузером выявляет реальную структуру, включая ленивую загрузку. В результате вы получаете полную карту сайта конкурента: все URL, заголовки, мета-теги, Schema.org. Такой подход экономит до 20 часов работы в неделю и даёт преимущество в SEO-анализе.

Какие проблемы решает краулер для структуры сайта?

Частая боль — неполный сбор структуры из-за JavaScript-рендеринга, вложенности URL или канонических дублей. Например, интернет-магазин на Vue.js может выдавать одинаковый контент на разных URL, что искажает карту сайта. Краулер с headless-браузером выявляет реальную структуру, включая динамические подгрузки.

Ещё одна проблема — анализ Schema.org. Без structured data невозможно оценить, как конкурент использует богатые сниппеты. Краулер собирает JSON-LD и Microdata, позволяя копировать успешные паттерны.

Какую архитектуру используем для краулинга?

Два рабочих варианта: Python + Scrapy/Playwright для сложных SPA с ленивой загрузкой, Node.js + Puppeteer/Cheerio для большинства стандартных сайтов. В задачах, где нет динамического JS-рендеринга, хватает HTTP-клиента с HTML-парсером — быстрее в 5–10 раз, проще в деплое.

Характеристика HTTP-краулер Headless-краулер
Скорость на страницу 0.3–0.8 с 2–5 с
Поддержка JS Нет Полная
Нагрузка на сервер Низкая Умеренная
Сложность деплоя Минимальная Средняя

Минимальная Python-реализация на основе requests + lxml:

import requests
from lxml import html
from urllib.parse import urljoin, urlparse
from collections import deque
import time
from urllib.robotparser import RobotFileParser

class SiteStructureCrawler:
    def __init__(self, base_url: str, max_depth: int = 4, delay: float = 1.0):
        self.base_url = base_url
        self.domain = urlparse(base_url).netloc
        self.max_depth = max_depth
        self.delay = delay
        self.visited: dict[str, dict] = {}
        self.queue: deque = deque([(base_url, 0)])
        # Проверка robots.txt
        rp = RobotFileParser()
        rp.set_url(f'{base_url}/robots.txt')
        rp.read()
        self.rp = rp

    def crawl(self):
        session = requests.Session()
        session.headers['User-Agent'] = (
            'Mozilla/5.0 (compatible; SiteAnalyzer/1.0; +https://example.com/bot)'
        )

        while self.queue:
            url, depth = self.queue.popleft()
            if url in self.visited or depth > self.max_depth:
                continue
            if not self.rp.can_fetch('*', url):
                continue  # пропускаем запрещённые пути

            try:
                resp = session.get(url, timeout=10, allow_redirects=True)
                resp.raise_for_status()
            except requests.RequestException as e:
                self.visited[url] = {'error': str(e), 'depth': depth}
                continue

            doc = html.fromstring(resp.content)
            doc.make_links_absolute(url)

            title = doc.findtext('.//title') or ''
            h1 = [h.text_content().strip() for h in doc.cssselect('h1')]
            meta_desc_el = doc.cssselect('meta[name="description"]')
            meta_desc = meta_desc_el[0].get('content', '') if meta_desc_el else ''
            canonical_el = doc.cssselect('link[rel="canonical"]')
            canonical = canonical_el[0].get('href', '') if canonical_el else ''
            noindex = bool(doc.cssselect('meta[name="robots"][content*="noindex"]'))

            # Сбор Schema.org и заголовков
            schemas = []
            for script in doc.cssselect('script[type="application/ld+json"]'):
                try:
                    import json
                    data = json.loads(script.text_content())
                    schemas.append(data)
                except json.JSONDecodeError:
                    pass
            headings = []
            for tag in ['h1', 'h2', 'h3', 'h4']:
                for el in doc.cssselect(tag):
                    headings.append({'tag': tag, 'text': el.text_content().strip()})

            links = []
            for a in doc.cssselect('a[href]'):
                href = a.get('href', '').strip()
                parsed = urlparse(href)
                if parsed.netloc == self.domain and href not in self.visited:
                    links.append(href)
                    if depth + 1 <= self.max_depth:
                        self.queue.append((href, depth + 1))

            self.visited[url] = {
                'depth': depth,
                'status': resp.status_code,
                'title': title.strip(),
                'h1': h1,
                'meta_description': meta_desc,
                'canonical': canonical,
                'noindex': noindex,
                'internal_links': links,
                'content_type': resp.headers.get('Content-Type', ''),
                'schema': schemas,
                'headings': headings,
            }

            time.sleep(self.delay)

        return self.visited

Работа с JavaScript-рендерингом

Если сайт конкурента — SPA (React/Vue/Angular) или использует lazy-load для основного контента, обычный HTTP-краулер вернёт пустые страницы. Здесь нужен headless-браузер:

from playwright.sync_api import sync_playwright

def crawl_spa_page(url: str) -> dict:
    with sync_playwright() as p:
        browser = p.chromium.launch(headless=True)
        page = browser.new_page()
        page.goto(url, wait_until='networkidle', timeout=30000)

        title = page.title()
        h1_elements = page.query_selector_all('h1')
        h1_texts = [el.inner_text() for el in h1_elements]

        # Сбор всех ссылок после рендеринга
        links = page.eval_on_selector_all(
            'a[href]',
            'els => els.map(e => e.href)'
        )

        browser.close()
        return {'title': title, 'h1': h1_texts, 'links': links}

Playwright добавляет ~2–5 секунд на страницу против 0.3–0.8 секунды для обычного HTTP. При краулинге 500+ страниц это ощутимо — используется только там, где без него не обойтись.

Как автоматизировать регулярный краулинг?

Разовый сбор данных быстро устаревает. Конкуренты меняют структуру, добавляют разделы, переформатируют заголовки. Полезно настроить автоматический запуск раз в неделю/месяц и сравнивать результаты:

def diff_structures(old: dict, new: dict) -> dict:
    added = {url: data for url, data in new.items() if url not in old}
    removed = {url: data for url, data in old.items() if url not in new}
    changed = {}
    for url in old:
        if url in new:
            if old[url].get('title') != new[url].get('title'):
                changed[url] = {
                    'old_title': old[url].get('title'),
                    'new_title': new[url].get('title'),
                }
    return {'added': added, 'removed': removed, 'changed': changed}

Почему важен сбор Schema.org?

Structured data — прямой индикатор того, насколько конкурент вкладывается в SEO. Наличие Article, Product, BreadcrumbList, FAQPage даёт преимущество в выдаче. Краулер фиксирует все типы разметки, позволяя вам перенять успешные схемы.

Настройка и запуск краулера

Чтобы начать сбор, выполните несколько шагов:

  1. Клонируйте репозиторий с готовым краулером.
  2. Установите зависимости: pip install requests lxml (или playwright для SPA).
  3. Укажите стартовый URL и максимальную глубину обхода.
  4. Запустите скрипт: python crawler.py.
  5. После завершения получите отчёт — файл в формате JSON или CSV.

Результаты и автоматизация

Собранная структура экспортируется в несколько форматов в зависимости от задачи:

Формат Когда использовать Преимущества
JSON Программная обработка, интеграция с API Полнота данных, вложенность
CSV Анализ в Excel/Google Sheets Простота, сортировка
SQLite Регулярный краулинг, история изменений Быстрые запросы, поддержка diff
import json
import csv

# JSON — для программной обработки
with open('competitor_structure.json', 'w', encoding='utf-8') as f:
    json.dump(crawler.visited, f, ensure_ascii=False, indent=2)

# CSV — для анализа в Excel/Google Sheets
fieldnames = ['url', 'depth', 'status', 'title', 'meta_description', 'h1', 'noindex', 'canonical']
with open('competitor_structure.csv', 'w', newline='', encoding='utf-8') as f:
    writer = csv.DictWriter(f, fieldnames=fieldnames, extrasaction='ignore')
    writer.writeheader()
    for url, data in crawler.visited.items():
        row = {'url': url, **data}
        if isinstance(row.get('h1'), list):
            row['h1'] = ' | '.join(row['h1'])
        writer.writerow(row)

Что входит в работу?

  • Разработка краулера с учётом специфики вашей ниши: выбор стека (Python или Node.js), настройка depth, задержек, robots.txt.
  • Интеграция с headless-браузером для SPA-сайтов.
  • Сбор всех URL, заголовков H1-H6, meta-тегов, canonical, noindex, Schema.org.
  • Экспорт в JSON, CSV или SQLite по вашему выбору.
  • Автоматизация запуска через cron/Airflow с сохранением истории изменений.
  • Документация по эксплуатации и консультация по анализу результатов.

Сроки и гарантии

Базовый краулер (HTTP, без SPA) с экспортом в CSV/JSON — от 1 до 2 рабочих дней. С поддержкой JavaScript-рендеринга, сбором Schema.org, дифф-сравнением и SQLite-хранилищем — от 3 до 4 дней. Интеграция с планировщиком и уведомлениями при изменениях — ещё от 1 до 2 дней.

Мы гарантируем, что краулер уважает robots.txt (Robots.txt) — обязательная проверка перед каждым запросом. Задержка между запросами (минимум 1 секунда) предотвращает блокировку по IP. Для регулярного краулинга используем ротацию User-Agent и прокси.

Типичные ошибки при разработке краулера:

  • Игнорирование robots.txt — риск блокировки IP.
  • Слишком быстрый краулинг (delay < 1 сек) — бан от сервера.
  • Пропуск проверки canonical — дубли раздувают структуру.
  • Отсутствие обработки циклических ссылок — бесконечный обход.
  • Неучёт пагинации (page/2, page/3) — неполный сбор.

Свяжитесь с нами для консультации. Закажите разработку краулера под вашу нишу. Получите бесплатный анализ ваших конкурентов и рекомендации по краулингу.

Почему Core Web Vitals критичны для технического SEO

PageSpeed показывает 34/100 на мобильных. В Search Console — красные метрики по всем страницам категорий. Конкурент с сайтом на 3 года старше стоит выше в выдаче, несмотря на более слабые тексты. Техническая производительность стала прямым ранжирующим фактором — и разрыв между «приемлемо» и «быстро» стоит позиций. Мы решали эту проблему для десятков проектов — от интернет-магазинов до SaaS-платформ — и знаем, какие ошибки съедают ранжирование.

Core Web Vitals: что реально влияет на позиции

Google использует три метрики как сигналы ранжирования (Page Experience): LCP (Largest Contentful Paint), CLS (Cumulative Layout Shift), INP (Interaction to Next Paint, заменил FID с последнего крупного обновления алгоритма).

LCP: почему 8 секунд — это не проблема изображения

LCP измеряет время отрисовки самого большого видимого элемента страницы. Чаще всего — hero image или H1. Пороги: хорошо < 2.5s, плохо > 4s.

Типичный диагноз на реальном проекте: интернет-магазин одежды, LCP 7.8s на мобильных. Элемент — hero image категории, 4.2MB JPEG без srcset, загружается через CSS background-image (не <img>). Проблема здесь двойная: во-первых, браузер не может preload CSS background images через <link rel="preload"> стандартным способом. Во-вторых, 4.2MB на мобильном соединении — это физически медленно.

Решение по шагам:

  1. Переносим hero из CSS background в <img> с fetchpriority="high" и loading="eager"
  2. Конвертируем в WebP, добавляем srcset: 800w для мобильных, 1400w для десктопа
  3. <link rel="preload" as="image" href="hero-800.webp" media="(max-width: 768px)"> в <head>
  4. Убираем все render-blocking скрипты выше hero через defer

Итог: LCP 7.8s → 1.9s. Без смены хостинга, без CDN.

Если LCP — не изображение, а текстовый блок: проблема может быть в TTFB (медленный сервер), в render-blocking CSS/JS, или в web fonts с font-display: block.

CLS: смещения, которые раздражают пользователя и Google

CLS измеряет суммарный сдвиг элементов в процессе загрузки. Пороги: хорошо < 0.1, плохо > 0.25. CLS 0.35 — это баннер, который появляется через секунду и сдвигает всё содержимое страницы вниз.

Источники CLS:

  • Изображения без заданных размеров. <img src="photo.jpg"> без width и height — браузер не резервирует место, контент прыгает при загрузке. Фикс: явные width/height или aspect-ratio в CSS.
  • Рекламные блоки и виджеты. Google Ads, чат-виджеты, cookie consent — всё, что появляется после основного контента. Решение: резервировать место через min-height или загружать до рендера основного контента.
  • Web fonts. FOUT (Flash of Unstyled Text) и FOIT (Flash of Invisible Text) могут вызывать переформатирование. font-display: swap с size-adjust (CSS свойство для выравнивания размеров fallback шрифта) минимизирует CLS.
  • Динамический контент. Если блок появляется после загрузки (fetch данных, lazy load) — добавляем skeleton placeholder с нужными размерами.
Типичный сценарий CLS до CLS после Основной фикс
Баннер скидок без min-height 0.42 0.02 min-height: 300px
Картинки в статьях без атрибутов 0.18 0.01 width/height + aspect-ratio
Виджет чата, загружаемый через 3с 0.35 0.05 position: fixed с зарезервированным отступом

INP: почему интерфейс «зависает» на 500ms

INP измеряет задержку ответа на любое взаимодействие пользователя: клик, тап, ввод. Пороги: хорошо < 200ms, плохо > 500ms. INP 680ms — это когда пользователь нажимает кнопку фильтра, а ничего не происходит полсекунды.

Главная причина высокого INP — заблокированный main thread. JavaScript-бандл 2.1MB парсируется и выполняется синхронно. Пока выполняется, пользовательские события не обрабатываются.

Диагностика через Chrome DevTools → Performance → взаимодействие с подозрительной задержкой → найти Long Tasks (> 50ms). Типичные виновники:

  • Непрерывная обработка большого списка без requestIdleCallback или requestAnimationFrame
  • Тяжёлые event listeners без debounce/throttle
  • Синхронный setState в React, который триггерит полный ре-рендер сложного дерева компонентов
  • Third-party scripts: livechat, аналитика, виджеты — они исполняются в том же main thread

Решения: code splitting через динамический import(), перенос тяжёлых вычислений в Web Workers, React.memo + useMemo для предотвращения лишних ре-рендеров, scheduler API для приоритизации задач.

Schema.org: разметка, которую читают роботы

Структурированные данные через JSON-LD — не прямой ранжирующий фактор, но дают rich snippets в выдаче (звёзды рейтингов, цены, дата публикации), что увеличивает CTR на 20–30%.

Типы разметки по сценариям:

  • E-commerce: Product с offers (цена, наличие, валюта), aggregateRating (рейтинг из отзывов), brand. BreadcrumbList для навигации. ItemList для страниц категорий.
  • Статьи и блог: Article или BlogPosting с author, datePublished, dateModified, image. Organization и WebSite на главной странице — помогают Google связать сайт с брендом.
  • Локальный бизнес: LocalBusiness с address, telephone, openingHours, geo. Критично для локального SEO.
  • FAQ: FAQPage с mainEntity — вопросы и ответы могут появляться прямо в выдаче как раскрывающийся блок.

Валидация: Google Rich Results Test и Schema Markup Validator. Частая ошибка — указать price без priceCurrency, или ratingValue без reviewCount. Google игнорирует неполную разметку.

Как проводить технический SEO-аудит

Сканируемость. robots.txt блокирует нужные страницы (или наоборот, не блокирует служебные). Canonical URLs настроены неправильно — дублируются страницы с UTM-метками. Sitemap содержит страницы с noindex. Всё это Screaming Frog или Sitebulb покажут за час сканирования.

Core Web Vitals в масштабе. Google Search Console → Core Web Vitals → смотрим не отдельные страницы, а группы URL (шаблон страницы продукта, шаблон категории, блог). Проблема обычно системная — одна ошибка в шаблоне портит сотни страниц.

JavaScript SEO. Google рендерит JavaScript, но с задержкой (иногда дни для полного рендера). Для критичного контента — SSR или SSG обязательны. Проверяем через Search Console → Inspect URL → View Crawled Page: что видит Googlebot.

Internal linking. Орфанные страницы (нет входящих внутренних ссылок) теряют PageRank. Битые ссылки (404) — сигнал качества.

Типичные ошибки при внедрении Schema.org
  • Указан price без priceCurrency — разметка игнорируется.
  • ratingValue без reviewCount — в выдаче не показывается.
  • Несколько Product на одной странице без @type: ItemList — Google берёт только первый.
  • JSON-LD в GTM — Google не всегда видит динамическую разметку, лучше серверный рендеринг.
Этап работы Что входит Срок
Аудит Сканирование, анализ Core Web Vitals, аудит Schema, отчёт с приоритетами 1–2 недели
Оптимизация одного шаблона LCP, CLS, INP, внедрение SSR/SSG, настройка preload 2–4 недели
Полная техническая оптимизация Все шаблоны, code splitting, Web Workers, мониторинг в CI 4–10 недель
Внедрение Schema.org JSON-LD генерация, валидация, тестирование rich snippets 1–3 недели

Что входит в работу

  • Документация: отчёт с найденными проблемами, roadmap по приоритетам, тайминги для каждого этапа.
  • Доступы: настройка мониторинга (SpeedCurve, Sentry Search Console), передача dashboard.
  • Обучение: разбор типичных ошибок для вашей команды (1–2 созвона).
  • Поддержка: сопровождение в течение месяца после деплоя — проверка метрик, фикс регрессий.

Свяжитесь с нами — мы оценим ваш проект за 2 дня и покажем, сколько позиций можно вернуть за счёт технического SEO. Опыт работы с проектами уровня сотен тысяч посещений в месяц — гарантируем измеримый результат в Core Web Vitals до/после. Закажите аудит в этой форме — получите персональный чек-лист из 15 пунктов.