Настройка сканирования сайта через Screaming Frog

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Настройка сканирования сайта через Screaming Frog
Средний
от 1 дня до 3 дней
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    957
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1189
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    948

Битые ссылки — не единственная головная боль техлида. Кривые canonical, дубли title, N+1 редиректов — каждый из этих багов снижает позиции в выдаче. Screaming Frog SEO Spider — де-факто стандарт технического аудита. Мы используем его в каждом проекте и настраиваем автоматический краулинг для регулярного мониторинга. Многолетний опыт нашей команды подтверждает: ни одна проблема не останется незамеченной. Экономия на ручном аудите достигает 70–90% за счёт автоматизации. Стоимость настройки варьируется от 15 000 до 45 000 рублей в зависимости от объёма. Получите консультацию — подберём конфигурацию под ваш стек.

Какие проблемы решает Screaming Frog?

  • Битые ссылки и редиректы: находим 4xx и 5xx ошибки, цепочки редиректов, циклические перенаправления. На одном проекте с каталогом в 20 000 товаров обнаружили 12-звенную цепочку редиректов — ранжирование упало на 30%.
  • Проблемы с мета-тегами: отсутствующие или дублированные title, слишком длинные мета-описания, кривые H1. Краулер подсвечивает все несоответствия.
  • Проблемы индексации: страницы без canonical, неправильные hreflang, закрытые в robots.txt URL, которые должны индексироваться. Например, блокировка страниц фильтрации приводит к потере 40% трафика.

Автоматический краулинг через CLI в 5 раз быстрее ручного запуска GUI и позволяет интегрировать аудит в CI/CD. Для сайта в 20 000 URL с JS-рендерингом требуется 4-8 ГБ RAM, а время простоя из-за необнаруженных ошибок — в 3-5 раз выше. Свяжитесь с нами, чтобы оценить экономию на вашем проекте.

Почему автоматический краулинг — стандарт технического аудита?

GUI-версия удобна для разовых проверок, но для регулярного мониторинга нужен CLI. Сравнение подходов:

Критерий GUI CLI
Запуск Ручной, каждый раз Автоматический по расписанию
Скорость Зависит от интерфейса В 5 раз быстрее
Интеграция Нет В CI/CD, cron, уведомления
Ресурсы Фиксированный heap Настраиваемый -Xmx
Повторяемость Разный каждый раз Идентичный конфиг

Также стоит учесть типичные ошибки конфигурации:

Ошибка Последствие Решение
Не задан User-Agent Блокировка краулера Установить --user-agent соответствующий
Слишком большая глубина Долгое сканирование Ограничить --max-crawl-depth до 5-10
Не включён рендеринг JS Пропущенные ссылки Использовать --use-rendered
Отсутствие исключений Зацикливание Настроить --exclude для параметров
Развёрнутый пример конфигурации для cron
0 3 * * 1 /usr/bin/screamingfrogseospider --crawl https://example.com --headless --config /etc/screamingfrog/standard-audit.seospiderconfig --output-folder /var/reports/$(date +\%Y\%m\%d) --export-tabs "Internal:All,Response Codes:All,Page Titles:All,Meta Description:All,H1:All,Canonical:All,Directives:All,Hreflang:All,Structured Data:All,Links:All,Sitemaps:All" --timestamped-output

Настройка автоматического краулинга

Установка и лицензия

Screaming Frog — Java-приложение. Бесплатная версия ограничена 500 URL, платная лицензия для коммерческих проектов.

# Ubuntu/Debian
wget https://download.screamingfrog.co.uk/products/seo-spider/screamingfrogseospider_21.0_all.deb
sudo dpkg -i screamingfrogseospider_21.0_all.deb

Запуск через CLI

Ключевое — режим --headless. Параметры: --crawl, --save-crawl, --export-tabs, --output-folder.

screamingfrogseospider \
  --crawl https://example.com \
  --headless \
  --save-crawl \
  --export-tabs "Internal:All,Response Codes:All,Page Titles:All,Meta Description:All,H1:All,Canonical:All,Directives:All,Hreflang:All,Structured Data:All,Links:All,Sitemaps:All" \
  --output-folder /var/reports/example-com/$(date +%Y%m%d) \
  --timestamped-output

Конфигурация и рендеринг

Для стандартизации сохраните конфиг в GUI и передавайте через --config. Для JavaScript-сайтов включите рендеринг через встроенный Chromium (--use-rendered). Время краулинга с JS увеличивается в 3–5 раз, поэтому применяйте только где критично.

Аутентификация

# Cookie
screamingfrogseospider --crawl https://example.com/admin/ --headless --set-cookies "PHPSESSID=abc123; laravel_session=xyz789" --output-folder /var/reports/

# HTTP Basic
screamingfrogseospider --crawl https://example.com --headless --auth-details "user:password" --output-folder /var/reports/

Как настроить CLI для автоматического запуска?

В cron-задаче используйте полный путь к бинарнику и параметры выше. Убедитесь, что Java heap достаточен: для сайта 50 000 URL с JS-рендерингом требуется 4-8 ГБ RAM (-Xmx). Для мониторинга добавьте уведомления в Telegram или email при появлении 4xx- и 5xx-ошибок.

Когда нужен рендеринг JavaScript?

Для сайтов на React, Vue или Angular, где контент подгружается динамически. Без рендеринга краулер увидит только пустой шаблон — вы пропустите до 80% ссылок. Рекомендуем включать --use-rendered для SPA-приложений.

Почему рендеринг JavaScript критичен для SPA?

В SPA отсутствуют статические HTML-страницы. Краулер без рендеринга не найдет внутренние ссылки, мета-теги, структурированные данные. Как указывает официальная документация Screaming Frog, для полного аудита SPA необходим headless Chrome. Это единственный способ выявить все технические проблемы.

Процесс работы

  1. Аналитика: определяем цели аудита, список URL, роботс, карту сайта.
  2. Проектирование: создаём конфигурацию краулера (User-Agent, глубину, исключения).
  3. Реализация: настраиваем CLI-запуск, экспорт данных, скрипты обработки.
  4. Тестирование: проверяем на тестовом поддомене, верифицируем результаты.
  5. Деплой: размещаем на сервере, настраиваем cron, уведомления в Telegram/email.

Что входит в результат

  • Конфигурация краулера: standard-audit.seospiderconfig.
  • Bash-скрипт автоматического запуска с логированием.
  • Python-скрипт анализа основных метрик (коды ответов, дубли title/H1, битые ссылки).
  • Настройка уведомлений (Telegram/email) при аномалиях.
  • Инструкция по обновлению и поддержке.

Обработка результатов

Screaming Frog экспортирует CSV для каждой вкладки. Мы подготовили Python-скрипты для загрузки и сводки.

import pandas as pd
from pathlib import Path

def load_crawl_results(output_dir: str) -> dict[str, pd.DataFrame]:
    results = {}
    for csv_file in Path(output_dir).glob('*.csv'):
        name = csv_file.stem.lower().replace(' ', '_')
        try:
            df = pd.read_csv(csv_file, encoding='utf-8-sig', low_memory=False)
            results[name] = df
        except Exception as e:
            print(f'Could not load {csv_file}: {e}')
    return results

def audit_summary(results: dict) -> dict:
    summary = {}
    if 'internal_all' in results:
        internal = results['internal_all']
        summary['total_urls'] = len(internal)
        summary['indexable'] = len(internal[internal.get('Indexability', '') == 'Indexable'])
    if 'response_codes_all' in results:
        codes = results['response_codes_all']
        for code, prefix in [('2xx','2'),('3xx','3'),('4xx','4'),('5xx','5')]:
            summary[code] = len(codes[codes['Status Code'].astype(str).str.startswith(prefix)])
    if 'page_titles_all' in results:
        titles = results['page_titles_all']
        summary['missing_title'] = titles['Title 1'].isna().sum() + (titles['Title 1']=='').sum()
        summary['duplicate_title'] = titles['Title 1'].duplicated().sum()
    if 'h1_all' in results:
        h1 = results['h1_all']
        summary['missing_h1'] = h1['H1-1'].isna().sum() + (h1['H1-1']=='').sum()
        if 'H1-1 Count' in h1:
            summary['multiple_h1'] = (h1['H1-1 Count'] > 1).sum()
    return summary

Сводка позволяет сразу выявить критические проблемы и оценить масштаб работ. Например, более 5% 4xx-ошибок — повод для срочного редизайна структуры. Автоматизация краулинга позволяет сократить затраты на технический аудит на 70–90% по сравнению с ручным тестированием. Получите консультацию и пример конфигурации под ваш сайт — свяжитесь с нами для предварительной оценки.

Почему Core Web Vitals критичны для технического SEO

PageSpeed показывает 34/100 на мобильных. В Search Console — красные метрики по всем страницам категорий. Конкурент с сайтом на 3 года старше стоит выше в выдаче, несмотря на более слабые тексты. Техническая производительность стала прямым ранжирующим фактором — и разрыв между «приемлемо» и «быстро» стоит позиций. Мы решали эту проблему для десятков проектов — от интернет-магазинов до SaaS-платформ — и знаем, какие ошибки съедают ранжирование.

Core Web Vitals: что реально влияет на позиции

Google использует три метрики как сигналы ранжирования (Page Experience): LCP (Largest Contentful Paint), CLS (Cumulative Layout Shift), INP (Interaction to Next Paint, заменил FID с последнего крупного обновления алгоритма).

LCP: почему 8 секунд — это не проблема изображения

LCP измеряет время отрисовки самого большого видимого элемента страницы. Чаще всего — hero image или H1. Пороги: хорошо < 2.5s, плохо > 4s.

Типичный диагноз на реальном проекте: интернет-магазин одежды, LCP 7.8s на мобильных. Элемент — hero image категории, 4.2MB JPEG без srcset, загружается через CSS background-image (не <img>). Проблема здесь двойная: во-первых, браузер не может preload CSS background images через <link rel="preload"> стандартным способом. Во-вторых, 4.2MB на мобильном соединении — это физически медленно.

Решение по шагам:

  1. Переносим hero из CSS background в <img> с fetchpriority="high" и loading="eager"
  2. Конвертируем в WebP, добавляем srcset: 800w для мобильных, 1400w для десктопа
  3. <link rel="preload" as="image" href="hero-800.webp" media="(max-width: 768px)"> в <head>
  4. Убираем все render-blocking скрипты выше hero через defer

Итог: LCP 7.8s → 1.9s. Без смены хостинга, без CDN.

Если LCP — не изображение, а текстовый блок: проблема может быть в TTFB (медленный сервер), в render-blocking CSS/JS, или в web fonts с font-display: block.

CLS: смещения, которые раздражают пользователя и Google

CLS измеряет суммарный сдвиг элементов в процессе загрузки. Пороги: хорошо < 0.1, плохо > 0.25. CLS 0.35 — это баннер, который появляется через секунду и сдвигает всё содержимое страницы вниз.

Источники CLS:

  • Изображения без заданных размеров. <img src="photo.jpg"> без width и height — браузер не резервирует место, контент прыгает при загрузке. Фикс: явные width/height или aspect-ratio в CSS.
  • Рекламные блоки и виджеты. Google Ads, чат-виджеты, cookie consent — всё, что появляется после основного контента. Решение: резервировать место через min-height или загружать до рендера основного контента.
  • Web fonts. FOUT (Flash of Unstyled Text) и FOIT (Flash of Invisible Text) могут вызывать переформатирование. font-display: swap с size-adjust (CSS свойство для выравнивания размеров fallback шрифта) минимизирует CLS.
  • Динамический контент. Если блок появляется после загрузки (fetch данных, lazy load) — добавляем skeleton placeholder с нужными размерами.
Типичный сценарий CLS до CLS после Основной фикс
Баннер скидок без min-height 0.42 0.02 min-height: 300px
Картинки в статьях без атрибутов 0.18 0.01 width/height + aspect-ratio
Виджет чата, загружаемый через 3с 0.35 0.05 position: fixed с зарезервированным отступом

INP: почему интерфейс «зависает» на 500ms

INP измеряет задержку ответа на любое взаимодействие пользователя: клик, тап, ввод. Пороги: хорошо < 200ms, плохо > 500ms. INP 680ms — это когда пользователь нажимает кнопку фильтра, а ничего не происходит полсекунды.

Главная причина высокого INP — заблокированный main thread. JavaScript-бандл 2.1MB парсируется и выполняется синхронно. Пока выполняется, пользовательские события не обрабатываются.

Диагностика через Chrome DevTools → Performance → взаимодействие с подозрительной задержкой → найти Long Tasks (> 50ms). Типичные виновники:

  • Непрерывная обработка большого списка без requestIdleCallback или requestAnimationFrame
  • Тяжёлые event listeners без debounce/throttle
  • Синхронный setState в React, который триггерит полный ре-рендер сложного дерева компонентов
  • Third-party scripts: livechat, аналитика, виджеты — они исполняются в том же main thread

Решения: code splitting через динамический import(), перенос тяжёлых вычислений в Web Workers, React.memo + useMemo для предотвращения лишних ре-рендеров, scheduler API для приоритизации задач.

Schema.org: разметка, которую читают роботы

Структурированные данные через JSON-LD — не прямой ранжирующий фактор, но дают rich snippets в выдаче (звёзды рейтингов, цены, дата публикации), что увеличивает CTR на 20–30%.

Типы разметки по сценариям:

  • E-commerce: Product с offers (цена, наличие, валюта), aggregateRating (рейтинг из отзывов), brand. BreadcrumbList для навигации. ItemList для страниц категорий.
  • Статьи и блог: Article или BlogPosting с author, datePublished, dateModified, image. Organization и WebSite на главной странице — помогают Google связать сайт с брендом.
  • Локальный бизнес: LocalBusiness с address, telephone, openingHours, geo. Критично для локального SEO.
  • FAQ: FAQPage с mainEntity — вопросы и ответы могут появляться прямо в выдаче как раскрывающийся блок.

Валидация: Google Rich Results Test и Schema Markup Validator. Частая ошибка — указать price без priceCurrency, или ratingValue без reviewCount. Google игнорирует неполную разметку.

Как проводить технический SEO-аудит

Сканируемость. robots.txt блокирует нужные страницы (или наоборот, не блокирует служебные). Canonical URLs настроены неправильно — дублируются страницы с UTM-метками. Sitemap содержит страницы с noindex. Всё это Screaming Frog или Sitebulb покажут за час сканирования.

Core Web Vitals в масштабе. Google Search Console → Core Web Vitals → смотрим не отдельные страницы, а группы URL (шаблон страницы продукта, шаблон категории, блог). Проблема обычно системная — одна ошибка в шаблоне портит сотни страниц.

JavaScript SEO. Google рендерит JavaScript, но с задержкой (иногда дни для полного рендера). Для критичного контента — SSR или SSG обязательны. Проверяем через Search Console → Inspect URL → View Crawled Page: что видит Googlebot.

Internal linking. Орфанные страницы (нет входящих внутренних ссылок) теряют PageRank. Битые ссылки (404) — сигнал качества.

Типичные ошибки при внедрении Schema.org
  • Указан price без priceCurrency — разметка игнорируется.
  • ratingValue без reviewCount — в выдаче не показывается.
  • Несколько Product на одной странице без @type: ItemList — Google берёт только первый.
  • JSON-LD в GTM — Google не всегда видит динамическую разметку, лучше серверный рендеринг.
Этап работы Что входит Срок
Аудит Сканирование, анализ Core Web Vitals, аудит Schema, отчёт с приоритетами 1–2 недели
Оптимизация одного шаблона LCP, CLS, INP, внедрение SSR/SSG, настройка preload 2–4 недели
Полная техническая оптимизация Все шаблоны, code splitting, Web Workers, мониторинг в CI 4–10 недель
Внедрение Schema.org JSON-LD генерация, валидация, тестирование rich snippets 1–3 недели

Что входит в работу

  • Документация: отчёт с найденными проблемами, roadmap по приоритетам, тайминги для каждого этапа.
  • Доступы: настройка мониторинга (SpeedCurve, Sentry Search Console), передача dashboard.
  • Обучение: разбор типичных ошибок для вашей команды (1–2 созвона).
  • Поддержка: сопровождение в течение месяца после деплоя — проверка метрик, фикс регрессий.

Свяжитесь с нами — мы оценим ваш проект за 2 дня и покажем, сколько позиций можно вернуть за счёт технического SEO. Опыт работы с проектами уровня сотен тысяч посещений в месяц — гарантируем измеримый результат в Core Web Vitals до/после. Закажите аудит в этой форме — получите персональный чек-лист из 15 пунктов.