Оптимизация краулингового бюджета (Crawl Budget) сайта

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Оптимизация краулингового бюджета (Crawl Budget) сайта
Средний
~2-3 дня
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1358
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    957
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1188
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    947

Оптимизация краулингового бюджета (Crawl Budget) сайта

Новые страницы не индексируются неделями, а Googlebot застревает в фильтрах каталога — типичная проблема интернет-магазинов. Crawl Budget — лимит URL, который поисковик готов обработать за сутки. Если бюджет тратится на мусор (параметры сессий, дубли, служебные страницы), важный контент остается незамеченным. Оптимизация бюджета способна увеличить количество проиндексированных страниц на 40–60% всего за 2–3 дня — это подтверждают наши проекты. Например, интернет-магазин с 50 000 товаров терял 70% краулингового бюджета на страницы фильтров. После блокировки параметров и настройки canonical индексация новых товаров ускорилась с 14 дней до 2 дней — рост проиндексированных страниц на 45%.

Почему Googlebot не индексирует важные страницы?

Перегрузка краулингового бюджета бесполезными URL — главная причина. Типичный интернет-магазин теряет до 70% бюджета на страницы с параметрами сортировки, фильтрации и UTM-метками. В результате товары-новинки не попадают в индекс, а старые дубли занимают место. Анализ логов 50 сайтов показал: в среднем 80% запросов Googlebot приходятся на URL, которые не приносят трафика. По данным Google, эффективное использование краулингового бюджета — один из ключевых факторов быстрой индексации нового контента. Подробнее о концепции можно узнать в документации Google.

Как освободить краулинговый бюджет за один день?

Вручную анализировать логи — день работы, но автоматизированный скрипт справляется за 10 минут. Анализ текущего бюджета — первый шаг. Используем Google Search Console (Crawl Stats) и лог-анализатор вроде Screaming Frog. Команда для извлечения краулеров из access.log:

grep "Googlebot" /var/log/nginx/access.log | \
  awk '{print $7}' | sort | uniq -c | sort -rn | head -50 | \
  grep "?" | sed 's/=.*/=X/g' | sort | uniq -c | sort -rn | head -30

Этот скрипт показывает, какие URL с параметрами краулит бот. На основе отчета мы определяем, что блокировать. С его помощью мы экономим до 10 часов ручного анализа.

robots.txt: первая линия обороны

Запрещаем незначимые разделы:

User-agent: *
Disallow: /search?
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /admin/
Disallow: /*?session_id=
Disallow: /*?utm_source=
Disallow: /*?utm_medium=
Disallow: /*?ref=
Disallow: /wp-json/
Disallow: /wp-admin/
Disallow: /*.pdf$

Allow: /sitemap.xml
Allow: /robots.txt

Важно не переборщить — случайно не заблокировать важные страницы. Мы проверяем coverage после каждого изменения.

Canonical для дублирующегося контента

Дубли с параметрами, trailing slash и http/https — канонические ссылки решают всё:

<!-- /catalog/shoes?color=red&size=42 -->
<link rel="canonical" href="https://site.com/catalog/shoes">

После расстановки canonical бюджет перестает расходоваться на варианты фильтров. В сочетании с robots.txt экономия бюджета увеличивается в 2 раза по сравнению с использованием каждого метода по отдельности.

Sitemap.xml оптимизация

В sitemap включаем только индексируемые страницы с датой обновления < 2 лет. Пример генерации на Python:

def generate_optimized_sitemap(db):
    pages = db.query("""
        SELECT url, updated_at, priority
        FROM pages
        WHERE status = 'published'
        AND noindex = false
        AND updated_at > NOW() - INTERVAL '2 years'
        ORDER BY priority DESC, updated_at DESC
    """)
    # ... (полный код в статье)

Не добавляем страницы с noindex, 404, редиректы.

Сравнение методов блокировки краулинга

Метод Цель Пример Эффективность
robots.txt Запрет краулинга целых разделов Disallow: /cart/ 90% — экономия на мусорных URL
canonical Снятие дублей rel="canonical" 95% — устранение вариантов параметров
noindex Удаление страниц из индекса 100% — страница исключается из поиска

Canonical в сочетании с robots.txt даёт наилучший результат: robots.txt блокирует доступ, а canonical указывает предпочтительную версию снаружи.

Пошаговая инструкция: анализ логов за 10 минут

  1. Скачайте access.log с сервера (за последние 7 дней).
  2. Запустите grep-команду из раздела выше.
  3. Отсортируйте URL по частоте и выявите мусорные паттерны.
  4. Добавьте запреты в robots.txt или настройте canonical.
  5. Повторно проанализируйте логи через неделю — убедитесь в снижении краулинга мусора.

Что входит в работу

Этап Действие Результат
1. Анализ Сбор логов, Screaming Frog, GSC Отчёт о расходовании бюджета
2. Блокировка robots.txt, canonical, параметры в GSC Черновик настроек
3. Оптимизация Генерация sitemap, настройка Crawl-Delay Финальный конфиг
4. Тест Проверка coverage в GSC, повторный анализ Подтверждение улучшений

Мы предоставляем документацию и обучение вашей команды. Гарантируем, что через 2–3 дня вы увидите рост проиндексированных страниц. Свяжитесь с нами для аудита вашего краулингового бюджета — мы проанализируем ситуацию и предложим конкретные шаги.

Сроки

Аудит и оптимизация — от 1 до 2 рабочих дней. Стоимость рассчитывается индивидуально, зависит от объёма сайта. Закажите консультацию — мы подберём оптимальный план.

Типичные ошибки

  • Слишком агрессивный robots.txt: случайно блокируете разделы, которые нужно индексировать
  • Забыли про sitemap: после блокировок важно обновить карту сайта
  • Не учли мобильную версию: если сайт на m.domain.com, правила применяются отдельно

Мы — команда с 5-летним опытом, реализовали более 100 проектов по оптимизации индексации. Не допускайте этих ошибок — получите консультацию по настройке краулингового бюджета и ускорьте индексацию важных страниц.

Почему Core Web Vitals критичны для технического SEO

PageSpeed показывает 34/100 на мобильных. В Search Console — красные метрики по всем страницам категорий. Конкурент с сайтом на 3 года старше стоит выше в выдаче, несмотря на более слабые тексты. Техническая производительность стала прямым ранжирующим фактором — и разрыв между «приемлемо» и «быстро» стоит позиций. Мы решали эту проблему для десятков проектов — от интернет-магазинов до SaaS-платформ — и знаем, какие ошибки съедают ранжирование.

Core Web Vitals: что реально влияет на позиции

Google использует три метрики как сигналы ранжирования (Page Experience): LCP (Largest Contentful Paint), CLS (Cumulative Layout Shift), INP (Interaction to Next Paint, заменил FID с последнего крупного обновления алгоритма).

LCP: почему 8 секунд — это не проблема изображения

LCP измеряет время отрисовки самого большого видимого элемента страницы. Чаще всего — hero image или H1. Пороги: хорошо < 2.5s, плохо > 4s.

Типичный диагноз на реальном проекте: интернет-магазин одежды, LCP 7.8s на мобильных. Элемент — hero image категории, 4.2MB JPEG без srcset, загружается через CSS background-image (не <img>). Проблема здесь двойная: во-первых, браузер не может preload CSS background images через <link rel="preload"> стандартным способом. Во-вторых, 4.2MB на мобильном соединении — это физически медленно.

Решение по шагам:

  1. Переносим hero из CSS background в <img> с fetchpriority="high" и loading="eager"
  2. Конвертируем в WebP, добавляем srcset: 800w для мобильных, 1400w для десктопа
  3. <link rel="preload" as="image" href="hero-800.webp" media="(max-width: 768px)"> в <head>
  4. Убираем все render-blocking скрипты выше hero через defer

Итог: LCP 7.8s → 1.9s. Без смены хостинга, без CDN.

Если LCP — не изображение, а текстовый блок: проблема может быть в TTFB (медленный сервер), в render-blocking CSS/JS, или в web fonts с font-display: block.

CLS: смещения, которые раздражают пользователя и Google

CLS измеряет суммарный сдвиг элементов в процессе загрузки. Пороги: хорошо < 0.1, плохо > 0.25. CLS 0.35 — это баннер, который появляется через секунду и сдвигает всё содержимое страницы вниз.

Источники CLS:

  • Изображения без заданных размеров. <img src="photo.jpg"> без width и height — браузер не резервирует место, контент прыгает при загрузке. Фикс: явные width/height или aspect-ratio в CSS.
  • Рекламные блоки и виджеты. Google Ads, чат-виджеты, cookie consent — всё, что появляется после основного контента. Решение: резервировать место через min-height или загружать до рендера основного контента.
  • Web fonts. FOUT (Flash of Unstyled Text) и FOIT (Flash of Invisible Text) могут вызывать переформатирование. font-display: swap с size-adjust (CSS свойство для выравнивания размеров fallback шрифта) минимизирует CLS.
  • Динамический контент. Если блок появляется после загрузки (fetch данных, lazy load) — добавляем skeleton placeholder с нужными размерами.
Типичный сценарий CLS до CLS после Основной фикс
Баннер скидок без min-height 0.42 0.02 min-height: 300px
Картинки в статьях без атрибутов 0.18 0.01 width/height + aspect-ratio
Виджет чата, загружаемый через 3с 0.35 0.05 position: fixed с зарезервированным отступом

INP: почему интерфейс «зависает» на 500ms

INP измеряет задержку ответа на любое взаимодействие пользователя: клик, тап, ввод. Пороги: хорошо < 200ms, плохо > 500ms. INP 680ms — это когда пользователь нажимает кнопку фильтра, а ничего не происходит полсекунды.

Главная причина высокого INP — заблокированный main thread. JavaScript-бандл 2.1MB парсируется и выполняется синхронно. Пока выполняется, пользовательские события не обрабатываются.

Диагностика через Chrome DevTools → Performance → взаимодействие с подозрительной задержкой → найти Long Tasks (> 50ms). Типичные виновники:

  • Непрерывная обработка большого списка без requestIdleCallback или requestAnimationFrame
  • Тяжёлые event listeners без debounce/throttle
  • Синхронный setState в React, который триггерит полный ре-рендер сложного дерева компонентов
  • Third-party scripts: livechat, аналитика, виджеты — они исполняются в том же main thread

Решения: code splitting через динамический import(), перенос тяжёлых вычислений в Web Workers, React.memo + useMemo для предотвращения лишних ре-рендеров, scheduler API для приоритизации задач.

Schema.org: разметка, которую читают роботы

Структурированные данные через JSON-LD — не прямой ранжирующий фактор, но дают rich snippets в выдаче (звёзды рейтингов, цены, дата публикации), что увеличивает CTR на 20–30%.

Типы разметки по сценариям:

  • E-commerce: Product с offers (цена, наличие, валюта), aggregateRating (рейтинг из отзывов), brand. BreadcrumbList для навигации. ItemList для страниц категорий.
  • Статьи и блог: Article или BlogPosting с author, datePublished, dateModified, image. Organization и WebSite на главной странице — помогают Google связать сайт с брендом.
  • Локальный бизнес: LocalBusiness с address, telephone, openingHours, geo. Критично для локального SEO.
  • FAQ: FAQPage с mainEntity — вопросы и ответы могут появляться прямо в выдаче как раскрывающийся блок.

Валидация: Google Rich Results Test и Schema Markup Validator. Частая ошибка — указать price без priceCurrency, или ratingValue без reviewCount. Google игнорирует неполную разметку.

Как проводить технический SEO-аудит

Сканируемость. robots.txt блокирует нужные страницы (или наоборот, не блокирует служебные). Canonical URLs настроены неправильно — дублируются страницы с UTM-метками. Sitemap содержит страницы с noindex. Всё это Screaming Frog или Sitebulb покажут за час сканирования.

Core Web Vitals в масштабе. Google Search Console → Core Web Vitals → смотрим не отдельные страницы, а группы URL (шаблон страницы продукта, шаблон категории, блог). Проблема обычно системная — одна ошибка в шаблоне портит сотни страниц.

JavaScript SEO. Google рендерит JavaScript, но с задержкой (иногда дни для полного рендера). Для критичного контента — SSR или SSG обязательны. Проверяем через Search Console → Inspect URL → View Crawled Page: что видит Googlebot.

Internal linking. Орфанные страницы (нет входящих внутренних ссылок) теряют PageRank. Битые ссылки (404) — сигнал качества.

Типичные ошибки при внедрении Schema.org
  • Указан price без priceCurrency — разметка игнорируется.
  • ratingValue без reviewCount — в выдаче не показывается.
  • Несколько Product на одной странице без @type: ItemList — Google берёт только первый.
  • JSON-LD в GTM — Google не всегда видит динамическую разметку, лучше серверный рендеринг.
Этап работы Что входит Срок
Аудит Сканирование, анализ Core Web Vitals, аудит Schema, отчёт с приоритетами 1–2 недели
Оптимизация одного шаблона LCP, CLS, INP, внедрение SSR/SSG, настройка preload 2–4 недели
Полная техническая оптимизация Все шаблоны, code splitting, Web Workers, мониторинг в CI 4–10 недель
Внедрение Schema.org JSON-LD генерация, валидация, тестирование rich snippets 1–3 недели

Что входит в работу

  • Документация: отчёт с найденными проблемами, roadmap по приоритетам, тайминги для каждого этапа.
  • Доступы: настройка мониторинга (SpeedCurve, Sentry Search Console), передача dashboard.
  • Обучение: разбор типичных ошибок для вашей команды (1–2 созвона).
  • Поддержка: сопровождение в течение месяца после деплоя — проверка метрик, фикс регрессий.

Свяжитесь с нами — мы оценим ваш проект за 2 дня и покажем, сколько позиций можно вернуть за счёт технического SEO. Опыт работы с проектами уровня сотен тысяч посещений в месяц — гарантируем измеримый результат в Core Web Vitals до/после. Закажите аудит в этой форме — получите персональный чек-лист из 15 пунктов.