Оптимізація краулінгового бюджету (Crawl Budget) сайту

Оптимізація краулінгового бюджету (Crawl Budget) сайту

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Оптимізація краулінгового бюджету (Crawl Budget) сайту
Середній
~2-3 дні

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1418
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1286
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    983
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1243
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    998

Оптимізація краулінгового бюджету (Crawl Budget) сайту

Нові сторінки не індексуються тижнями, а Googlebot застряє у фільтрах каталогу — типова проблема інтернет-магазинів. Crawl Budget — ліміт URL, який пошуковик готовий обробити за добу. Якщо бюджет витрачається на сміття (параметри сесій, дублі, службові сторінки), важливий контент залишається непоміченим. Оптимізація бюджету здатна збільшити кількість проіндексованих сторінок на 40–60% всього за 2–3 дні — це підтверджують наші проекти. Наприклад, інтернет-магазин з 50 000 товарів втрачав 70% краулінгового бюджету на сторінки фільтрів. Після блокування параметрів та налаштування canonical індексація нових товарів прискорилася з 14 днів до 2 днів — зростання проіндексованих сторінок на 45%.

Чому Googlebot не індексує важливі сторінки?

Перевантаження краулінгового бюджету непотрібними URL — головна причина. Типовий інтернет-магазин втрачає до 70% бюджету на сторінки з параметрами сортування, фільтрації та UTM-мітками. В результаті товари-новинки не потрапляють в індекс, а старі дублі займають місце. Аналіз логів 50 сайтів показав: в середньому 80% запитів Googlebot припадають на URL, які не приносять трафіку. За даними Google, ефективне використання краулінгового бюджету — один з ключових факторів швидкої індексації нового контенту. Детальніше про концепцію можна дізнатися в документації Google.

Як звільнити краулінговий бюджет за один день?

Вручну аналізувати логи — день роботи, але автоматизований скрипт справляється за 10 хвилин. Аналіз поточного бюджету — перший крок. Використовуємо Google Search Console (Crawl Stats) та лог-аналізатор на кшталт Screaming Frog. Команда для вилучення краулерів з access.log:

grep "Googlebot" /var/log/nginx/access.log | \ awk '{print $7}' | sort | uniq -c | sort -rn | head -50 | \ grep "?" | sed 's/=.*/=X/g' | sort | uniq -c | sort -rn | head -30 

Цей скрипт показує, які URL з параметрами краулить бот. На основі звіту ми визначаємо, що блокувати. За його допомогою ми економимо до 10 годин ручного аналізу.

robots.txt: перша лінія оборони

Забороняємо незначні розділи:

User-agent: * Disallow: /search? Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /admin/ Disallow: /*?session_id= Disallow: /*?utm_source= Disallow: /*?utm_medium= Disallow: /*?ref= Disallow: /wp-json/ Disallow: /wp-admin/ Disallow: /*.pdf$ Allow: /sitemap.xml Allow: /robots.txt 

Важно не перестаратися — випадково не заблокувати важливі сторінки. Ми перевіряємо coverage після кожної зміни.

Canonical для дублюючого контенту

Дублі з параметрами, trailing slash та http/https — канонічні посилання вирішують все:

<!-- /catalog/shoes?color=red&size=42 --> <link rel="canonical" href="https://site.com/catalog/shoes"> 

Після розстановки canonical бюджет перестає витрачатися на варіанти фільтрів. У поєднанні з robots.txt економія бюджету збільшується в 2 рази порівняно з використанням кожного методу окремо.

Sitemap.xml оптимізація

У sitemap включаємо тільки індексовані сторінки з датою оновлення < 2 років. Приклад генерації на Python:

def generate_optimized_sitemap(db): pages = db.query(""" SELECT url, updated_at, priority FROM pages WHERE status = 'published' AND noindex = false AND updated_at > NOW() - INTERVAL '2 years' ORDER BY priority DESC, updated_at DESC """) # ... (повний код у статті) 

Не додаємо сторінки з noindex, 404, редиректи.

Порівняння методів блокування краулінгу

Метод Мета Приклад Ефективність
robots.txt Заборона краулінгу цілих розділів Disallow: /cart/ 90% — економія на сміттєвих URL
canonical Зняття дублів rel="canonical" 95% — усунення варіантів параметрів
noindex Видалення сторінок з індексу 100% — сторінка виключається з пошуку

Canonical у поєднанні з robots.txt дає найкращий результат: robots.txt блокує доступ, а canonical вказує кращу версію ззовні.

Покрокова інструкція: аналіз логів за 10 хвилин

  1. Завантажте access.log з сервера (за останні 7 днів).
  2. Запустіть grep-команду з розділу вище.
  3. Відсортуйте URL за частотою та виявіть сміттєві патерни.
  4. Додайте заборони в robots.txt або налаштуйте canonical.
  5. Повторно проаналізуйте логи через тиждень — переконайтеся в зниженні краулінгу сміття.

Що входить в роботу

Етап Дія Результат
1. Аналіз Збір логів, Screaming Frog, GSC Звіт про витрачання бюджету
2. Блокування robots.txt, canonical, параметри в GSC Чернетка налаштувань
3. Оптимізація Генерація sitemap, налаштування Crawl-Delay Фінальний конфіг
4. Тест Перевірка coverage в GSC, повторний аналіз Підтвердження покращень

Ми надаємо документацію та навчання вашої команди. Гарантуємо, що через 2–3 дні ви побачите зростання проіндексованих сторінок. Зв'яжіться з нами для аудиту вашого краулінгового бюджету — ми проаналізуємо ситуацію та запропонуємо конкретні кроки.

Строки

Аудит та оптимізація — від 1 до 2 робочих днів. Вартість розраховується індивідуально, залежить від обсягу сайту. Замовте консультацію — ми підберемо оптимальний план.

Типові помилки

  • Занадто агресивний robots.txt: випадково блокуєте розділи, які потрібно індексувати
  • Забули про sitemap: після блокувань важливо оновити карту сайту
  • Не врахували мобільну версію: якщо сайт на m.domain.com, правила застосовуються окремо

Ми — команда з 5-річним досвідом, реалізували понад 100 проектів з оптимізації індексації. Не припускайтеся цих помилок — отримайте консультацію з налаштування краулінгового бюджету та прискорте індексацію важливих сторінок.