Оптимізація краулінгового бюджету (Crawl Budget) сайту
Нові сторінки не індексуються тижнями, а Googlebot застряє у фільтрах каталогу — типова проблема інтернет-магазинів. Crawl Budget — ліміт URL, який пошуковик готовий обробити за добу. Якщо бюджет витрачається на сміття (параметри сесій, дублі, службові сторінки), важливий контент залишається непоміченим. Оптимізація бюджету здатна збільшити кількість проіндексованих сторінок на 40–60% всього за 2–3 дні — це підтверджують наші проекти. Наприклад, інтернет-магазин з 50 000 товарів втрачав 70% краулінгового бюджету на сторінки фільтрів. Після блокування параметрів та налаштування canonical індексація нових товарів прискорилася з 14 днів до 2 днів — зростання проіндексованих сторінок на 45%.
Чому Googlebot не індексує важливі сторінки?
Перевантаження краулінгового бюджету непотрібними URL — головна причина. Типовий інтернет-магазин втрачає до 70% бюджету на сторінки з параметрами сортування, фільтрації та UTM-мітками. В результаті товари-новинки не потрапляють в індекс, а старі дублі займають місце. Аналіз логів 50 сайтів показав: в середньому 80% запитів Googlebot припадають на URL, які не приносять трафіку. За даними Google, ефективне використання краулінгового бюджету — один з ключових факторів швидкої індексації нового контенту. Детальніше про концепцію можна дізнатися в документації Google.
Як звільнити краулінговий бюджет за один день?
Вручну аналізувати логи — день роботи, але автоматизований скрипт справляється за 10 хвилин. Аналіз поточного бюджету — перший крок. Використовуємо Google Search Console (Crawl Stats) та лог-аналізатор на кшталт Screaming Frog. Команда для вилучення краулерів з access.log:
grep "Googlebot" /var/log/nginx/access.log | \ awk '{print $7}' | sort | uniq -c | sort -rn | head -50 | \ grep "?" | sed 's/=.*/=X/g' | sort | uniq -c | sort -rn | head -30 Цей скрипт показує, які URL з параметрами краулить бот. На основі звіту ми визначаємо, що блокувати. За його допомогою ми економимо до 10 годин ручного аналізу.
robots.txt: перша лінія оборони
Забороняємо незначні розділи:
User-agent: * Disallow: /search? Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /admin/ Disallow: /*?session_id= Disallow: /*?utm_source= Disallow: /*?utm_medium= Disallow: /*?ref= Disallow: /wp-json/ Disallow: /wp-admin/ Disallow: /*.pdf$ Allow: /sitemap.xml Allow: /robots.txt Важно не перестаратися — випадково не заблокувати важливі сторінки. Ми перевіряємо coverage після кожної зміни.
Canonical для дублюючого контенту
Дублі з параметрами, trailing slash та http/https — канонічні посилання вирішують все:
<!-- /catalog/shoes?color=red&size=42 --> <link rel="canonical" href="https://site.com/catalog/shoes"> Після розстановки canonical бюджет перестає витрачатися на варіанти фільтрів. У поєднанні з robots.txt економія бюджету збільшується в 2 рази порівняно з використанням кожного методу окремо.
Sitemap.xml оптимізація
У sitemap включаємо тільки індексовані сторінки з датою оновлення < 2 років. Приклад генерації на Python:
def generate_optimized_sitemap(db): pages = db.query(""" SELECT url, updated_at, priority FROM pages WHERE status = 'published' AND noindex = false AND updated_at > NOW() - INTERVAL '2 years' ORDER BY priority DESC, updated_at DESC """) # ... (повний код у статті) Не додаємо сторінки з noindex, 404, редиректи.
Порівняння методів блокування краулінгу
| Метод | Мета | Приклад | Ефективність |
|---|---|---|---|
| robots.txt | Заборона краулінгу цілих розділів | Disallow: /cart/ | 90% — економія на сміттєвих URL |
| canonical | Зняття дублів | rel="canonical" | 95% — усунення варіантів параметрів |
| noindex | Видалення сторінок з індексу | 100% — сторінка виключається з пошуку |
Canonical у поєднанні з robots.txt дає найкращий результат: robots.txt блокує доступ, а canonical вказує кращу версію ззовні.
Покрокова інструкція: аналіз логів за 10 хвилин
- Завантажте access.log з сервера (за останні 7 днів).
- Запустіть grep-команду з розділу вище.
- Відсортуйте URL за частотою та виявіть сміттєві патерни.
- Додайте заборони в robots.txt або налаштуйте canonical.
- Повторно проаналізуйте логи через тиждень — переконайтеся в зниженні краулінгу сміття.
Що входить в роботу
| Етап | Дія | Результат |
|---|---|---|
| 1. Аналіз | Збір логів, Screaming Frog, GSC | Звіт про витрачання бюджету |
| 2. Блокування | robots.txt, canonical, параметри в GSC | Чернетка налаштувань |
| 3. Оптимізація | Генерація sitemap, налаштування Crawl-Delay | Фінальний конфіг |
| 4. Тест | Перевірка coverage в GSC, повторний аналіз | Підтвердження покращень |
Ми надаємо документацію та навчання вашої команди. Гарантуємо, що через 2–3 дні ви побачите зростання проіндексованих сторінок. Зв'яжіться з нами для аудиту вашого краулінгового бюджету — ми проаналізуємо ситуацію та запропонуємо конкретні кроки.
Строки
Аудит та оптимізація — від 1 до 2 робочих днів. Вартість розраховується індивідуально, залежить від обсягу сайту. Замовте консультацію — ми підберемо оптимальний план.
Типові помилки
- Занадто агресивний robots.txt: випадково блокуєте розділи, які потрібно індексувати
- Забули про sitemap: після блокувань важливо оновити карту сайту
- Не врахували мобільну версію: якщо сайт на m.domain.com, правила застосовуються окремо
Ми — команда з 5-річним досвідом, реалізували понад 100 проектів з оптимізації індексації. Не припускайтеся цих помилок — отримайте консультацію з налаштування краулінгового бюджету та прискорте індексацію важливих сторінок.







