Уявіть: на сайті сотні сторінок із зовнішніми посиланнями. Через місяць після останнього аудиту одне з посилань перестало працювати — ресурс видалили. Ви втрачаєте позиції в пошуку через биті посилання (404 помилок), а користувачі йдуть з несправної сторінки. За даними Moz, понад 30% користувачів покидають сайт при зустрічі з несправним посиланням. Кожна 404-помилка — сигнал про низьку якість сайту для пошукових систем. Ми вирішуємо цю проблему: налаштовуємо автоматичне сканування всіх посилань за розкладом зі сповіщеннями про знайдені помилки. Ви отримуєте звіт до того, як проблема вплине на SEO або UX.
Чому биті посилання шкодять SEO?
Пошукові системи Google та Яндекс враховують наявність несправних посилань при ранжуванні. Кожна 404-помилка — сигнал про низьку якість сайту. Особливо критичні биті посилання в меню, футері та на цільових сторінках — вони безпосередньо впливають на поведінкові фактори. Автоматичний моніторинг дозволяє виявити проблему за хвилини, а не дні. Google Search Console фіксує 404-помилки із затримкою, наш підхід дає актуальні дані в реальному часі. За нашими даними, своєчасне виявлення битих посилань знижує показник відмов на 15%.
Як працює автоматична перевірка?
Ми використовуємо асинхронний краулер на Python з бібліотекою aiohttp. Він паралельно обробляє до 20 посилань, перевіряючи HTTP-статус кожної. При виявленні помилки (4xx, 5xx, таймаут) посилання фіксується із зазначенням реферера. Після завершення сканування формується звіт з повним списком битих лінків і надсилається в обраний канал (Slack, Telegram, email). Ми налаштовуємо сповіщення так, щоб ви отримували щоденний звіт із коротким зведенням та посиланням на повний CSV. Для сайту з 5000 сторінок повне сканування займає близько години.
Покроковий процес налаштування:
- Встановлюємо Python-оточення та залежності (aiohttp, BeautifulSoup, Celery).
- Конфігуруємо краулер: задаємо стартовий URL, обмеження по домену, таймаути.
- Налаштовуємо планувальник Celery Beat для щоденного запуску.
- Інтегруємо сповіщення в Slack або Telegram.
- Тестуємо сценарій на тестовому стенді.
Технічна реалізація
# broken_link_checker.py
import asyncio
import aiohttp
from urllib.parse import urlparse, urljoin
from bs4 import BeautifulSoup
from collections import defaultdict
class BrokenLinkChecker:
def __init__(self, base_url: str, concurrency: int = 20):
self.base_url = base_url
self.domain = urlparse(base_url).netloc
self.semaphore = asyncio.Semaphore(concurrency)
self.visited: set[str] = set()
self.broken: list[dict] = []
async def check(self) -> list[dict]:
async with aiohttp.ClientSession(
timeout=aiohttp.ClientTimeout(total=15),
headers={'User-Agent': 'LinkChecker/1.0'},
) as session:
await self.crawl(session, self.base_url, referrer='root')
return self.broken
async def crawl(self, session: aiohttp.ClientSession, url: str, referrer: str):
if url in self.visited:
return
self.visited.add(url)
async with self.semaphore:
try:
async with session.get(url, allow_redirects=True) as resp:
status = resp.status
if status >= 400:
self.broken.append({'url': url, 'status': status, 'referrer': referrer})
return
# Парсим только HTML страницы своего домена
if urlparse(url).netloc == self.domain and 'text/html' in resp.headers.get('Content-Type', ''):
html = await resp.text()
links = self.extract_links(url, html)
tasks = [self.crawl(session, link, url) for link in links if link not in self.visited]
await asyncio.gather(*tasks, return_exceptions=True)
except asyncio.TimeoutError:
self.broken.append({'url': url, 'status': 'timeout', 'referrer': referrer})
except Exception as e:
self.broken.append({'url': url, 'status': str(e), 'referrer': referrer})
def extract_links(self, base: str, html: str) -> list[str]:
soup = BeautifulSoup(html, 'lxml')
links = []
for tag in soup.find_all(['a', 'link', 'img', 'script'], href=True):
href = tag.get('href') or tag.get('src')
if href:
absolute = urljoin(base, href)
parsed = urlparse(absolute)
if parsed.scheme in ('http', 'https'):
links.append(absolute.split('#')[0])
return list(set(links))
Планувальник та сповіщення
# scheduler.py (Celery Beat)
from celery import Celery
from broken_link_checker import BrokenLinkChecker
import asyncio
import requests
app = Celery('tasks', broker='redis://localhost:6379/0')
@app.task
def check_broken_links():
checker = BrokenLinkChecker('https://example.com', concurrency=15)
broken = asyncio.run(checker.check())
if not broken:
return {'status': 'ok', 'checked': len(checker.visited)}
# Відправляємо звіт в Slack
message = f"🔗 Знайдено {len(broken)} битих посилань:\n"
for item in broken[:10]: # Перші 10
message += f"• `{item['status']}` {item['url']}\n ← {item['referrer']}\n"
if len(broken) > 10:
message += f"...і ще {len(broken) - 10}. Повний звіт у CSV.\n"
requests.post(os.env['SLACK_WEBHOOK'], json={'text': message})
# Зберігаємо в БД для історії
BrokenLinkReport.objects.create(
checked_at = timezone.now(),
total_links = len(checker.visited),
broken_count = len(broken),
details = broken,
)
return {'broken': len(broken)}
# Розклад: щодня о 6:00
app.conf.beat_schedule = {
'daily-link-check': {
'task': 'scheduler.check_broken_links',
'schedule': crontab(hour=6, minute=0),
},
}
Як уникнути навантаження на сервер?
Краулер працює на окремому сервері, не навантажуючи ваш хостинг. Ми налаштовуємо затримки між запитами та поважаємо директиви robots.txt. Якщо сайт великий (понад 10 000 сторінок), розбиваємо сканування на етапи та використовуємо розподілені черги через Celery. Це гарантує, що перевірка не вплине на продуктивність вашого сайту для реальних користувачів. Зв'яжіться з нами, щоб ми підібрали оптимальну конфігурацію для вашого проєкту.
Технічні деталі обробки редиректів
Краулер слідує за редиректами (allow_redirects=True) та фіксує кінцевий статус. Якщо редирект веде на 404, це також вважається помилкою. Для ланцюжків редиректів використовується максимальна кількість переходів (за замовчуванням 10).
Порівняння способів перевірки посилань
| Метод | Трудомісткість | Частота | Точність |
|---|---|---|---|
| Ручна перевірка | Висока (4 години на 500 сторінок) | Раз на місяць або рідше | Суб'єктивна, пропуски |
| Автоматична (наш підхід) | Низька (5 хвилин на 500 сторінок) | Щоденно | 100% сканування всіх посилань |
Автоматична перевірка в 50 разів швидша за ручний прогін та виключає людський фактор. Наша команда має багаторічний досвід в SEO-аудиті та розробці скриптів для веб-аналізу, виконавши понад 100 проєктів з автоматизації моніторингу посилань.
Типові помилки при самостійному налаштуванні
| Помилка | Наслідок | Наше рішення |
|---|---|---|
| Відсутність таймауту | Зависання на повільних ресурсах | Встановлюємо таймаут 15 секунд |
| Пропуск JS-посилань | Неповне сканування | Парсимо повний HTML, включаючи динамічно завантажені посилання |
| Ігнорування реферерів | Складно знайти сторінку-джерело | Зберігаємо referrer для кожного знайденого URL |
Які інструменти ми використовуємо?
Основний стек: Python 3.11, aiohttp для асинхронних запитів, BeautifulSoup для парсингу HTML, Celery для планування завдань та Redis як брокер повідомлень. Усі інструменти з відкритим кодом і добре документовані.
Що входить в налаштування
- Аналіз структури сайту — визначаємо обсяг посилань, пріоритетні розділи.
- Конфігурація краулера — налаштовуємо глибину обходу, обмеження по домену, таймаути.
- Розклад сканування — задаємо частоту (щоденно, щотижнево) та час запуску.
- Інтеграція сповіщень — підключаємо Slack, Telegram або email, налаштовуємо формат звіту.
- Тестування — перевіряємо коректність роботи на тестовому сценарії.
- Документація та підтримка — передаємо інструкцію з експлуатації, надаємо місяць підтримки.
Терміни та вартість
Налаштування займає від 1 до 2 робочих днів. Вартість розраховується індивідуально залежно від складності. Ми гарантуємо роботу краулера без навантаження на ваш сервер. Отримайте консультацію з налаштування моніторингу битих посилань вже сьогодні.







