Налаштування автоматичної перевірки битих посилань на сайті

Уявіть: на сайті сотні сторінок із зовнішніми посиланнями. Через місяць після останнього аудиту одне з посилань перестало працювати — ресурс видалили. Ви втрачаєте позиції в пошуку через [биті посилання](https://uk.wikipedia.org/wiki/%D0%91%D0%B8%D1%82%D0%B5_%D0%BF%D0%BE%D1%81%D0%B8%D0%BB%D0%B0%D0%B

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Налаштування автоматичної перевірки битих посилань на сайті
Простий
від 1 дня до 3 днів

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1419
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    983
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1245
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    998

Уявіть: на сайті сотні сторінок із зовнішніми посиланнями. Через місяць після останнього аудиту одне з посилань перестало працювати — ресурс видалили. Ви втрачаєте позиції в пошуку через биті посилання (404 помилок), а користувачі йдуть з несправної сторінки. За даними Moz, понад 30% користувачів покидають сайт при зустрічі з несправним посиланням. Кожна 404-помилка — сигнал про низьку якість сайту для пошукових систем. Ми вирішуємо цю проблему: налаштовуємо автоматичне сканування всіх посилань за розкладом зі сповіщеннями про знайдені помилки. Ви отримуєте звіт до того, як проблема вплине на SEO або UX.

Чому биті посилання шкодять SEO?

Пошукові системи Google та Яндекс враховують наявність несправних посилань при ранжуванні. Кожна 404-помилка — сигнал про низьку якість сайту. Особливо критичні биті посилання в меню, футері та на цільових сторінках — вони безпосередньо впливають на поведінкові фактори. Автоматичний моніторинг дозволяє виявити проблему за хвилини, а не дні. Google Search Console фіксує 404-помилки із затримкою, наш підхід дає актуальні дані в реальному часі. За нашими даними, своєчасне виявлення битих посилань знижує показник відмов на 15%.

Як працює автоматична перевірка?

Ми використовуємо асинхронний краулер на Python з бібліотекою aiohttp. Він паралельно обробляє до 20 посилань, перевіряючи HTTP-статус кожної. При виявленні помилки (4xx, 5xx, таймаут) посилання фіксується із зазначенням реферера. Після завершення сканування формується звіт з повним списком битих лінків і надсилається в обраний канал (Slack, Telegram, email). Ми налаштовуємо сповіщення так, щоб ви отримували щоденний звіт із коротким зведенням та посиланням на повний CSV. Для сайту з 5000 сторінок повне сканування займає близько години.

Покроковий процес налаштування:

  1. Встановлюємо Python-оточення та залежності (aiohttp, BeautifulSoup, Celery).
  2. Конфігуруємо краулер: задаємо стартовий URL, обмеження по домену, таймаути.
  3. Налаштовуємо планувальник Celery Beat для щоденного запуску.
  4. Інтегруємо сповіщення в Slack або Telegram.
  5. Тестуємо сценарій на тестовому стенді.

Технічна реалізація

# broken_link_checker.py import asyncio import aiohttp from urllib.parse import urlparse, urljoin from bs4 import BeautifulSoup from collections import defaultdict class BrokenLinkChecker: def __init__(self, base_url: str, concurrency: int = 20): self.base_url = base_url self.domain = urlparse(base_url).netloc self.semaphore = asyncio.Semaphore(concurrency) self.visited: set[str] = set() self.broken: list[dict] = [] async def check(self) -> list[dict]: async with aiohttp.ClientSession( timeout=aiohttp.ClientTimeout(total=15), headers={'User-Agent': 'LinkChecker/1.0'}, ) as session: await self.crawl(session, self.base_url, referrer='root') return self.broken async def crawl(self, session: aiohttp.ClientSession, url: str, referrer: str): if url in self.visited: return self.visited.add(url) async with self.semaphore: try: async with session.get(url, allow_redirects=True) as resp: status = resp.status if status >= 400: self.broken.append({'url': url, 'status': status, 'referrer': referrer}) return # Парсим только HTML страницы своего домена if urlparse(url).netloc == self.domain and 'text/html' in resp.headers.get('Content-Type', ''): html = await resp.text() links = self.extract_links(url, html) tasks = [self.crawl(session, link, url) for link in links if link not in self.visited] await asyncio.gather(*tasks, return_exceptions=True) except asyncio.TimeoutError: self.broken.append({'url': url, 'status': 'timeout', 'referrer': referrer}) except Exception as e: self.broken.append({'url': url, 'status': str(e), 'referrer': referrer}) def extract_links(self, base: str, html: str) -> list[str]: soup = BeautifulSoup(html, 'lxml') links = [] for tag in soup.find_all(['a', 'link', 'img', 'script'], href=True): href = tag.get('href') or tag.get('src') if href: absolute = urljoin(base, href) parsed = urlparse(absolute) if parsed.scheme in ('http', 'https'): links.append(absolute.split('#')[0]) return list(set(links)) 

Планувальник та сповіщення

# scheduler.py (Celery Beat) from celery import Celery from broken_link_checker import BrokenLinkChecker import asyncio import requests app = Celery('tasks', broker='redis://localhost:6379/0') @app.task def check_broken_links(): checker = BrokenLinkChecker('https://example.com', concurrency=15) broken = asyncio.run(checker.check()) if not broken: return {'status': 'ok', 'checked': len(checker.visited)} # Відправляємо звіт в Slack message = f"🔗 Знайдено {len(broken)} битих посилань:\n" for item in broken[:10]: # Перші 10 message += f"• `{item['status']}` {item['url']}\n ← {item['referrer']}\n" if len(broken) > 10: message += f"...і ще {len(broken) - 10}. Повний звіт у CSV.\n" requests.post(os.env['SLACK_WEBHOOK'], json={'text': message}) # Зберігаємо в БД для історії BrokenLinkReport.objects.create( checked_at = timezone.now(), total_links = len(checker.visited), broken_count = len(broken), details = broken, ) return {'broken': len(broken)} 
# Розклад: щодня о 6:00 app.conf.beat_schedule = { 'daily-link-check': { 'task': 'scheduler.check_broken_links', 'schedule': crontab(hour=6, minute=0), }, } 

Як уникнути навантаження на сервер?

Краулер працює на окремому сервері, не навантажуючи ваш хостинг. Ми налаштовуємо затримки між запитами та поважаємо директиви robots.txt. Якщо сайт великий (понад 10 000 сторінок), розбиваємо сканування на етапи та використовуємо розподілені черги через Celery. Це гарантує, що перевірка не вплине на продуктивність вашого сайту для реальних користувачів. Зв'яжіться з нами, щоб ми підібрали оптимальну конфігурацію для вашого проєкту.

Технічні деталі обробки редиректів

Краулер слідує за редиректами (allow_redirects=True) та фіксує кінцевий статус. Якщо редирект веде на 404, це також вважається помилкою. Для ланцюжків редиректів використовується максимальна кількість переходів (за замовчуванням 10).

Порівняння способів перевірки посилань

Метод Трудомісткість Частота Точність
Ручна перевірка Висока (4 години на 500 сторінок) Раз на місяць або рідше Суб'єктивна, пропуски
Автоматична (наш підхід) Низька (5 хвилин на 500 сторінок) Щоденно 100% сканування всіх посилань

Автоматична перевірка в 50 разів швидша за ручний прогін та виключає людський фактор. Наша команда має багаторічний досвід в SEO-аудиті та розробці скриптів для веб-аналізу, виконавши понад 100 проєктів з автоматизації моніторингу посилань.

Типові помилки при самостійному налаштуванні

Помилка Наслідок Наше рішення
Відсутність таймауту Зависання на повільних ресурсах Встановлюємо таймаут 15 секунд
Пропуск JS-посилань Неповне сканування Парсимо повний HTML, включаючи динамічно завантажені посилання
Ігнорування реферерів Складно знайти сторінку-джерело Зберігаємо referrer для кожного знайденого URL

Які інструменти ми використовуємо?

Основний стек: Python 3.11, aiohttp для асинхронних запитів, BeautifulSoup для парсингу HTML, Celery для планування завдань та Redis як брокер повідомлень. Усі інструменти з відкритим кодом і добре документовані.

Що входить в налаштування

  • Аналіз структури сайту — визначаємо обсяг посилань, пріоритетні розділи.
  • Конфігурація краулера — налаштовуємо глибину обходу, обмеження по домену, таймаути.
  • Розклад сканування — задаємо частоту (щоденно, щотижнево) та час запуску.
  • Інтеграція сповіщень — підключаємо Slack, Telegram або email, налаштовуємо формат звіту.
  • Тестування — перевіряємо коректність роботи на тестовому сценарії.
  • Документація та підтримка — передаємо інструкцію з експлуатації, надаємо місяць підтримки.

Терміни та вартість

Налаштування займає від 1 до 2 робочих днів. Вартість розраховується індивідуально залежно від складності. Ми гарантуємо роботу краулера без навантаження на ваш сервер. Отримайте консультацію з налаштування моніторингу битих посилань вже сьогодні.