Настройка автоматической проверки битых ссылок на сайте

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Настройка автоматической проверки битых ссылок на сайте
Простой
от 1 дня до 3 дней
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    957
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1189
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    948

Представьте: на сайте сотни страниц с внешними ссылками. Через месяц после последнего аудита одна из ссылок перестала работать — ресурс удалили. Вы теряете позиции в поиске из-за битых ссылок (404 ошибок), а пользователи уходят с неработающей страницы. По данным Moz, более 30% пользователей покидают сайт при встрече с неработающей ссылкой. Каждая 404-ошибка — сигнал о низком качестве сайта для поисковых систем. Мы решаем эту проблему: настраиваем автоматическое сканирование всех ссылок по расписанию с уведомлениями о найденных ошибках. Вы получаете отчёт до того, как проблема повлияет на SEO или UX.

Почему битые ссылки вредят SEO?

Поисковые системы Google и Яндекс учитывают наличие неработающих ссылок при ранжировании. Каждая 404-ошибка — сигнал о низком качестве сайта. Особенно критичны битые ссылки в меню, футере и на целевых страницах — они напрямую влияют на поведенческие факторы. Автоматический мониторинг позволяет выявить проблему за минуты, а не дни. Google Search Console фиксирует 404-ошибки с задержкой, наш подход даёт актуальные данные в реальном времени. По нашим данным, своевременное обнаружение битых ссылок снижает показатель отказов на 15%.

Как работает автоматическая проверка?

Мы используем асинхронный краулер на Python с библиотекой aiohttp. Он параллельно обрабатывает до 20 ссылок, проверяя HTTP-статус каждой. При обнаружении ошибки (4xx, 5xx, таймаут) ссылка фиксируется с указанием реферера. После завершения сканирования формируется отчёт с полным списком битых линков и отправляется в выбранный канал (Slack, Telegram, email). Мы настраиваем уведомления так, чтобы вы получали ежедневный отчёт с краткой сводкой и ссылкой на полный CSV. Для сайта из 5000 страниц полное сканирование занимает около часа.

Пошаговый процесс настройки:

  1. Устанавливаем Python-окружение и зависимости (aiohttp, BeautifulSoup, Celery).
  2. Конфигурируем краулер: задаём стартовый URL, ограничения по домену, таймауты.
  3. Настраиваем планировщик Celery Beat для ежедневного запуска.
  4. Интегрируем уведомления в Slack или Telegram.
  5. Тестируем сценарий на тестовом стенде.

Техническая реализация

# broken_link_checker.py
import asyncio
import aiohttp
from urllib.parse import urlparse, urljoin
from bs4 import BeautifulSoup
from collections import defaultdict

class BrokenLinkChecker:
    def __init__(self, base_url: str, concurrency: int = 20):
        self.base_url  = base_url
        self.domain    = urlparse(base_url).netloc
        self.semaphore = asyncio.Semaphore(concurrency)
        self.visited:  set[str] = set()
        self.broken:   list[dict] = []

    async def check(self) -> list[dict]:
        async with aiohttp.ClientSession(
            timeout=aiohttp.ClientTimeout(total=15),
            headers={'User-Agent': 'LinkChecker/1.0'},
        ) as session:
            await self.crawl(session, self.base_url, referrer='root')
        return self.broken

    async def crawl(self, session: aiohttp.ClientSession, url: str, referrer: str):
        if url in self.visited:
            return
        self.visited.add(url)

        async with self.semaphore:
            try:
                async with session.get(url, allow_redirects=True) as resp:
                    status = resp.status
                    if status >= 400:
                        self.broken.append({'url': url, 'status': status, 'referrer': referrer})
                        return

                    # Парсим только HTML страницы своего домена
                    if urlparse(url).netloc == self.domain and 'text/html' in resp.headers.get('Content-Type', ''):
                        html = await resp.text()
                        links = self.extract_links(url, html)
                        tasks = [self.crawl(session, link, url) for link in links if link not in self.visited]
                        await asyncio.gather(*tasks, return_exceptions=True)

            except asyncio.TimeoutError:
                self.broken.append({'url': url, 'status': 'timeout', 'referrer': referrer})
            except Exception as e:
                self.broken.append({'url': url, 'status': str(e), 'referrer': referrer})

    def extract_links(self, base: str, html: str) -> list[str]:
        soup = BeautifulSoup(html, 'lxml')
        links = []
        for tag in soup.find_all(['a', 'link', 'img', 'script'], href=True):
            href = tag.get('href') or tag.get('src')
            if href:
                absolute = urljoin(base, href)
                parsed = urlparse(absolute)
                if parsed.scheme in ('http', 'https'):
                    links.append(absolute.split('#')[0])
        return list(set(links))

Планировщик и уведомления

# scheduler.py (Celery Beat)
from celery import Celery
from broken_link_checker import BrokenLinkChecker
import asyncio
import requests

app = Celery('tasks', broker='redis://localhost:6379/0')

@app.task
    def check_broken_links():
        checker = BrokenLinkChecker('https://example.com', concurrency=15)
        broken  = asyncio.run(checker.check())

    if not broken:
        return {'status': 'ok', 'checked': len(checker.visited)}

    # Отправляем отчёт в Slack
    message = f"🔗 Найдено {len(broken)} битых ссылок:\n"
    for item in broken[:10]:  # Первые 10
        message += f"• `{item['status']}` {item['url']}\n  ← {item['referrer']}\n"
    if len(broken) > 10:
        message += f"...и ещё {len(broken) - 10}. Полный отчёт в CSV.\n"

    requests.post(os.env['SLACK_WEBHOOK'], json={'text': message})

    # Сохраняем в БД для истории
    BrokenLinkReport.objects.create(
        checked_at  = timezone.now(),
        total_links = len(checker.visited),
        broken_count = len(broken),
        details     = broken,
    )

    return {'broken': len(broken)}
# Расписание: каждый день в 6:00
app.conf.beat_schedule = {
    'daily-link-check': {
        'task':     'scheduler.check_broken_links',
        'schedule': crontab(hour=6, minute=0),
    },
}

Как избежать нагрузки на сервер?

Краулер работает на отдельном сервере, не нагружая ваш хостинг. Мы настраиваем задержки между запросами и уважаем директивы robots.txt. Если сайт большой (более 10 000 страниц), разбиваем сканирование на этапы и используем распределённые очереди через Celery. Это гарантирует, что проверка не повлияет на производительность вашего сайта для реальных пользователей. Свяжитесь с нами, чтобы мы подобрали оптимальную конфигурацию для вашего проекта.

Технические детали обработки редиректов

Краулер следует за редиректами (allow_redirects=True) и фиксирует конечный статус. Если редирект ведёт на 404, это также считается ошибкой. Для цепочек редиректов используется максимальное количество переходов (по умолчанию 10).

Сравнение способов проверки ссылок

Метод Трудоёмкость Частота Точность
Ручная проверка Высокая (4 часа на 500 страниц) Раз в месяц или реже Субъективная, пропуски
Автоматическая (наш подход) Низкая (5 минут на 500 страниц) Ежедневно 100% сканирование всех ссылок

Автоматическая проверка в 50 раз быстрее ручного прогона и исключает человеческий фактор. Наша команда имеет многолетний опыт в SEO-аудите и разработке скриптов для веб-анализа, выполнив более 100 проектов по автоматизации мониторинга ссылок.

Типичные ошибки при самостоятельной настройке

Ошибка Последствие Наше решение
Отсутствие таймаута Зависание на медленных ресурсах Устанавливаем таймаут 15 секунд
Пропуск JS-ссылок Неполное сканирование Парсим полный HTML, включая динамически подгружаемые ссылки
Игнорирование рефереров Сложно найти страницу-источник Сохраняем referrer для каждого найденного URL

Какие инструменты мы используем?

Основной стек: Python 3.11, aiohttp для асинхронных запросов, BeautifulSoup для парсинга HTML, Celery для планирования задач и Redis как брокер сообщений. Все инструменты с открытым исходным кодом и хорошо документированы.

Что входит в настройку

  • Анализ структуры сайта — определяем объём ссылок, приоритетные разделы.
  • Конфигурация краулера — настраиваем глубину обхода, ограничения по домену, таймауты.
  • Расписание сканирования — задаём частоту (ежедневно, еженедельно) и время запуска.
  • Интеграция уведомлений — подключаем Slack, Telegram или email, настраиваем формат отчёта.
  • Тестирование — проверяем корректность работы на тестовом сценарии.
  • Документация и поддержка — передаём инструкцию по эксплуатации, предоставляем месяц поддержки.

Сроки и стоимость

Настройка занимает от 1 до 2 рабочих дней. Стоимость рассчитывается индивидуально в зависимости от сложности. Мы гарантируем работу краулера без нагрузки на ваш сервер. Получите консультацию по настройке мониторинга битых ссылок уже сегодня.

Почему Core Web Vitals критичны для технического SEO

PageSpeed показывает 34/100 на мобильных. В Search Console — красные метрики по всем страницам категорий. Конкурент с сайтом на 3 года старше стоит выше в выдаче, несмотря на более слабые тексты. Техническая производительность стала прямым ранжирующим фактором — и разрыв между «приемлемо» и «быстро» стоит позиций. Мы решали эту проблему для десятков проектов — от интернет-магазинов до SaaS-платформ — и знаем, какие ошибки съедают ранжирование.

Core Web Vitals: что реально влияет на позиции

Google использует три метрики как сигналы ранжирования (Page Experience): LCP (Largest Contentful Paint), CLS (Cumulative Layout Shift), INP (Interaction to Next Paint, заменил FID с последнего крупного обновления алгоритма).

LCP: почему 8 секунд — это не проблема изображения

LCP измеряет время отрисовки самого большого видимого элемента страницы. Чаще всего — hero image или H1. Пороги: хорошо < 2.5s, плохо > 4s.

Типичный диагноз на реальном проекте: интернет-магазин одежды, LCP 7.8s на мобильных. Элемент — hero image категории, 4.2MB JPEG без srcset, загружается через CSS background-image (не <img>). Проблема здесь двойная: во-первых, браузер не может preload CSS background images через <link rel="preload"> стандартным способом. Во-вторых, 4.2MB на мобильном соединении — это физически медленно.

Решение по шагам:

  1. Переносим hero из CSS background в <img> с fetchpriority="high" и loading="eager"
  2. Конвертируем в WebP, добавляем srcset: 800w для мобильных, 1400w для десктопа
  3. <link rel="preload" as="image" href="hero-800.webp" media="(max-width: 768px)"> в <head>
  4. Убираем все render-blocking скрипты выше hero через defer

Итог: LCP 7.8s → 1.9s. Без смены хостинга, без CDN.

Если LCP — не изображение, а текстовый блок: проблема может быть в TTFB (медленный сервер), в render-blocking CSS/JS, или в web fonts с font-display: block.

CLS: смещения, которые раздражают пользователя и Google

CLS измеряет суммарный сдвиг элементов в процессе загрузки. Пороги: хорошо < 0.1, плохо > 0.25. CLS 0.35 — это баннер, который появляется через секунду и сдвигает всё содержимое страницы вниз.

Источники CLS:

  • Изображения без заданных размеров. <img src="photo.jpg"> без width и height — браузер не резервирует место, контент прыгает при загрузке. Фикс: явные width/height или aspect-ratio в CSS.
  • Рекламные блоки и виджеты. Google Ads, чат-виджеты, cookie consent — всё, что появляется после основного контента. Решение: резервировать место через min-height или загружать до рендера основного контента.
  • Web fonts. FOUT (Flash of Unstyled Text) и FOIT (Flash of Invisible Text) могут вызывать переформатирование. font-display: swap с size-adjust (CSS свойство для выравнивания размеров fallback шрифта) минимизирует CLS.
  • Динамический контент. Если блок появляется после загрузки (fetch данных, lazy load) — добавляем skeleton placeholder с нужными размерами.
Типичный сценарий CLS до CLS после Основной фикс
Баннер скидок без min-height 0.42 0.02 min-height: 300px
Картинки в статьях без атрибутов 0.18 0.01 width/height + aspect-ratio
Виджет чата, загружаемый через 3с 0.35 0.05 position: fixed с зарезервированным отступом

INP: почему интерфейс «зависает» на 500ms

INP измеряет задержку ответа на любое взаимодействие пользователя: клик, тап, ввод. Пороги: хорошо < 200ms, плохо > 500ms. INP 680ms — это когда пользователь нажимает кнопку фильтра, а ничего не происходит полсекунды.

Главная причина высокого INP — заблокированный main thread. JavaScript-бандл 2.1MB парсируется и выполняется синхронно. Пока выполняется, пользовательские события не обрабатываются.

Диагностика через Chrome DevTools → Performance → взаимодействие с подозрительной задержкой → найти Long Tasks (> 50ms). Типичные виновники:

  • Непрерывная обработка большого списка без requestIdleCallback или requestAnimationFrame
  • Тяжёлые event listeners без debounce/throttle
  • Синхронный setState в React, который триггерит полный ре-рендер сложного дерева компонентов
  • Third-party scripts: livechat, аналитика, виджеты — они исполняются в том же main thread

Решения: code splitting через динамический import(), перенос тяжёлых вычислений в Web Workers, React.memo + useMemo для предотвращения лишних ре-рендеров, scheduler API для приоритизации задач.

Schema.org: разметка, которую читают роботы

Структурированные данные через JSON-LD — не прямой ранжирующий фактор, но дают rich snippets в выдаче (звёзды рейтингов, цены, дата публикации), что увеличивает CTR на 20–30%.

Типы разметки по сценариям:

  • E-commerce: Product с offers (цена, наличие, валюта), aggregateRating (рейтинг из отзывов), brand. BreadcrumbList для навигации. ItemList для страниц категорий.
  • Статьи и блог: Article или BlogPosting с author, datePublished, dateModified, image. Organization и WebSite на главной странице — помогают Google связать сайт с брендом.
  • Локальный бизнес: LocalBusiness с address, telephone, openingHours, geo. Критично для локального SEO.
  • FAQ: FAQPage с mainEntity — вопросы и ответы могут появляться прямо в выдаче как раскрывающийся блок.

Валидация: Google Rich Results Test и Schema Markup Validator. Частая ошибка — указать price без priceCurrency, или ratingValue без reviewCount. Google игнорирует неполную разметку.

Как проводить технический SEO-аудит

Сканируемость. robots.txt блокирует нужные страницы (или наоборот, не блокирует служебные). Canonical URLs настроены неправильно — дублируются страницы с UTM-метками. Sitemap содержит страницы с noindex. Всё это Screaming Frog или Sitebulb покажут за час сканирования.

Core Web Vitals в масштабе. Google Search Console → Core Web Vitals → смотрим не отдельные страницы, а группы URL (шаблон страницы продукта, шаблон категории, блог). Проблема обычно системная — одна ошибка в шаблоне портит сотни страниц.

JavaScript SEO. Google рендерит JavaScript, но с задержкой (иногда дни для полного рендера). Для критичного контента — SSR или SSG обязательны. Проверяем через Search Console → Inspect URL → View Crawled Page: что видит Googlebot.

Internal linking. Орфанные страницы (нет входящих внутренних ссылок) теряют PageRank. Битые ссылки (404) — сигнал качества.

Типичные ошибки при внедрении Schema.org
  • Указан price без priceCurrency — разметка игнорируется.
  • ratingValue без reviewCount — в выдаче не показывается.
  • Несколько Product на одной странице без @type: ItemList — Google берёт только первый.
  • JSON-LD в GTM — Google не всегда видит динамическую разметку, лучше серверный рендеринг.
Этап работы Что входит Срок
Аудит Сканирование, анализ Core Web Vitals, аудит Schema, отчёт с приоритетами 1–2 недели
Оптимизация одного шаблона LCP, CLS, INP, внедрение SSR/SSG, настройка preload 2–4 недели
Полная техническая оптимизация Все шаблоны, code splitting, Web Workers, мониторинг в CI 4–10 недель
Внедрение Schema.org JSON-LD генерация, валидация, тестирование rich snippets 1–3 недели

Что входит в работу

  • Документация: отчёт с найденными проблемами, roadmap по приоритетам, тайминги для каждого этапа.
  • Доступы: настройка мониторинга (SpeedCurve, Sentry Search Console), передача dashboard.
  • Обучение: разбор типичных ошибок для вашей команды (1–2 созвона).
  • Поддержка: сопровождение в течение месяца после деплоя — проверка метрик, фикс регрессий.

Свяжитесь с нами — мы оценим ваш проект за 2 дня и покажем, сколько позиций можно вернуть за счёт технического SEO. Опыт работы с проектами уровня сотен тысяч посещений в месяц — гарантируем измеримый результат в Core Web Vitals до/после. Закажите аудит в этой форме — получите персональный чек-лист из 15 пунктов.