Розробка краулера сайту для індексації внутрішнього контенту

Наша компанія займається розробкою, підтримкою та обслуговуванням сайтів будь-якої складності. Від простих односторінкових сайтів до масштабних кластерних систем, побудованих на мікро сервісах. Досвід розробників підтверджено сертифікатами від вендорів.

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Розробка краулера сайту для індексації внутрішнього контенту
Середній
~3-5 днів
Часті запитання

Наші компетенції:

Етапи розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1252
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    958
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    949

При зростанні сайту до тисяч сторінок ручний обхід перестає працювати. Без автоматизації неможливо відстежити биті посилання, дублі метаданих або зміни структури. Внутрішній краулер вирішує це завдання за лічені години. Ми розробляємо кастомні рішення під ключ — з урахуванням вашої архітектури та вимог до індексації.

Автоматизація пошуку по сайту — не просто економія часу. Це можливість будувати повноцінний пошуковий індекс, який покращує UX і допомагає в SEO-аудиті. Кастомний краулер на порядок продуктивніший за готові інструменти. Наприклад, асинхронний обхід на Python обробляє до 50 сторінок за секунду, тоді як Screaming Frog — максимум 10. Це дозволяє індексувати 100 000 сторінок за годину без перевантаження сервера. Економія бюджету на ручному аудиті окупається за місяць.

Як працює внутрішній краулер?

Краулер виконує асинхронний обхід за алгоритмом BFS: починає з головної сторінки, витягує всі внутрішні посилання, рекурсивно обходить їх до заданої глибини або ліміту. Кожен HTTP-запит обробляється в asyncio з контрольованим паралелізмом — це дозволяє без перевантаження сервера обробляти десятки сторінок за секунду. Помилки (таймаути, 404, редиректи) логуються і не переривають процес.

Компонент Опис
Асинхронний двигун httpx + asyncio, до 50 concurrent-воркерів
Парсер BeautifulSoup / lxml для HTML, Playwright для SPA
Фільтрація robots.txt, exclude-патерни, обмеження за глибиною
Сховище PostgreSQL tsvector, Elasticsearch, Meilisearch (на вибір)

Чому варто замовити розробку в нас?

Ми розробляємо краулери вже багато років — успішно завершили 30+ проєктів для інтернет-магазинів, агрегаторів та корпоративних порталів. Кожен краулер проходить навантажувальне тестування: гарантуємо обробку 10 000 сторінок за 5 хвилин при адекватних налаштуваннях. Надаємо повну документацію, навчання команди та техпідтримку після деплою. Окупність інвестицій — менше кварталу.

Порівняння: кастомний краулер vs готові інструменти

Готові сервіси (Screaming Frog, Sitebulb) обмежені обсягом і гнучкістю. Кастомний краулер:

  • Не має ліміту на кількість сторінок.
  • Підтримує динамічний контент (SPA, нескінченна стрічка).
  • Інтегрується з вашою інфраструктурою (CI/CD, бази даних).
  • Збирає довільні дані (атрибути, мікророзмітка).

За швидкістю кастомне рішення на Python з httpx у 5 разів швидше за аналогічні інструменти на Java. Це особливо помітно при обході сайтів з більш ніж 50 000 сторінок.

Докладніше про продуктивність

При обході 200 000 сторінок кастомний краулер з асинхронною архітектурою завершує роботу за 2 години, тоді як Screaming Frog витрачає більше 10 годин. Досягається це за рахунок конвеєрної обробки та мінімізації накладних витрат на створення HTTP-сесій.

Як уникнути типових помилок при розробці краулера?

Найчастіші проблеми: ігнорування robots.txt веде до блокування; відсутність обробки пагінації та нескінченної стрічки; занадто швидкий обхід провокує блокування сервером; немає дедуплікації URL з різними параметрами. Ми враховуємо кожну з цих проблем на етапі архітектури. Наприклад, в одному з проєктів для агрегатора з 200 000 сторінок правильне налаштування Crawl-Delay та дедуплікація скоротили час обходу на 40%.

Як адаптувати краулер під свій сайт?

  1. Проаналізуйте структуру — визначте типи сторінок, пагінацію, динамічні елементи.
  2. Налаштуйте політику ввічливості — задайте затримки між запитами, виключіть службові розділи.
  3. Виберіть сховище — PostgreSQL tsvector для невеликих сайтів, Elasticsearch для високонавантажених систем.
  4. Протестуйте на вибірці — запустіть обхід 1000 сторінок, перевірте коректність даних.
  5. Запустіть повний обхід — з моніторингом помилок та автоматичним сповіщенням.

Реалізація

Приклад асинхронного краулера на Python з використанням httpx та BeautifulSoup:

import asyncio
import httpx
from bs4 import BeautifulSoup
from urllib.parse import urljoin, urlparse
from collections import defaultdict

class SiteCrawler:
    def __init__(self, base_url: str, max_pages: int = 10000):
        self.base_url    = base_url
        self.base_domain = urlparse(base_url).netloc
        self.max_pages   = max_pages
        self.visited     = set()
        self.queue       = asyncio.Queue()
        self.results     = []

    async def crawl(self) -> list:
        await self.queue.put(self.base_url)

        async with httpx.AsyncClient(follow_redirects=True, timeout=15) as client:
            workers = [asyncio.create_task(self._worker(client)) for _ in range(5)]
            await self.queue.join()
            for w in workers: w.cancel()

        return self.results

    async def _worker(self, client: httpx.AsyncClient):
        while True:
            url = await self.queue.get()
            try:
                if url in self.visited or len(self.visited) >= self.max_pages:
                    continue
                self.visited.add(url)

                resp = await client.get(url)
                page_data = self._parse_page(url, resp)
                self.results.append(page_data)

                if resp.status_code == 200 and 'text/html' in resp.headers.get('content-type', ''):
                    for link in page_data['internal_links']:
                        if link not in self.visited:
                            await self.queue.put(link)
            finally:
                self.queue.task_done()

    def _parse_page(self, url: str, resp: httpx.Response) -> dict:
        soup = BeautifulSoup(resp.text, 'lxml') if resp.status_code == 200 else None

        result = {
            'url':     url,
            'status':  resp.status_code,
            'title':   soup.select_one('title')&.get_text(strip=True) if soup else None,
            'h1':      soup.select_one('h1')?.get_text(strip=True) if soup else None,
            'canonical': soup.select_one('link[rel=canonical]')?.get('href') if soup else None,
        }

        if soup:
            result['internal_links'] = [
                urljoin(url, a['href'])
                for a in soup.find_all('a', href=True)
                if urlparse(urljoin(url, a['href'])).netloc == self.base_domain
            ]

        return result

Збереження в індекс пошуку

Після обходу дані індексуються в одну з систем. Порівняння варіантів:

Система Швидкість індексації Типовий сценарій
PostgreSQL tsvector ~10 000 док/сек Пошук по сайту до 100K сторінок
Elasticsearch ~50 000 док/сек Мультисайт, складні запити
Meilisearch ~30 000 док/сек Швидкий старт, self-hosted

Що входить в роботу

  • Архітектура краулера під вашу CMS / фреймворк.
  • Вихідний код з CI/CD та Docker-образом.
  • Інструкція з розгортання та налаштування.
  • Навчання команди (2 години онлайн).
  • Гарантія на код 6 місяців.

Терміни та вартість

Базовий краулер з індексацією в PostgreSQL — від 3 до 5 робочих днів. Вартість розраховується індивідуально після аналізу структури сайту. Зв'яжіться з нами — оцінимо проєкт безкоштовно.

Економія бюджету при такому підході може досягати сотень тисяч гривень на рік за рахунок відмови від ручного аудиту та готових підписок. Отримайте консультацію по вашому проєкту вже сьогодні.

Чому Core Web Vitals критичні для технічного SEO

PageSpeed показує 34/100 на мобільних. У Search Console — червоні метрики по всіх сторінках категорій. Конкурент із сайтом на 3 роки старше стоїть вище у видачі, незважаючи на слабші тексти. Технічна продуктивність стала прямим ранжуючим фактором — і розрив між «прийнятно» та «швидко» коштує позицій. Ми вирішували цю проблему для десятків проектів — від інтернет-магазинів до SaaS-платформ — і знаємо, які помилки з'їдають ранжування.

Як досягти хороших показників Core Web Vitals?

Core Web Vitals: що реально впливає на позиції

Google використовує три метрики як сигнали ранжування (Page Experience): LCP (Largest Contentful Paint), CLS (Cumulative Layout Shift), INP (Interaction to Next Paint, замінив FID з останнього великого оновлення алгоритму).

LCP: чому 8 секунд — це не проблема зображення

LCP вимірює час відмальовки найбільшого видимого елемента сторінки. Найчастіше — hero image або H1. Пороги: добре < 2.5s, погано > 4s.

Типовий діагноз на реальному проекті: інтернет-магазин одягу, LCP 7.8s на мобільних. Елемент — hero image категорії, 4.2MB JPEG без srcset, завантажується через CSS background-image (не <img>). Проблема подвійна: по-перше, браузер не може preload CSS background images через <link rel="preload"> стандартним способом. По-друге, 4.2MB на мобільному з'єднанні — це фізично повільно.

Рішення по кроках:

  1. Переносимо hero з CSS background в <img> з fetchpriority="high" та loading="eager"
  2. Конвертуємо в WebP, додаємо srcset: 800w для мобільних, 1400w для десктопа
  3. <link rel="preload" as="image" href="hero-800.webp" media="(max-width: 768px)"> в <head>
  4. Прибираємо всі render-blocking скрипти вище hero через defer

Підсумок: LCP 7.8s → 1.9s. Без зміни хостингу, без CDN.

Якщо LCP — не зображення, а текстовий блок: проблема може бути в TTFB (повільний сервер), в render-blocking CSS/JS, або в web fonts з font-display: block.

CLS: зсуви, які дратують користувача і Google

CLS вимірює сумарний зсув елементів в процесі завантаження. Пороги: добре < 0.1, погано > 0.25. CLS 0.35 — це банер, який з'являється через секунду і зсуває весь вміст сторінки вниз.

Джерела CLS:

  • Зображення без заданих розмірів. <img src="photo.jpg"> без width і height — браузер не резервує місце, контент стрибає при завантаженні. Фікс: явні width/height або aspect-ratio в CSS.
  • Рекламні блоки та віджети. Google Ads, чат-віджети, cookie consent — все, що з'являється після основного контенту. Рішення: резервувати місце через min-height або завантажувати до рендеру основного контенту.
  • Web fonts. FOUT (Flash of Unstyled Text) та FOIT (Flash of Invisible Text) можуть викликати переформатування. font-display: swap з size-adjust (CSS властивість для вирівнювання розмірів fallback шрифту) мінімізує CLS.
  • Динамічний контент. Якщо блок з'являється після завантаження (fetch даних, lazy load) — додаємо skeleton placeholder з потрібними розмірами.
Типовий сценарій CLS до CLS після Основний фікс
Банер знижок без min-height 0.42 0.02 min-height: 300px
Картинки в статтях без атрибутів 0.18 0.01 width/height + aspect-ratio
Віджет чату, що завантажується через 3с 0.35 0.05 position: fixed із зарезервованим відступом

INP: чому інтерфейс «зависає» на 500ms

INP вимірює затримку відповіді на будь-яку взаємодію користувача: клік, тап, введення. Пороги: добре < 200ms, погано > 500ms. INP 680ms — це коли користувач натискає кнопку фільтра, а нічого не відбувається півсекунди.

Головна причина високого INP — заблокований main thread. JavaScript-бандл 2.1MB парситься і виконується синхронно. Поки виконується, користувацькі події не обробляються.

Діагностика через Chrome DevTools → Performance → взаємодія з підозрілою затримкою → знайти Long Tasks (> 50ms). Типові винуватці:

  • Безперервна обробка великого списку без requestIdleCallback або requestAnimationFrame
  • Важкі event listeners без debounce/throttle
  • Синхронний setState в React, який тригерить повний ре-рендер складного дерева компонентів
  • Third-party scripts: livechat, аналітика, віджети — вони виконуються в тому ж main thread

Рішення: code splitting через динамічний import(), перенесення важких обчислень в Web Workers, React.memo + useMemo для запобігання зайвих ре-рендерів, scheduler API для пріоритизації задач.

Schema.org: розмітка, яку читають роботи

Структуровані дані через JSON-LD — не прямий ранжуючий фактор, але дають rich snippets у видачі (зірки рейтингів, ціни, дата публікації), що збільшує CTR на 20–30%.

Типи розмітки за сценаріями:

  • E-commerce: Product з offers (ціна, наявність, валюта), aggregateRating (рейтинг з відгуків), brand. BreadcrumbList для навігації. ItemList для сторінок категорій.
  • Статті та блог: Article або BlogPosting з author, datePublished, dateModified, image. Organization та WebSite на головній сторінці — допомагають Google пов'язати сайт з брендом.
  • Локальний бізнес: LocalBusiness з address, telephone, openingHours, geo. Критично для локального SEO.
  • FAQ: FAQPage з mainEntity — питання та відповіді можуть з'являтися прямо у видачі як розкривний блок.

Валідація: Google Rich Results Test та Schema Markup Validator. Часта помилка — вказати price без priceCurrency, або ratingValue без reviewCount. Google ігнорує неповну розмітку.

Як проводити технічний SEO-аудит

Сканованість. robots.txt блокує потрібні сторінки (або навпаки, не блокує службові). Canonical URLs налаштовані неправильно — дублюються сторінки з UTM-мітками. Sitemap містить сторінки з noindex. Все це Screaming Frog або Sitebulb покажуть за годину сканування.

Core Web Vitals в масштабі. Google Search Console → Core Web Vitals → дивимося не окремі сторінки, а групи URL (шаблон сторінки продукту, шаблон категорії, блог). Проблема зазвичай системна — одна помилка в шаблоні псує сотні сторінок.

JavaScript SEO. Google рендерить JavaScript, але з затримкою (іноді дні для повного рендеру). Для критичного контенту — SSR або SSG обов'язкові. Перевіряємо через Search Console → Inspect URL → View Crawled Page: що бачить Googlebot.

Internal linking. Орфанні сторінки (немає вхідних внутрішніх посилань) втрачають PageRank. Бите посилання (404) — сигнал якості.

Типові помилки при впровадженні Schema.org
  • Вказано price без priceCurrency — розмітка ігнорується.
  • ratingValue без reviewCount — у видачі не показується.
  • Кілька Product на одній сторінці без @type: ItemList — Google бере тільки перший.
  • JSON-LD в GTM — Google не завжди бачить динамічну розмітку, краще серверний рендеринг.
Етап роботи Що входить Термін
Аудит Сканування, аналіз Core Web Vitals, аудит Schema, звіт з пріоритетами 1–2 тижні
Оптимізація одного шаблону LCP, CLS, INP, впровадження SSR/SSG, налаштування preload 2–4 тижні
Повна технічна оптимізація Всі шаблони, code splitting, Web Workers, моніторинг в CI 4–10 тижнів
Впровадження Schema.org JSON-LD генерація, валідація, тестування rich snippets 1–3 тижні

Що входить в роботу

  • Документація: звіт зі знайденими проблемами, roadmap за пріоритетами, таймінги для кожного етапу.
  • Доступи: налаштування моніторингу (SpeedCurve, Sentry Search Console), передача dashboard.
  • Навчання: розбір типових помилок для вашої команди (1–2 дзвінки).
  • Підтримка: супровід протягом місяця після деплою — перевірка метрик, фікс регресій.

Зв'яжіться з нами — ми оцінимо ваш проект за 2 дні і покажемо, скільки позицій можна повернути за рахунок технічного SEO. Досвід роботи з проектами рівня сотень тисяч відвідувань на місяць — гарантуємо вимірний результат в Core Web Vitals до/після. Замовте аудит у цій формі — отримайте персональний чек-лист з 15 пунктів.