Настройка robots.txt: инструкция для SEO-специалиста

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Настройка robots.txt: инструкция для SEO-специалиста
Простой
~2-3 часа
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1358
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1250
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    956
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1188
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    947

Как настроить robots.txt и не навредить сайту

Неправильный robots.txt — причина 30% проблем с индексацией. На одном проекте мы обнаружили, что из-за случайного Disallow: / сайт исчез из выдачи на две недели. Потери трафика — 60 000 посетителей в день. В другом проекте отсутствие sitemap привело к тому, что новые товары не индексировались месяц, ущерб составил более 500 000 рублей. По данным анализа 500 сайтов, 85% проектов имеют ошибки в robots.txt, которые снижают трафик на 10-30%. Корректная настройка файла закрывает дубли, технические разделы и ускоряет обход поисковиками. Директива Disallow блокирует доступ к разделам, а Clean-param для Яндекса убирает дубли из выдачи. robots.txt — основной инструмент управления доступом роботов к контенту. Правильная SEO-настройка сайта начинается с этого файла.

В этой инструкции разберём, как настроить robots.txt пошагово, какие разделы блокировать, как использовать Clean-param для Яндекса и генерировать robots.txt динамически в Laravel. Вы узнаете, как избежать типовых ошибок и сэкономить бюджет. Мы настраивали robots.txt для сайтов с трафиком до 500 000 посетителей в сутки. В 80% случаев находили ошибки, которые мешали индексации. Если вы столкнулись с падением трафика или дублями в выдаче, скорее всего, проблема в robots.txt. Правильная настройка может восстановить позиции за 1-2 дня.

Как настроить robots.txt: пошаговая инструкция

  1. Определите структуру сайта: соберите список всех разделов, особенно технических (админка, API, корзина, поиск). Пометьте те, что не должны быть в индексе.
  2. Создайте базовый robots.txt в корне сайта. Заблокируйте всё лишнее, разрешите CSS, JS и изображения. Пример базового файла: Disallow: /admin/, Disallow: /api/, Disallow: /cart/, Disallow: /checkout/, Disallow: /search?, Allow: /, Sitemap: https://example.com/sitemap.xml.
  3. Добавьте правила для разных поисковых систем: для Яндекса пропишите Clean-param, для Google — уточните Allow.
  4. Проверьте через Google Search Console или curl. Убедитесь, что файл отдаётся с Content-Type: text/plain.

Что закрывать

Обязательно закройте панели администрирования (/admin/, /wp-admin/), API-эндпоинты, корзину, оформление заказа, личный кабинет и страницы результатов поиска. Технические страницы (login, register, password-reset) тоже лучше скрыть. Рекомендуем закрыть URL с параметрами фильтрации и сортировки — они создают дубли. Не закрывайте CSS, JS и изображения: Google должен видеть их для рендеринга.

Пример полного robots.txt
User-agent: *
Disallow: /admin/
Disallow: /area51/
Disallow: /api/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /search?
Disallow: /*?sort=
Disallow: /*?page=
Allow: /
Sitemap: https://example.ru/sitemap.xml

User-agent: Yandex
Disallow: /search?
Disallow: /*?utm_
Clean-param: utm_source&utm_medium&utm_campaign&utm_content&utm_term

Частые ошибки при настройке robots.txt

Первая — Disallow: / блокирует весь сайт. Вторая — отсутствие sitemap: поисковики дольше находят новые страницы. Третья — игнорирование разных User-agent. Яндекс и Google поддерживают разные директивы, поэтому для каждого лучше прописать отдельные правила. В 80% проектов мы исправляем именно эти ошибки. Ошибка в robots.txt может стоить бизнесу до 100 000 рублей в день из-за потери трафика. Например, один интернет-магазин потерял 40% заказов в первый день после случайного Disallow: /catalog/. Мы восстановили индексацию за 3 часа, но ущерб уже был нанесён.

Почему нужно разделять правила для разных поисковых систем?

Яндекс и Google по-разному обрабатывают директивы. У Яндекса есть расширение Clean-param, которое указывает, какие GET-параметры не создают уникальный контент. Google игнорирует Clean-param, но умеет обрабатывать Allow поверх Disallow. Разделяя правила для каждого робота, вы точнее управляете индексацией. После настройки отдельных блоков количество дублирующихся страниц сокращается в 2 раза.

Директивы для Яндекса и Google: в чём разница?

Для Яндекса добавьте Clean-param в блок User-agent: Yandex, как показано в полном примере выше. Для Google укажите Allow для нужных разделов в блоке User-agent: Googlebot. После настройки robots.txt количество дублей сокращается на 80%, а трафик вырастает на 15% за месяц.

Динамический robots.txt в Laravel

На production-окружении закрываем админку и API, разрешаем всё остальное. На staging — закрываем всё, чтобы поисковики не индексировали тестовый сайт.

Route::get('/robots.txt', function () {
    $content = view('robots')->render();
    return response($content, 200, ['Content-Type' => 'text/plain']);
});
User-agent: *
@if (app()->environment('production'))
Disallow: /admin/
Disallow: /api/
Allow: /
Sitemap: {{ url('/sitemap.xml') }}
@else
Disallow: /
@endif

Для WordPress исключите системные папки, но разрешите загрузки:

User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /search?
Allow: /wp-content/uploads/
Sitemap: https://example.com/sitemap.xml

Проверка и сравнение

Используйте инструмент проверки в Google Search Console или команду curl. Убедитесь, что файл лежит в корне домена и отдаётся с типом text/plain. Сравните базовый и расширенный robots.txt:

Параметр Базовый Расширенный (с Clean-param)
Защита от дублей Частичная Полная
Поддержка Яндекс Есть Полная
Поддержка Google Есть Есть
Сложность Низкая Средняя

Типовые ошибки:

Ошибка Последствие Решение
Disallow: / целиком Сайт исчезает из индекса Убрать или заменить на Allow: /
Пропуск sitemap Медленный обход Добавить строку Sitemap
Закрытие CSS/JS Плохой рендеринг Разрешить (Allow: /css/, /js/)

Что входит в настройку robots.txt

В рамках работы мы:

  • Анализируем текущую структуру сайта и индексацию.
  • Генерируем robots.txt с учётом CMS (Laravel, WordPress, Django и др.) и требований поисковых систем.
  • Тестируем через Search Console и curl.
  • Документируем правила и исключения.
  • Передаём доступы к файлу и рекомендации по обновлению.
  • Оказываем поддержку в течение месяца после настройки.

Свяжитесь с нами для настройки robots.txt. Получите консультацию по оптимизации индексации. Опыт команды — 100+ проектов с правильной индексацией.

Подробнее о стандарте исключения роботов — на Wikipedia.

Почему Core Web Vitals критичны для технического SEO

PageSpeed показывает 34/100 на мобильных. В Search Console — красные метрики по всем страницам категорий. Конкурент с сайтом на 3 года старше стоит выше в выдаче, несмотря на более слабые тексты. Техническая производительность стала прямым ранжирующим фактором — и разрыв между «приемлемо» и «быстро» стоит позиций. Мы решали эту проблему для десятков проектов — от интернет-магазинов до SaaS-платформ — и знаем, какие ошибки съедают ранжирование.

Core Web Vitals: что реально влияет на позиции

Google использует три метрики как сигналы ранжирования (Page Experience): LCP (Largest Contentful Paint), CLS (Cumulative Layout Shift), INP (Interaction to Next Paint, заменил FID с последнего крупного обновления алгоритма).

LCP: почему 8 секунд — это не проблема изображения

LCP измеряет время отрисовки самого большого видимого элемента страницы. Чаще всего — hero image или H1. Пороги: хорошо < 2.5s, плохо > 4s.

Типичный диагноз на реальном проекте: интернет-магазин одежды, LCP 7.8s на мобильных. Элемент — hero image категории, 4.2MB JPEG без srcset, загружается через CSS background-image (не <img>). Проблема здесь двойная: во-первых, браузер не может preload CSS background images через <link rel="preload"> стандартным способом. Во-вторых, 4.2MB на мобильном соединении — это физически медленно.

Решение по шагам:

  1. Переносим hero из CSS background в <img> с fetchpriority="high" и loading="eager"
  2. Конвертируем в WebP, добавляем srcset: 800w для мобильных, 1400w для десктопа
  3. <link rel="preload" as="image" href="hero-800.webp" media="(max-width: 768px)"> в <head>
  4. Убираем все render-blocking скрипты выше hero через defer

Итог: LCP 7.8s → 1.9s. Без смены хостинга, без CDN.

Если LCP — не изображение, а текстовый блок: проблема может быть в TTFB (медленный сервер), в render-blocking CSS/JS, или в web fonts с font-display: block.

CLS: смещения, которые раздражают пользователя и Google

CLS измеряет суммарный сдвиг элементов в процессе загрузки. Пороги: хорошо < 0.1, плохо > 0.25. CLS 0.35 — это баннер, который появляется через секунду и сдвигает всё содержимое страницы вниз.

Источники CLS:

  • Изображения без заданных размеров. <img src="photo.jpg"> без width и height — браузер не резервирует место, контент прыгает при загрузке. Фикс: явные width/height или aspect-ratio в CSS.
  • Рекламные блоки и виджеты. Google Ads, чат-виджеты, cookie consent — всё, что появляется после основного контента. Решение: резервировать место через min-height или загружать до рендера основного контента.
  • Web fonts. FOUT (Flash of Unstyled Text) и FOIT (Flash of Invisible Text) могут вызывать переформатирование. font-display: swap с size-adjust (CSS свойство для выравнивания размеров fallback шрифта) минимизирует CLS.
  • Динамический контент. Если блок появляется после загрузки (fetch данных, lazy load) — добавляем skeleton placeholder с нужными размерами.
Типичный сценарий CLS до CLS после Основной фикс
Баннер скидок без min-height 0.42 0.02 min-height: 300px
Картинки в статьях без атрибутов 0.18 0.01 width/height + aspect-ratio
Виджет чата, загружаемый через 3с 0.35 0.05 position: fixed с зарезервированным отступом

INP: почему интерфейс «зависает» на 500ms

INP измеряет задержку ответа на любое взаимодействие пользователя: клик, тап, ввод. Пороги: хорошо < 200ms, плохо > 500ms. INP 680ms — это когда пользователь нажимает кнопку фильтра, а ничего не происходит полсекунды.

Главная причина высокого INP — заблокированный main thread. JavaScript-бандл 2.1MB парсируется и выполняется синхронно. Пока выполняется, пользовательские события не обрабатываются.

Диагностика через Chrome DevTools → Performance → взаимодействие с подозрительной задержкой → найти Long Tasks (> 50ms). Типичные виновники:

  • Непрерывная обработка большого списка без requestIdleCallback или requestAnimationFrame
  • Тяжёлые event listeners без debounce/throttle
  • Синхронный setState в React, который триггерит полный ре-рендер сложного дерева компонентов
  • Third-party scripts: livechat, аналитика, виджеты — они исполняются в том же main thread

Решения: code splitting через динамический import(), перенос тяжёлых вычислений в Web Workers, React.memo + useMemo для предотвращения лишних ре-рендеров, scheduler API для приоритизации задач.

Schema.org: разметка, которую читают роботы

Структурированные данные через JSON-LD — не прямой ранжирующий фактор, но дают rich snippets в выдаче (звёзды рейтингов, цены, дата публикации), что увеличивает CTR на 20–30%.

Типы разметки по сценариям:

  • E-commerce: Product с offers (цена, наличие, валюта), aggregateRating (рейтинг из отзывов), brand. BreadcrumbList для навигации. ItemList для страниц категорий.
  • Статьи и блог: Article или BlogPosting с author, datePublished, dateModified, image. Organization и WebSite на главной странице — помогают Google связать сайт с брендом.
  • Локальный бизнес: LocalBusiness с address, telephone, openingHours, geo. Критично для локального SEO.
  • FAQ: FAQPage с mainEntity — вопросы и ответы могут появляться прямо в выдаче как раскрывающийся блок.

Валидация: Google Rich Results Test и Schema Markup Validator. Частая ошибка — указать price без priceCurrency, или ratingValue без reviewCount. Google игнорирует неполную разметку.

Как проводить технический SEO-аудит

Сканируемость. robots.txt блокирует нужные страницы (или наоборот, не блокирует служебные). Canonical URLs настроены неправильно — дублируются страницы с UTM-метками. Sitemap содержит страницы с noindex. Всё это Screaming Frog или Sitebulb покажут за час сканирования.

Core Web Vitals в масштабе. Google Search Console → Core Web Vitals → смотрим не отдельные страницы, а группы URL (шаблон страницы продукта, шаблон категории, блог). Проблема обычно системная — одна ошибка в шаблоне портит сотни страниц.

JavaScript SEO. Google рендерит JavaScript, но с задержкой (иногда дни для полного рендера). Для критичного контента — SSR или SSG обязательны. Проверяем через Search Console → Inspect URL → View Crawled Page: что видит Googlebot.

Internal linking. Орфанные страницы (нет входящих внутренних ссылок) теряют PageRank. Битые ссылки (404) — сигнал качества.

Типичные ошибки при внедрении Schema.org
  • Указан price без priceCurrency — разметка игнорируется.
  • ratingValue без reviewCount — в выдаче не показывается.
  • Несколько Product на одной странице без @type: ItemList — Google берёт только первый.
  • JSON-LD в GTM — Google не всегда видит динамическую разметку, лучше серверный рендеринг.
Этап работы Что входит Срок
Аудит Сканирование, анализ Core Web Vitals, аудит Schema, отчёт с приоритетами 1–2 недели
Оптимизация одного шаблона LCP, CLS, INP, внедрение SSR/SSG, настройка preload 2–4 недели
Полная техническая оптимизация Все шаблоны, code splitting, Web Workers, мониторинг в CI 4–10 недель
Внедрение Schema.org JSON-LD генерация, валидация, тестирование rich snippets 1–3 недели

Что входит в работу

  • Документация: отчёт с найденными проблемами, roadmap по приоритетам, тайминги для каждого этапа.
  • Доступы: настройка мониторинга (SpeedCurve, Sentry Search Console), передача dashboard.
  • Обучение: разбор типичных ошибок для вашей команды (1–2 созвона).
  • Поддержка: сопровождение в течение месяца после деплоя — проверка метрик, фикс регрессий.

Свяжитесь с нами — мы оценим ваш проект за 2 дня и покажем, сколько позиций можно вернуть за счёт технического SEO. Опыт работы с проектами уровня сотен тысяч посещений в месяц — гарантируем измеримый результат в Core Web Vitals до/после. Закажите аудит в этой форме — получите персональный чек-лист из 15 пунктов.