Индексация

Robots.txt: как настроить файл для SEO

6 мин чтения

Практическое руководство по настройке robots.txt: основные директивы, примеры для популярных CMS, связь с sitemap.xml, проверка файла и разбор типичных ошибок.

Robots.txt: как настроить файл для SEO

Robots.txt: как настроить файл для сайта

Файл robots.txt сообщает поисковым роботам, какие разделы сайта можно сканировать, а какие следует исключить из обхода. Он находится в корневой папке домена и открывается по адресу site.ru/robots.txt. Правильная настройка помогает уменьшить количество технических страниц в обходе, направить внимание робота на важный контент и снизить нагрузку на сервер.

Важно понимать: robots.txt управляет именно сканированием, но не гарантирует удаление страницы из поисковой выдачи. Если URL известен поисковой системе из внешних ссылок или других источников, он может появиться в индексе даже при запрете обхода. Для удаления страниц обычно применяют метатег noindex, HTTP-заголовок X-Robots-Tag или настройку доступа на уровне сервера.

Директивы robots.txt

Синтаксис файла простой: каждая директива записывается с новой строки. Основные параметры имеют следующий вид:

  • User-agent определяет, для какого робота действует правило. Значение * означает всех роботов.
  • Disallow запрещает обход указанного пути.
  • Allow разрешает обход пути, который попадает под более общее ограничение.
  • Sitemap указывает адрес XML-карты сайта.
  • Host ранее использовалась Яндексом для выбора главного зеркала, но сейчас не является обязательной и в большинстве случаев не нужна.

Простейший открытый вариант выглядит так:

User-agent: *
Disallow:
Sitemap: https://site.ru/sitemap.xml

Пустое значение после Disallow означает, что запретов нет. Чтобы закрыть каталог от всех роботов, используют запись:

User-agent: *
Disallow: /admin/

Символ звёздочки применяется как маска. Например, правило Disallow: /*? запрещает URL, содержащие знак вопроса, и часто используется для ограничения сканирования страниц с параметрами. Однако такую директиву нельзя добавлять без анализа сайта: параметры могут участвовать в важных посадочных страницах или фильтрах, которые должны индексироваться.

Для закрытия конкретного файла или раздела указывают полный путь относительно корня домена:

User-agent: *
Disallow: /private/
Disallow: /tmp/
Disallow: /service-test.html

Правила можно задавать отдельным роботам. Например, следующий блок запрещает Googlebot сканировать каталог, а для остальных роботов ограничение не устанавливается:

User-agent: Googlebot
Disallow: /catalog-test/

Блоки для разных роботов не стоит смешивать без необходимости. Если на сайте нет особых требований, достаточно одной группы с User-agent: *. Директива Allow может быть полезна, когда нужно открыть вложенный файл внутри закрытого каталога:

User-agent: *
Disallow: /catalog/
Allow: /catalog/public.html

На практике обработка пересекающихся правил может отличаться у поисковых систем, поэтому лучше формулировать ограничения максимально точно. Не закрывайте CSS, JavaScript и изображения без веской причины: поисковику нужно видеть ресурсы, чтобы корректно оценить внешний вид и работу страницы.

Примеры для разных CMS

В CMS robots.txt может быть обычным статическим файлом или формироваться динамически. Перед изменением проверьте, какой вариант используется, чтобы ручная правка не была перезаписана обновлением или настройками плагина.

WordPress

Для небольшого сайта WordPress подойдет такой базовый вариант:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-includes/
Disallow: /?s=
Disallow: /search/
Sitemap: https://site.ru/sitemap_index.xml

Административная панель обычно не нужна в поиске, но файл admin-ajax.php может использоваться публичной частью сайта, поэтому его часто оставляют доступным. Адрес карты зависит от SEO-плагина: одни расширения создают sitemap_index.xml, другие используют sitemap.xml. Указывайте только реально существующий URL.

Bitrix

Для интернет-магазина на 1С-Битрикс часто закрывают служебные каталоги, корзину, сравнение товаров и персональные разделы:

User-agent: *
Disallow: /bitrix/
Disallow: /personal/
Disallow: /search/
Disallow: /compare/
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://site.ru/sitemap.xml

Пути зависят от структуры конкретного проекта. Нельзя переносить этот пример на сайт без проверки: каталог, раздел поиска или адрес оформления заказа могут называться иначе.

OpenCart

Для OpenCart обычно ограничивают технические страницы и параметры сортировки:

User-agent: *
Disallow: /admin/
Disallow: /catalog/view/
Disallow: /*route=account/
Disallow: /*sort=
Disallow: /*limit=
Sitemap: https://site.ru/sitemap.xml

В OpenCart параметры могут формировать разные URL в зависимости от версии и настроек ЧПУ. Перед добавлением масок соберите примеры адресов из логов сервера и Яндекс Вебмастера или Google Search Console.

Tilda и другие конструкторы

В конструкторах файл часто создается автоматически. В панели управления нужно найти настройки SEO, проверить доступность robots.txt и убедиться, что в нем нет запрета для всего сайта:

User-agent: *
Disallow: /
Sitemap: https://site.ru/sitemap.xml

Запись Disallow: / закрывает весь сайт и допустима только для тестового домена или временной разработки. После публикации проекта ее необходимо удалить.

Проверка и типичные ошибки

После публикации откройте robots.txt в браузере по адресу корня домена. Проверьте протокол, домен, наличие ответа со статусом 200 и корректное отображение обычного текста. Файл должен находиться именно в корне: robots.txt в папке /seo/ поисковые роботы не учитывают как общую инструкцию для домена.

Затем протестируйте важные URL в инструментах для вебмастеров. Проверьте главную страницу, разделы, карточки товаров, CSS и JavaScript, а также адреса, которые нужно исключить из обхода. Отдельно откройте ссылку из директивы Sitemap. Карта должна возвращать корректный XML без ошибки 404, редиректа на другой адрес или требования авторизации. Для создания и обновления карты можно использовать генератор sitemap, а затем добавить ее точный URL в robots.txt и панели поисковых систем.

Одна из самых опасных ошибок — случайное закрытие всего сайта правилом Disallow: /. Также часто блокируют разделы по слишком короткому фрагменту, например Disallow: /shop, из-за чего могут попасть под ограничение адреса /shop-info и /shopping. Если нужно закрыть каталог, используйте завершающий слеш: Disallow: /shop/.

Не пытайтесь закрыть через robots.txt страницы, которые уже находятся в индексе и должны исчезнуть из выдачи. Запрет обхода может, наоборот, помешать поисковику увидеть директиву noindex. Для таких URL сначала выберите подходящий метод удаления, а robots.txt применяйте для управления дальнейшим сканированием.

Следите за регистром символов, кодировкой UTF-8 и отсутствием лишних пробелов в путях. Правила для HTTP и HTTPS, а также для разных поддоменов могут отличаться: каждый хост требует собственного robots.txt. После изменений повторно проверьте доступность приоритетных страниц и обновите сведения о sitemap.xml в инструментах поисковых систем.

Хороший robots.txt не должен быть максимально большим. Его задача — ясно описать технические ограничения, не мешая роботам находить и обрабатывать полезный контент. Составляйте правила на основе структуры сайта, данных аналитики и логов, а не по шаблону из другого проекта.

Поделиться:
S

Редакция SEO-инструменты и генерация sitemap

Генератор sitemap и SEO-инструменты: инструкции

Читайте также