Как настроить robots.txt: подробное руководство для сайта
Разбираем, зачем нужен robots.txt, как использовать директивы Allow и Disallow, закрывать служебные разделы и проверять файл на ошибки.

Как настроить robots.txt для сайта
Файл robots.txt помогает управлять доступом поисковых роботов к разделам сайта. С его помощью можно указать, какие страницы и каталоги разрешено сканировать, а какие не должны попадать в обход робота. Правильно настроенный файл снижает нагрузку на сервер, экономит краулинговый бюджет и помогает поисковым системам быстрее находить важные материалы.
При этом robots.txt не является инструментом абсолютного запрета индексации. Директивы файла служат рекомендациями для поисковых роботов. Если страницу нужно надежно исключить из поисковой выдачи, применяют метатег robots с параметром noindex, HTTP-заголовок X-Robots-Tag или закрывают доступ к ресурсу на уровне сервера. Поэтому настройку robots.txt важно рассматривать как часть общей технической SEO-оптимизации.
Что такое robots.txt и зачем он нужен
Robots.txt — обычный текстовый файл, который размещают в корневом каталоге домена. Он должен открываться по адресу вида https://example.ru/robots.txt. Для каждого протокола и поддомена действует собственный файл: robots.txt на www.example.ru не управляет сканированием страниц на example.ru, если это разные хосты с точки зрения поисковой системы.
Основная задача файла — задать правила для роботов. В нем можно закрыть от сканирования административную панель, страницы поиска по сайту, технические параметры URL, временные каталоги и другие области, которые не несут самостоятельной ценности для поиска. Одновременно файл должен оставлять открытыми CSS, JavaScript, изображения и важные страницы, если их загрузка нужна поисковику для корректного анализа сайта.
Минимальная структура robots.txt выглядит так:
User-agent: *
Disallow:
Sitemap: https://example.ru/sitemap.xmlДиректива User-agent определяет робота, для которого предназначены следующие правила. Символ * означает всех роботов. Пустая директива Disallow ничего не запрещает, поэтому такой файл фактически открывает сайт для сканирования. Строка Sitemap сообщает адрес XML-карты сайта. Ее можно добавить независимо от правил доступа. Если карта создана через генератор sitemap, укажите в robots.txt ее полный канонический URL.
Перед настройкой определите структуру сайта и цели индексации. Составьте список разделов, которые должны участвовать в поиске, а затем отдельно отметьте служебные URL. Не стоит закрывать весь сайт на время разработки и забывать снять запрет перед публикацией: правило Disallow: / полностью блокирует сканирование для выбранного робота.
Директивы allow и disallow: примеры
Директива Disallow запрещает роботу переходить по URL, соответствующим указанному пути. Например:
User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /tmp/В этом примере закрыты каталог административной панели, внутренний поиск и временные файлы. Начальный слеш означает путь от корня сайта. Запись Disallow: /catalog может затронуть URL, начинающиеся с этого фрагмента, поэтому для точного каталога обычно используют завершающий слеш: Disallow: /catalog/.
Чтобы закрыть отдельный файл, укажите его полный путь:
User-agent: *
Disallow: /private/instruction.pdfПустой путь после Disallow означает отсутствие запрета. Чтобы закрыть весь сайт, используют:
User-agent: *
Disallow: /Это правило допустимо для тестового домена, но опасно для работающего проекта. После запуска проверьте, что оно удалено или заменено более точными ограничениями.
Allow используется, чтобы явно разрешить доступ к пути, который пересекается с более общим запретом. Например, если весь каталог закрыт, но один файл нужно оставить доступным:
User-agent: *
Disallow: /files/
Allow: /files/public-guide.pdfНа практике поддержка пересекающихся правил зависит от поисковой системы и длины совпадающего пути. Поэтому не создавайте сложные комбинации без необходимости. Чем проще robots.txt, тем легче проверить его логику и тем меньше риск случайно закрыть важные страницы.
Популярный пример для интернет-магазина:
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /*?sort=
Disallow: /*?filter=
Allow: /assets/
Sitemap: https://example.ru/sitemap.xmlПараметры со звездочкой применяются поисковыми системами по-разному, поэтому после публикации их обязательно проверяют в инструментах для вебмастеров. Не закрывайте URL только потому, что он содержит вопросительный знак: некоторые параметры могут формировать полезные страницы, а запрет способен помешать роботу обнаружить внутренние ссылки.
Robots.txt не удаляет уже проиндексированные страницы. Если URL ранее был доступен поисковику, а затем его закрыли через Disallow, адрес может продолжить отображаться в результатах без содержимого или с устаревшими данными. Для удаления используйте noindex, код ответа 404 или 410, редирект либо другие подходящие методы. Также не следует размещать в robots.txt пароли, персональные данные и секретные адреса: файл общедоступен и не обеспечивает защиту информации.
Как проверить robots.txt на ошибки
Проверку начинают с открытия файла в браузере по адресу корня домена. Убедитесь, что сервер возвращает код ответа 200, файл называется именно robots.txt, а не robot.txt или robots.txt.html. Проверьте кодировку UTF-8, отсутствие лишних символов и корректное написание директив. Каждое правило размещают с новой строки, а комментарии начинают знаком #.
Затем составьте несколько тестовых URL: важную страницу, закрытый каталог, URL с параметрами, файл CSS или JavaScript и адрес XML-карты сайта. Для каждого адреса ответьте на вопрос, должен ли робот иметь доступ. Такая ручная проверка часто выявляет ошибки, которые незаметны при чтении файла целиком.
Используйте валидаторы robots.txt и инструменты поисковых систем. В панелях вебмастеров можно проверить, разрешен ли конкретный URL выбранному роботу, а также увидеть сообщения о синтаксических проблемах. После изменения правил очистите кэш CDN и серверный кэш, если они используются, затем повторите проверку. Поисковым системам может понадобиться время, чтобы загрузить новую версию файла.
Особое внимание уделите следующим ошибкам:
- полный запрет сайта через
Disallow: /на рабочем домене; - закрытие каталогов с важными страницами или ресурсами оформления;
- неверный адрес в строке
Sitemap; - попытка использовать robots.txt для защиты закрытых данных;
- противоречивые и избыточные правила для разных User-agent;
- блокировка страницы в robots.txt одновременно с ожиданием ее удаления из индекса.
После публикации отслеживайте статистику сканирования, ошибки обхода и изменения числа проиндексированных страниц. Robots.txt должен соответствовать реальной структуре сайта, поэтому его пересматривают после добавления новых разделов, фильтров и CMS-модулей. Карта сайта, созданная с помощью генератора sitemap, не заменяет robots.txt: sitemap сообщает поисковику о важных URL, а robots.txt регулирует доступ к путям. Вместе эти инструменты формируют понятную схему сканирования и помогают направить внимание роботов на действительно нужный контент.


