Ошибки в robots.txt, препятствующие индексации страниц
Как robots.txt влияет на обход и индексацию страниц
Файл robots.txt задаёт правила, по которым поисковые роботы обходят URL. Он должен находиться в корне сайта и быть доступен без авторизации по адресу /robots.txt. Директивы этого файла регулируют запросы робота, но сами по себе не удаляют страницы из поисковой базы и не гарантируют их включение в неё.
Ошибки в правилах могут закрыть раздел, нужную страницу или ресурсы, необходимые для её обработки. Проверку обычно начинают с конкретного URL и соответствующей ему группы User-agent: так проще определить, какая директива влияет на обход. Подробнее об ошибках, мешающих индексации, — в материале «Ошибки robots.txt, из-за которых страницы не индексируются в Google».
Разница между обходом URL и добавлением страницы в индекс
Обход — это запрос робота к адресу и чтение доступного содержимого. Индексация — обработка полученных данных и добавление страницы в поисковую базу. Страница может быть доступна для обхода, но не попасть в индекс из-за метатега robots со значением noindex, заголовка X-Robots-Tag, дублирующего содержимого или других сигналов.
Запрет Disallow останавливает обход указанного пути, но не равен запрету индексации. Если робот обнаружит закрытый URL по внешней или внутренней ссылке, он иногда добавляет сам адрес в индекс без содержимого страницы. Чтобы прочитать noindex и учесть его, роботу нужен доступ к странице.
Почему закрытый от обхода адрес иногда появляется в поиске
URL может быть найден через ссылку, карту сайта или ранее выполненный обход. При запрете robots.txt робот не получает содержимое и не может проверить метатег noindex, однако адрес может оставаться известным поисковой системе. Поэтому robots.txt не заменяет директивы управления индексацией.
Ошибки robots.txt, которые блокируют нужные страницы
Слишком широкие правила Disallow и неточные маски URL
Правило Disallow: /catalog/ закрывает для обхода пути, начинающиеся с /catalog/, а не одну отдельную страницу. Ошибка в слеше или маске может затронуть больше адресов, чем предполагалось. Например, запрет для корневого пути Disallow: / закрывает весь сайт от обхода роботом, к которому относится группа.
Директива Allow может разрешить более конкретный путь внутри запрещённого раздела. Роботы сопоставляют правила с URL по специфичности совпадающего пути; детали обработки могут различаться. Закрытие CSS- и JavaScript-файлов также способно помешать роботу увидеть оформление и поведение страницы, что затрудняет оценку её содержимого.
Ошибки в User-agent, синтаксисе и расположении файла
Группа User-agent определяет, к каким роботам применяются следующие за ней правила. Опечатка в имени может привести к тому, что правила не будут применяться к ожидаемому роботу. Общая группа с обозначением User-agent: * задаёт правила для роботов без отдельной подходящей группы.
Директивы записывают построчно, обычно в формате «название: значение». Комментарии начинаются с символа #. Файл рекомендуется сохранять в UTF-8; некорректная кодировка, лишние символы или неверное расположение могут помешать чтению правил. Robots.txt размещают в корне хоста: файл в подкаталоге не управляет путями всего сайта.
Как диагностировать запрет обхода
Проверка правил для конкретного URL
Для проверки сопоставляют полный путь страницы с группой нужного робота и всеми директивами Disallow и Allow. При этом учитывают регистр символов и структуру пути: /Page/ и /page/ могут обрабатываться как разные адреса. Тестирование показывает, разрешён ли обход конкретного URL, но не подтверждает, что страница попадёт в индекс.
Если запрета нет, проверяют доступность страницы для робота, метатег robots, заголовок X-Robots-Tag, канонический адрес и наличие ошибок сервера. Каноническая ссылка должна указывать на доступную страницу, а внутренние ссылки — вести на согласованную версию URL.
Анализ ответа сервера и журналов обхода
Запрос к robots.txt должен возвращать доступный файл; код ответа 200 указывает на успешную выдачу содержимого. Для страниц проверяют ответы сервера: например, 404 означает отсутствие ресурса, а 5xx — ошибку на стороне сервера. Журналы запросов показывают, обращался ли робот к файлу и URL, с каким ответом и в какое время.
Как исправить ограничения и проверить результат
Согласование robots.txt с noindex, каноническими адресами и картой сайта
Для исключения страницы из индекса используют noindex в метатеге или заголовке X-Robots-Tag, оставляя страницу доступной для обхода. Robots.txt применяют для регулирования запросов, а не как замену директивам индексации. Карта сайта должна содержать актуальные доступные URL, не закрытые от обхода. Канонические адреса, карта сайта и внутренние ссылки должны указывать на согласованные версии страниц.
Повторная проверка после изменения правил
После правки повторно проверяют спорные URL для нужных групп User-agent, включая страницы раздела и связанные CSS- и JavaScript-файлы. Затем проверяют доступность robots.txt и страницы, ответы сервера и новые записи в журналах обхода. Изменение файла не гарантирует немедленного повторного обхода: робот должен запросить обновлённые правила и обратиться к разрешённым адресам.


