Проверить robots.txt онлайн

Введите адрес страницы: проверим директивы robots.txt и покажем результат. Полный SEO-диагноз страницы можно запустить кнопкой из результата.

Бесплатно и без регистрации. Проверяется одна страница и общие настройки домена.

Главная → Все проверки → Директивы robots.txt

Директивы robots.txt: что проверяется

robots.txt — текстовый файл в корне сайта: он говорит поисковым роботам, какие разделы обходить можно, а какие нет. Одна строка «Disallow: /» закрывает от обхода весь сайт.

Почему это важно

Одна забытая строка Disallow: / способна закрыть от робота целый сайт — так случается, когда файл переносят с тестового сервера на боевой и забывают вернуть открытый доступ. Заметить это сразу трудно. Сайт открывается в браузере как обычно, а трафик из поиска проседает лишь постепенно, когда старые страницы одна за другой выпадают из индекса. Само исправление сводится к одной строке в файле, а вот новое сканирование и возврат позиций в выдаче требуют куда больше терпения. Другая частая проблема мельче: в файле нет ссылки на sitemap, из-за чего робот дольше находит новые разделы, или осталась старая директива Host, которая просто путает того, кто открывает файл вручную. Правит обычно SEO-специалист вместе с разработчиком: один находит ошибку, второй меняет файл на сервере.

Шестерни, щит с замком и сервер: техническая основа сайта

Откуда взялись требования

Формат и действие robots.txt документированы обоими поисковиками. Запрет в нём блокирует сканирование, но убрать страницу из индекса им нельзя. Первоисточник ↗

Категория проверки: Техническая база. Вес в оценке: 7/10.

Какие результаты возможны

robots.txt на месте и эту страницу не закрывает

Файл открывается, обход этой страницы в нём не запрещён ни для Google, ни для Яндекса. По этой проверке менять нечего.

Нет robots.txt

Создайте текстовый файл robots.txt в корне сайта, чтобы он открывался по адресу вида вашсайт.ru/robots.txt. Минимум внутри — строка «User-agent: *». Служебные разделы (корзина, личный кабинет, страницы поиска) закрывают строкой «Disallow: /путь». Строку «Sitemap:» с полным адресом карты добавляйте только если карта уже лежит по этому адресу и открывается: объявленный адрес, который отвечает не кодом 200, поисковик засчитает как ошибку загрузки. Без файла robots.txt обход не запрещён.

В robots.txt есть строки не по спецификации

Спецификация Google требует ведущий слэш, а что робот сделает со строкой вроде «Disallow: *», она не говорит. Хотели закрыть весь сайт для этого робота, пишите «Disallow: /»; хотели закрыть раздел, укажите путь от корня. Строки перечислены ниже.

В robots.txt нет ссылки на карту сайта

Строка не привязана к блоку User-agent, место в файле любое. Так робот получит список страниц сразу, не собирая его по ссылкам.

Ни строки Sitemap в robots.txt, ни самой карты сайта

Дописать одну строку здесь нельзя. Объявленный адрес, который отвечает не кодом 200, поисковик засчитывает как ошибку загрузки карты, и в Яндекс Вебмастере это остаётся висеть проблемой: было чисто, стало с ошибкой. Порядок обратный: сгенерируйте карту движком сайта или плагином, положите по адресу, откройте его в браузере и убедитесь, что XML отдаётся, и только потом добавьте строку Sitemap. Google оговаривает: примерно до 500 страниц, на каждую из которых ведёт ссылка из меню или раздела, карта не обязательна.

В robots.txt нет ссылки на карту сайта

Строки Sitemap в robots.txt нет. Есть ли у сайта сам файл карты, проверка в этот раз выяснить не смогла. Сначала откройте предполагаемый адрес карты в браузере. Если отдаётся XML, добавьте в robots.txt строку «Sitemap:» с этим адресом, место в файле любое. Если не отдаётся, порядок обратный: сначала карта, потом строка. Объявлять адрес, который отвечает не кодом 200, нельзя, поисковик засчитает это как ошибку загрузки.

В robots.txt осталась устаревшая строка Host

Удалите из robots.txt строку, которая начинается со слова Host. Яндекс отменил её в 2018 году и не читает. Основной адрес сайта (с www или без) задают иначе: редирект 301 с лишнего адреса на основной плюс настройка в Яндекс Вебмастере.

Страница закрыта в robots.txt

Откройте robots.txt в корне сайта, найдите строку Disallow, под которую попадает этот адрес, и удалите её или сузьте путь до служебного раздела. Запрет мешает роботу прочитать страницу, но не убирает адрес из выдачи: он может показаться в результатах без описания. Чтобы страница исчезла из поиска, нужен тег noindex (запрет показывать страницу в поиске). Робот прочитает его только при разрешённом обходе. Сначала откройте обход, потом ставьте noindex.

Кто исправляет

Чинить обычно достаётся SEO-специалисту или разработчику.

Другие проверки категории «Техническая база»

Частые вопросы: директивы robots.txt

Может ли robots.txt убрать страницу из поиска?

Нет. Файл только просит робота не сканировать раздел, но уже проиндексированная страница может остаться в выдаче без содержимого — Google явно разделяет запрет сканирования и удаление из индекса. Чтобы убрать страницу из поиска, нужен тег noindex или закрытие паролем, а не запись в robots.txt.

Обязательно ли указывать sitemap в robots.txt?

Формально нет: сайт можно проверить и без этой строки, если карта сайта уже добавлена через панель вебмастера. Но ссылка в robots.txt — самый простой способ подсказать роботу, где искать список страниц, особенно если сайт крупный и часть разделов обновляется редко.

Что будет, если robots.txt вообще нет на сайте?

Ничего катастрофического: при отсутствии файла робот считает, что можно сканировать всё. Это не ошибка сама по себе, но и не лучший вариант: без явных правил в индекс могут попасть служебные страницы вроде корзины или админки, которые лучше скрыть от выдачи.

Проверить страницу целиком

Эта проверка — одна из 52. Полный анализ показывает оценку от 0 до 100, разбор по категориям и список того, что чинить первым.

Полный анализ страницы