Проверка robots.txt: что закрыто и не закрыто лишнее
robots.txt управляет обходом сайта: какие разделы роботам смотреть, а какие нет. Ошибка в одной строке способна закрыть сайт целиком — поэтому файл стоит проверять после каждого изменения. Разобрать свой файл можно проверкой robots.txt, а собрать новый с нуля — генератором.
Что проверяет инструмент
- Доступен ли файл по адресу
/robots.txtи отдаётся ли он кодом 200. - Нет ли синтаксических ошибок и опечаток в директивах.
- Какие разделы закрыты и для каких роботов.
- Указана ли карта сайта.
- Не закрыты ли случайно нужные страницы и файлы стилей со скриптами.
Типичные ошибки
| Ошибка | Последствие |
|---|---|
Disallow: / для всех роботов | Сайт полностью закрыт от обхода — классика после переноса с тестового сервера |
| Закрыты CSS и JS | Робот видит страницу иначе, чем пользователь, и хуже её оценивает |
| Попытка убрать страницу из индекса через robots.txt | Не работает: запрет обхода не равен удалению из индекса, для этого нужен noindex |
| Нет ссылки на карту сайта | Робот дольше находит новые страницы |
| Разные файлы на www и без www | Поведение зависит от того, какой вариант обходят |
Директивы, на которые не стоит полагаться
Часть строк, которые встречаются в чужих файлах, современными роботами игнорируется или понимается по-своему: задержка обхода, указание основного зеркала, нестандартные шаблоны адресов. Google официально поддерживает ограниченный набор директив; всё остальное либо не действует, либо трактуется иначе разными поисковыми системами. Поэтому чем короче и проще файл, тем предсказуемее результат.
Минимальный рабочий файл
Для большинства сайтов достаточно открыть всё, закрыть служебные разделы, корзину и результаты внутреннего поиска, а затем указать карту сайта. Всё остальное — по необходимости. Проверьте после изменений, что нужные страницы остались доступны: чекером индексации и в Search Console.
Связанные проверки
Одновременно стоит посмотреть карту сайта и разницу между noindex, nofollow и robots.txt — эти три вещи путают чаще всего.