Перевірка robots.txt: що закрито і не закрито зайве
robots.txt управляє обходом сайту: які розділи роботам дивитися, а які ні. Помилка в одному рядку здатна закрити сайт цілком — тому файл варто перевіряти після кожної зміни. Розібрати свій файл можна перевіркою robots.txt, а зібрати новий з нуля — генератором.
Що перевіряє інструмент
- Доступний чи файл за адресою
/robots.txtі віддається він кодом 200. - Немає чи синтаксичних помилок і друкарських помилок у директивах.
- Які розділи закриті і для яких роботів.
- Вказана чи карта сайту.
- Не закриті чи випадково потрібні сторінки і файли стилів зі скриптами.
Типові помилки
| Помилка | Наслідок |
|---|---|
Disallow: / для всіх роботів | Сайт повністю закритий від обходу — класика після переносу з тестового сервера |
| Закриті CSS і JS | Робот бачить сторінку інакше, ніж користувач, і гірше її оцінює |
| Спроба прибрати сторінку з індексу через robots.txt | Не працює: заборона обходу не дорівнює видаленню з індексу, для цього потрібен noindex |
| Немає посилання на карту сайту | Робот довше знаходить нові сторінки |
| Різні файли на www і без www | Поведінка залежить від того, який варіант обходять |
Директиви, на які не варто покладатися
Частина рядків, які зустрічаються в чужих файлах, сучасними роботами ігнорується або розуміється по-своєму: затримка обходу, вказівка основного дзеркала, нестандартні шаблони адрес. Google офіційно підтримує обмежений набір директив; все інше або не діє, або трактуються інакше різними пошуковими системами. Тому чим коротший і простіший файл, тим передбачуваніший результат.
Мінімальний робочий файл
Для більшості сайтів достатньо відкрити все, закрити службові розділи, кошик і результати внутрішнього пошуку, а потім вказати карту сайту. Все інше — за необхідності. Перевірте після змін, що потрібні сторінки залишилися доступними: чекером індексації і в Search Console.
Пов'язані перевірки
Одночасно варто подивитися карту сайту і різницю між noindex, nofollow і robots.txt — ці три речі плутають найчастіше.