Sprawdzanie robots.txt: co jest zablokowane i co niepotrzebne
robots.txt zarządza indeksowaniem strony: które sekcje roboty mogą przeglądać, a które nie. Błąd w jednej linii może całkowicie zablokować stronę — dlatego plik należy sprawdzać po każdej zmianie. Możesz przeanalizować swój plik za pomocą sprawdzania robots.txt, a stworzyć nowy od podstaw za pomocą generatora.
Co sprawdza narzędzie
- Czy plik jest dostępny pod adresem
/robots.txti zwraca kod 200. - Czy nie ma błędów składniowych i literówek w dyrektywach.
- Jakie sekcje są zablokowane i dla jakich robotów.
- Czy wskazana jest mapa strony.
- Czy przypadkowo nie są zablokowane potrzebne strony oraz pliki stylów ze skryptami.
Typowe błędy
| Błąd | Konsekwencja |
|---|---|
Disallow: / dla wszystkich robotów | Strona całkowicie zablokowana przed przeglądaniem — klasyka po przeniesieniu z serwera testowego |
| Zablokowane CSS i JS | Robot widzi stronę inaczej niż użytkownik i ocenia ją gorzej |
| Próba usunięcia strony z indeksu przez robots.txt | Nie działa: zakaz indeksowania nie oznacza usunięcia z indeksu, do tego potrzebny jest noindex |
| Brak linku do mapy strony | Robot dłużej znajduje nowe strony |
| Różne pliki na www i bez www | Zachowanie zależy od tego, która wersja jest przeglądana |
Dyrektywy, na które nie warto polegać
Niektóre linie, które pojawiają się w cudzych plikach, są ignorowane lub rozumiane na swój sposób przez nowoczesne roboty: opóźnienie przeglądania, wskazanie głównego lustra, niestandardowe wzory adresów. Google oficjalnie wspiera ograniczony zestaw dyrektyw; wszystko inne albo nie działa, albo jest interpretowane inaczej przez różne wyszukiwarki. Dlatego im krótszy i prostszy plik, tym bardziej przewidywalny wynik.
Minimalny działający plik
Dla większości stron wystarczy otworzyć wszystko, zablokować sekcje serwisowe, kosz oraz wyniki wewnętrznego wyszukiwania, a następnie wskazać mapę strony. Wszystko inne — w razie potrzeby. Sprawdź po zmianach, czy potrzebne strony pozostały dostępne: sprawdzaczem indeksacji i w Search Console.
Powiązane kontrole
Jednocześnie warto sprawdzić mapę strony oraz różnicę między noindex, nofollow a robots.txt — te trzy rzeczy najczęściej się mylą.