robots.txt
robots.txt to plik tekstowy umieszczany w katalogu głównym domeny (pod adresem domena.pl/robots.txt), który instruuje roboty wyszukiwarek, które części witryny mogą odwiedzać, a które powinny pominąć. Jest częścią tzw. Robots Exclusion Protocol — dobrowolnego standardu, którego przestrzegają renomowane roboty, takie jak Googlebot. To zwykle pierwszy plik, po który sięga robot przed rozpoczęciem skanowania serwisu.
Jak działa robots.txt?
Plik składa się z reguł przypisanych do konkretnych robotów. Najważniejsze dyrektywy to:
- User-agent — wskazuje, którego robota dotyczą kolejne reguły (gwiazdka oznacza wszystkie),
- Disallow — ścieżka, której robot nie powinien pobierać,
- Allow — wyjątek pozwalający na dostęp do zasobu w zablokowanym katalogu,
- Sitemap — adres mapy witryny XML.
Przykładowo reguła Disallow: /panel/ mówi robotom, by nie skanowały panelu administracyjnego. Kluczowe jest zrozumienie, że robots.txt steruje skanowaniem (crawlowaniem), a nie indeksowaniem — to dwie różne rzeczy.
Zastosowanie w praktyce
robots.txt służy głównie do oszczędzania budżetu indeksowania: blokuje się w nim zasoby bez wartości dla wyszukiwarki, np. wewnętrzne wyszukiwarki generujące nieskończenie wiele adresów, panele logowania czy pliki techniczne. Częstym i groźnym błędem jest jednak próba ukrycia strony przed Google przez samo Disallow — zablokowany adres nadal może trafić do wyników, jeśli prowadzą do niego linki. Do wykluczenia strony z indeksu służy meta tag robots z wartością noindex, a nie robots.txt. Przy wdrożeniu nowej witryny warto sprawdzić, czy plik przypadkiem nie blokuje całego serwisu regułą Disallow: /, co jest klasyczną przyczyną zniknięcia strony z Google.
Powiązane pojęcia
Najczęstsze pytania
Czy blokada w robots.txt usuwa stronę z Google?
Nie. robots.txt zniechęca robota do pobrania strony, ale zablokowany adres wciąż może pojawić się w wynikach, jeśli prowadzą do niego linki. Aby usunąć stronę z indeksu, użyj meta tagu noindex lub nagłówka X-Robots-Tag, nie blokując jej wcześniej w robots.txt.
Gdzie musi znajdować się plik robots.txt?
Zawsze w katalogu głównym domeny, pod adresem domena.pl/robots.txt. Roboty szukają go wyłącznie w tej lokalizacji — plik umieszczony w podkatalogu zostanie zignorowany. Każda subdomena wymaga własnego pliku.
