Nodea — logo

robots.txt

robots.txt to plik tekstowy umieszczany w katalogu głównym domeny (pod adresem domena.pl/robots.txt), który instruuje roboty wyszukiwarek, które części witryny mogą odwiedzać, a które powinny pominąć. Jest częścią tzw. Robots Exclusion Protocol — dobrowolnego standardu, którego przestrzegają renomowane roboty, takie jak Googlebot. To zwykle pierwszy plik, po który sięga robot przed rozpoczęciem skanowania serwisu.

Jak działa robots.txt?

Plik składa się z reguł przypisanych do konkretnych robotów. Najważniejsze dyrektywy to:

  • User-agent — wskazuje, którego robota dotyczą kolejne reguły (gwiazdka oznacza wszystkie),
  • Disallow — ścieżka, której robot nie powinien pobierać,
  • Allow — wyjątek pozwalający na dostęp do zasobu w zablokowanym katalogu,
  • Sitemap — adres mapy witryny XML.

Przykładowo reguła Disallow: /panel/ mówi robotom, by nie skanowały panelu administracyjnego. Kluczowe jest zrozumienie, że robots.txt steruje skanowaniem (crawlowaniem), a nie indeksowaniem — to dwie różne rzeczy.

Zastosowanie w praktyce

robots.txt służy głównie do oszczędzania budżetu indeksowania: blokuje się w nim zasoby bez wartości dla wyszukiwarki, np. wewnętrzne wyszukiwarki generujące nieskończenie wiele adresów, panele logowania czy pliki techniczne. Częstym i groźnym błędem jest jednak próba ukrycia strony przed Google przez samo Disallow — zablokowany adres nadal może trafić do wyników, jeśli prowadzą do niego linki. Do wykluczenia strony z indeksu służy meta tag robots z wartością noindex, a nie robots.txt. Przy wdrożeniu nowej witryny warto sprawdzić, czy plik przypadkiem nie blokuje całego serwisu regułą Disallow: /, co jest klasyczną przyczyną zniknięcia strony z Google.

Powiązane pojęcia

Najczęstsze pytania

Czy blokada w robots.txt usuwa stronę z Google?

Nie. robots.txt zniechęca robota do pobrania strony, ale zablokowany adres wciąż może pojawić się w wynikach, jeśli prowadzą do niego linki. Aby usunąć stronę z indeksu, użyj meta tagu noindex lub nagłówka X-Robots-Tag, nie blokując jej wcześniej w robots.txt.

Gdzie musi znajdować się plik robots.txt?

Zawsze w katalogu głównym domeny, pod adresem domena.pl/robots.txt. Roboty szukają go wyłącznie w tej lokalizacji — plik umieszczony w podkatalogu zostanie zignorowany. Każda subdomena wymaga własnego pliku.