Robots.txt

Kasia Bielawska
>
Kasia Bielawska

Co to jest Robots.txt?

Robots.txt to publicznie dostępny plik tekstowy, który przekazuje robotom wyszukiwarek informacje o tym, jakie adresy w obrębie witryny mogą skanować. Najczęściej służy do ograniczenia odwiedzania nieistotnych podstron, duplikatów, wyników wyszukiwania wewnętrznego lub technicznych części serwisu.

Plik pomaga zarządzać ruchem generowanym przez crawlery, takie jak Googlebot. Nie jest jednak narzędziem do ochrony danych ani pewnym sposobem usuwania stron z wyników wyszukiwania.

Gdzie znajduje się plik robots.txt?

Plik powinien nazywać się dokładnie robots.txt i znajdować się w głównym katalogu witryny. Możesz go sprawdzić, dodając /robots.txt do adresu domeny, na przykład:

https://example.pl/robots.txt

Reguły obowiązują wyłącznie dla protokołu, hosta i portu, pod którymi udostępniono plik. Osobnego robots.txt może więc wymagać subdomena, na przykład sklep.example.pl. Plik powinien być zapisany jako zwykły tekst w kodowaniu UTF-8 i dostępny bez logowania.

Możliwość edycji pliku uzyskasz zwykle przez menedżer plików dostępny w ramach hostingu www, połączenie FTP lub panel systemu zarządzania treścią.

Jak działa robots.txt?

Przed rozpoczęciem skanowania robot może pobrać robots.txt i odczytać przypisane do niego reguły. Plik składa się z grup instrukcji. Najważniejsze z nich to:

  • User-agent – określa robota, którego dotyczą kolejne reguły. Gwiazdka oznacza wszystkie roboty respektujące plik.
  • Disallow – wskazuje ścieżkę, której robot nie powinien skanować.
  • Allow – zezwala na odwiedzanie wybranego zasobu znajdującego się wewnątrz zablokowanego katalogu.
  • Sitemap – podaje pełny adres mapy strony XML.

Wartości ścieżek są rozróżniane pod względem wielkości liter. Reguła dotycząca katalogu /Sklep/ nie musi więc obejmować adresu /sklep/.

Jak wygląda przykładowy plik robots.txt?

Prosty plik dla strony działającej na WordPressie może wyglądać następująco:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.pl/sitemap_index.xml

Taka konfiguracja ogranicza skanowanie panelu administracyjnego, ale pozwala robotom korzystać z pliku potrzebnego do obsługi części funkcji strony. Adres mapy XML ułatwia natomiast odnalezienie ważnych podstron.

Na stronach korzystających z hostingu WordPress zawartość robots.txt może być tworzona przez system lub wtyczkę SEO. Przed zmianą sprawdź więc, czy plik jest fizycznie zapisany na serwerze, czy generowany dynamicznie.

Czy robots.txt blokuje indeksowanie strony?

Nie zawsze. Dyrektywa Disallow blokuje przede wszystkim skanowanie adresu. Jeżeli odnośniki do zablokowanej strony znajdują się w innych miejscach internetu, wyszukiwarka może nadal odkryć jej adres i wyświetlić go w wynikach bez opisu.

Jeżeli strona nie powinna pojawiać się w Google, zastosuj odpowiednio skonfigurowany meta tag noindex, nagłówek HTTP albo zabezpieczenie hasłem. Robot musi mieć możliwość odwiedzenia strony, aby odczytać dyrektywę noindex. Jednoczesne dodanie Disallow może mu to uniemożliwić.

Jakie błędy w robots.txt występują najczęściej?

  • pozostawienie reguły Disallow: / po zakończeniu prac nad stroną,
  • blokowanie plików CSS lub JavaScript potrzebnych do prawidłowego odczytania witryny,
  • umieszczenie pliku w podkatalogu zamiast w katalogu głównym,
  • pomylenie wielkich i małych liter w ścieżkach,
  • traktowanie robots.txt jako zabezpieczenia poufnych plików,
  • użycie nieobsługiwanej przez Google dyrektywy Crawl-delay,
  • zablokowanie strony zawierającej dyrektywę noindex.

Po każdej zmianie otwórz adres pliku w przeglądarce i sprawdź raport robots.txt w Google Search Console. W kolejnych dniach warto także obserwować błędy indeksowania oraz monitoring strony, aby szybko zauważyć nieoczekiwane zmiany widoczności.

Czy za pomocą robots.txt można chronić dane?

Robots.txt nie jest zabezpieczeniem. Każdy może otworzyć plik i zobaczyć wpisane w nim ścieżki, a niektóre roboty mogą całkowicie ignorować jego instrukcje. Panel administracyjny, dokumenty lub dane klientów należy chronić za pomocą uwierzytelniania, odpowiednich uprawnień i konfiguracji serwera.

Chcesz poznać więcej szczegółów? Przeczytaj wpis na naszym blogu – znajdziesz w nim wszystko, co powinieneś wiedzieć o pliku robots.txt.

FAQ – plik robots.txt

Nie. Brak pliku oznacza zazwyczaj, że roboty mogą skanować wszystkie publicznie dostępne adresy. Robots.txt jest przydatny, gdy chcesz wprowadzić konkretne ograniczenia lub wskazać mapę strony.

Plik należy umieścić w katalogu głównym danego hosta, tak aby był dostępny pod adresem domena.pl/robots.txt. Plik umieszczony w zwykłym podkatalogu nie będzie obowiązywał całej witryny.

Nie. Disallow ogranicza skanowanie, ale sam adres może nadal znaleźć się w wynikach. Do blokowania indeksowania służy między innymi dyrektywa noindex, o ile robot może ją odczytać.

Można użyć reguł User-agent: * oraz Disallow: /. Należy zachować ostrożność, ponieważ taka konfiguracja może zablokować robotom dostęp do całej witryny.

Nie. Googlebot nie obsługuje dyrektywy Crawl-delay w robots.txt. Częstotliwością jego odwiedzin zarządzają algorytmy Google i ustawienia infrastruktury wyszukiwarki.

Otwórz plik w przeglądarce, sprawdź poprawność ścieżek i skorzystaj z raportu robots.txt dostępnego w Google Search Console.

The passwords may interest you!

SEO i SEM