Wskazówka dla robota, a nie zamknięte drzwi

Wyobraź sobie tabliczkę kierującą dostawcę do właściwego wejścia w budynku. Pomaga ona osobie, która stosuje się do instrukcji, ale nie zamyka pozostałych drzwi. Podobnie działa robots.txt. Właściciel witryny publikuje zasady, a współpracujący robot uwzględnia je podczas odwiedzin. Plik zwykle znajduje się w głównym katalogu danego hosta, gdzie można go pobrać przed dalszym przeglądaniem stron. Jako właściciel firmy nie musisz samodzielnie pisać reguł, lecz warto rozumieć ich rolę. To ułatwia ocenę, czy wykonawca proponuje właściwe rozwiązanie i czy obiecany rezultat rzeczywiście odpowiada możliwościom takiej instrukcji.

Pobieranie strony różni się od jej indeksowania

Crawlowanie polega na odwiedzaniu adresów i pobieraniu ich zawartości. Indeksowanie oznacza włączenie informacji do zasobów, z których wyszukiwarka tworzy wyniki. Zablokowanie pobrania nie musi sprawić, że adres stanie się całkowicie nieznany. Robot może poznać go z odnośników umieszczonych gdzie indziej. Stąd sytuacje, w których zablokowany adres nadal pojawia się w wyszukiwaniu. Jeżeli chcesz wykluczyć publiczną stronę z wyników, potrzebna jest odpowiednia instrukcja dotycząca indeksowania. Jeżeli chcesz zachować poufność dokumentu, konieczna jest kontrola dostępu. To dwa odrębne cele, które należy jasno nazwać przed rozpoczęciem jakichkolwiek zmian technicznych.

Przykład z fikcyjnego sklepu

Załóżmy, że mały sklep z materiałami plastycznymi pozwala filtrować produkty według koloru, rodzaju i dostępności. Różne połączenia filtrów tworzą wiele adresów pokazujących bardzo podobne zestawy produktów. Właścicielce zależy na widoczności kart produktów, ale nie na niepotrzebnym pobieraniu każdej kombinacji. Osoba opiekująca się witryną najpierw sprawdza, które zestawienia mają własną wartość dla klientów i czy występuje rzeczywisty problem z ruchem robotów. Dopiero później rozważa ograniczenia. Zablokowanie całego katalogu sklepu byłoby złą odpowiedzią, ponieważ objęłoby także najważniejsze oferty. Reguła powinna wynikać z roli konkretnej grupy stron w działalności sklepu, a nie z wygody samego zapisu.

Co może zawierać plik

Reguły wskazują określone roboty albo ich grupy oraz ścieżki, których nie powinny pobierać. Obsługiwana składnia może również pozwalać na wyjątki. W pliku bywa umieszczony adres mapy witryny, czyli listy stron przydatnej podczas odkrywania zawartości. Lista adresów i zakaz pobierania wykonują jednak różne zadania. Żaden z tych elementów nie obiecuje konkretnej pozycji ani terminu pojawienia się w wynikach. Nie musisz uczyć się wszystkich technicznych zapisów. Poproś raczej o wyjaśnienie, jakie strony obejmuje każda reguła, dlaczego wymagały osobnego potraktowania i na jakich przykładach sprawdzono jej rzeczywisty zasięg.

Mała zmiana może objąć wiele adresów

Krótka reguła może dotyczyć całej dużej części witryny. Problem powstaje na przykład wtedy, gdy ustawienie przygotowane dla wersji testowej trafia na publiczną stronę albo obejmuje podobnie nazwane katalogi. Nieprzemyślane blokowanie plików potrzebnych do wyświetlania strony również może utrudnić jej odczytanie. Przed zmianą zachowaj poprzednią wersję i wskaż kilka ważnych adresów do kontroli. Uwzględnij stronę główną, główną usługę, produkt i wersje językowe. Nie kończ testu na pierwszym ekranie witryny. To, że strona główna działa, nie dowodzi jeszcze, że robot ma dostęp do całego katalogu usług lub do głębiej położonych podstron.

Poufne dokumenty wymagają innego zabezpieczenia

Oferta dla konkretnego klienta, lista pracowników i wewnętrzny dokument projektu nie powinny polegać na dobrowolnej współpracy robotów. Sam plik robots.txt jest publiczny, więc wymienienie w nim wrażliwej ścieżki może nawet ujawnić istnienie takiego miejsca. Z osobą odpowiedzialną za serwis omów logowanie, uprawnienia oraz sposób udostępniania plików. Nie zakładaj też, że długi, trudny do odgadnięcia adres wystarcza do zachowania poufności. Praktyczne pytanie brzmi: czy osoba bez odpowiednich uprawnień może bezpośrednio pobrać treść? Odpowiedź trzeba sprawdzić niezależnie od tego, czy dokument pojawia się w wyszukiwarce i czy prowadzą do niego widoczne odnośniki.

Krótka kontrola przed uruchomieniem witryny

Poproś o adres rzeczywiście opublikowanego pliku i proste uzasadnienie każdej blokady. Porównaj reguły ze stanem, jaki ma obowiązywać po uruchomieniu strony. Szczególnie dokładnie sprawdź ustawienia przenoszone z wersji roboczej, ponieważ mogły celowo wykluczać roboty. Następnie poproś o potwierdzenie dostępu do reprezentatywnych ważnych podstron. Zapisz, kto odpowiada za zmiany i jak przywrócić poprzednią konfigurację. Niektóre systemy tworzą plik automatycznie na podstawie ustawień, dlatego zmiana pobranej kopii niczego nie rozwiązuje. Kontrola musi obejmować faktyczny sposób publikacji, właściwe środowisko oraz osobę, która ma uprawnienia do wykonania potrzebnej poprawki.

Reguły powinny mieć aktualne uzasadnienie

Przy zmianie katalogu produktów, języków lub systemu rezerwacji wróć do wcześniejszych ograniczeń. Dawniej potrzebna blokada może teraz objąć treści istotne dla nowych klientów. Nie dopisuj reguł tylko dlatego, że narzędzie pokazało wiele podobnych adresów. Czasem lepszą odpowiedzią jest uporządkowanie nawigacji, wskazanie adresów kanonicznych lub zmiana działania filtrów. Techniczne SEO rozpatruje te zależności razem. Przy każdej ważniejszej regule zapisz jej cel, obszar działania i datę kontroli. Dzięki temu nowa osoba obsługująca stronę zrozumie decyzję. Bez takiej informacji konfiguracja łatwo zamienia się w zbiór wyjątków, których nikt nie potrafi już uzasadnić.

Częste pytania

Czy każdy robot przestrzega robots.txt?

Nie. Plik zawiera wskazówki dla robotów, które dobrowolnie je uwzględniają. Inne programy mogą je zignorować, a obsługa poszczególnych instrukcji bywa różna. Ochrona poufnych informacji i egzekwowanie dostępu wymagają więc odpowiednich mechanizmów poza tym plikiem.

Czy plik usunie stronę z Google natychmiast?

Nie należy na tym polegać. Najpierw ustal, czy treść ma pozostać publiczna, zniknąć tylko z wyników czy zostać całkowicie usunięta. Dopiero potem dobierz właściwe działanie i sprawdź jego skutek, zamiast traktować blokadę pobierania jako rozwiązanie każdego przypadku.

Czy mała witryna potrzebuje wielu reguł?

Niekoniecznie. Zacznij od sprawdzenia istniejących ustawień i konkretnego problemu, który chcesz rozwiązać. Rozbudowana konfiguracja bez wyraźnej potrzeby zwiększa pracę przy utrzymaniu. Kilka zrozumiałych zasad zwykle łatwiej kontrolować niż zestaw przypadkowych wpisów skopiowanych z obcych witryn.

Źródła i dalsza lektura