Theos Group

Jak łatwo można znaleźć Twoją firmę w Google i w AI? Bezpłatnie, od razu.

Wolisz od razu pełny raport? Rozszerzone skanowanie — € 49 →

Baza wiedzy

Czy Google rzeczywiście może przeglądać Twoją stronę internetową?

Mały plik techniczny robots.txt określa, czy Google może przeglądać i renderować witrynę, a błąd może zatrzymać całą Twoją wykrywalność bez zauważenia.

Czym dokładnie jest ten plik?

Każda strona internetowa ma lub powinna mieć plik o nazwie robots.txt. Możesz go znaleźć, wpisując /robots.txt po nazwie domeny, na przykład twojacompany.nl/robots.txt. Ten plik jest pierwszą rzeczą, którą Google czyta przed wyświetleniem witryny. Jest tam w zwykłym tekście i informuje wyszukiwarki, które części witryny mogą, a które nie mogą odwiedzać.

Możesz porównać go do znaku przy wejściu do budynku. Niektóre drzwi są otwarte, inne są zamknięte prostą notatką. Problem polega na tym, że firmy czasami przypadkowo podają niewłaściwą notatkę. Zamiast zamykać jedne tylne drzwi, zamykają cały budynek dla zwiedzających, w tym najważniejsze obszary.

Oprócz ścieżek, które mogą, ale nie muszą być odwiedzane, chodzi również o coś bardziej subtelnego: pliki, które tworzą stronę. Pomyśl o CSS, który zapewnia układ, i JavaScript, który zapewnia ruch i interakcję na stronie. Jeśli robots.txt zablokuje te pliki, Google może odwiedzić stronę, ale nie wyświetlić jej poprawnie. Następnie widzi nagą, zepsutą wersję Twojej witryny.

Jest to ściśle związane z innym punktem kontrolnym: czy treść podstawowa jest również dostępna bez JavaScript, jak wyjaśniamy, kiedy treść podstawowa jest dostępna bez JavaScript. Oba punkty dotyczą tego samego pytania: czy Google może zobaczyć Twoją stronę tak, jak widzi ją odwiedzający, czy Google otrzymuje niekompletny obraz, który ma słabe wyniki.

Dlaczego to coś więcej niż tylko szczegół techniczny

Google wykorzystuje proces zwany renderowaniem: wyszukiwarka faktycznie buduje Twoją stronę, tak jak robi to przeglądarka, aby zobaczyć, co naprawdę widzi odwiedzający. Jest to możliwe tylko wtedy, gdy Google ma dostęp do wszystkich niezbędnych do tego komponentów. Gdy CSS lub JavaScript są zablokowane, Google widzi gołą stronę bez układu, bez menu, czasami bez tekstu skryptowego.

W rezultacie Google błędnie ocenia, o czym jest Twoja strona. Strona, która wygląda dobrze dla odwiedzających, może wydawać się niezrozumiała lub pusta dla Google. To nie jest kwestia zdobywania punktów trochę gorzej. Chodzi o brak uwzględnienia, nawet jeśli nie zrobiłeś nic złego z samą treścią.

Istnieje różnica między stroną, która nie istnieje, a stroną, która istnieje, ale została uczyniona niedostępną. Dotyczy to również innych punktów na naszej liście pomiarowej, takich jak to, czy usunięta strona poprawnie zwraca status 404, co omawiamy z samą stroną 404, jest pomocne. W obu przypadkach chodzi o przejrzystość: pokaż Google, co jest, a czego nie ma być znalezione.

Jak sprawdzić, czy wszystko w porządku

Wpisz nazwę domeny, a następnie /robots.txt w pasku adresu przeglądarki. Pojawia się prosta lista reguł, zwykle ze słowami takimi jak „Zabronić”, po których następuje ścieżka. Zabronić oznacza: tej ścieżki nie można odwiedzić. Sprawdź, czy jest coś, czego się nie spodziewasz, na przykład sam ukośnik, co oznacza, że cała strona jest zamknięta.

Zwróć szczególną uwagę na reguły odnoszące się do katalogów o nazwach takich jak /wp-content/, /assets/, /css/ lub /js/. Często są to dokładnie foldery, które zawierają układ i interakcję Twojej witryny. Jeśli zostaną zablokowane, istnieje duża szansa, że Google nie będzie w stanie poprawnie renderować twoich stron, nawet jeśli reszta pliku wydaje się nieszkodliwa.

Google Search Console, bezpłatna usługa Google dla właścicieli witryn, ma test, który pozwala sprawdzić konkretną stronę pod kątem problemów z renderowaniem. Oto przykład tego, jak Google widzi Twoją stronę. Jeśli wygląda na nagie lub zepsute, podczas gdy strona w przeglądarce wygląda dobrze, jest to wyraźny znak, że coś jest nie tak podczas ładowania CSS, JavaScript lub obrazów.

Jeśli wątpi Pan/Pani, czy określona ścieżka została celowo wykluczona czy przypadkowo, skonsultuj się z osobą, która budowała Pana/Pani stronę internetową. Niektóre blokady są świadome i rozsądne, na przykład zamknięcie wewnętrznego wyniku wyszukiwania, co omawiamy osobno na stronach wewnętrznych wyników wyszukiwania na noindex. Inne blokady to po prostu błędy wynikające z ustawienia domyślnego, które nigdy nie zostało sprawdzone.

Ile to kosztuje, jeśli to nie jest w porządku

Jeśli robots.txt blokuje ważne ścieżki, bez Pana/Pani wiedzy zamykają się części Pana/Pani witryny dla Google. Mogą to być strony produktów, artykuły na blogu, a nawet cała witryna po przeprowadzce do nowego systemu. Dzieje się to częściej niż myślą ludzie, szczególnie po odświeżeniu witryny, gdy ustawienie przeznaczone dla środowiska testowego przypadkowo pozostaje na żywej witrynie.

Podstępne jest to, że nie zauważysz tego w codziennym używaniu witryny. Strony po prostu się ładują, odwiedzający, którzy otrzymają link bezpośrednio, nadal mogą się tam dostać. Tylko ruch ze wyszukiwarek powoli wysycha bez wyraźnego powodu. Wielu przedsiębiorców szuka przyczyny w zawartości lub konkurencji, podczas gdy problem kryje się w pliku technicznym, który nigdy nie otwarli.

Gdy zablokowany jest tylko CSS i JavaScript, efekt jest bardziej subtelny, ale nie mniej szkodliwy. Strony pozostają dostępne dla wyszukiwarek, ale Google ocenia je na podstawie niepełnego obrazu. Tekst ładowany przez skrypt może nie być liczony. Strona, która wygląda dla Ciebie świetnie, jest oceniana przez Google jako uboga w treść, ze wszystkimi konsekwencjami dla Twojej pozycji w wynikach wyszukiwania.

Naprawa zwykle nie jest kwestią miesiący pracy. Często chodzi o kilka linii do dostosowania w pliku. Chodzi o to, że najpierw musisz rozpoznać problem. Bez kontroli blokada czasami przez lata pozostaje niezauważona, po prostu dlatego, że nikt na nią nie patrzył po ostatniej aktualizacji witryny.

Co należy zrobić, aby to uporządkować

Punkt wyjścia jest prosty: robots.txt może blokować tylko ścieżki, które świadomie chcesz wykluczyć, takie jak strona logowania administratora lub koszyk, który nigdy nie powinien pojawiać się w wynikach wyszukiwania. Wszystko, co przyczynia się do wyglądu lub działania strony, musi pozostać dostępne. To cały sens tego punktu kontrolnego: nie zamykać z ostrożności, ale celowo zamykać tam, gdzie to konieczne.

Poproś o kontrolę tego pliku w ramach szerszego przeglądu tego, co powinno być indeksowane, a co nie. Ten przegląd, macierz indeksacji dla każdego typu strony, określa, które strony powinny być widoczne dla Google, a które świadomie nie, jak wyjaśniamy w macierzy indeksacji dla każdego typu strony. Robots.txt jest wówczas narzędziem, za pomocą którego te wybory są wykonywane, a nie miejscem, w którym te wybory są podejmowane.

Kontroluj ten plik nie tylko podczas budowy witryny, ale także po każdej dużej zmianie: przeprowadzce na inny system, nowej przeglądarce witryn lub restrukturyzacji witryny. To są dokładnie te momenty, gdy ustawienia są przypadkowo przejmowane ze środowiska testowego. Krótka kontrola po fakcie zapobiega temu, że tymczasowe ustawienie staje się permanentne.

Pamiętaj też, że robots.txt nie istnieje samodzielnie. Jest ściśle powiązany z innymi sygnałami, które wysyłasz Google, takimi jak instrukcja na poziomie strony za pomocą tagu noindex, o którym mówisz więcej przy noindex za pośrednictwem meta robots lub X-Robots-Tag. Oba nie powinny się sobie przeczyć. Strona, którą chcesz pokazać, nie powinna być otwarta przez jeden kanał i wciąż blokowana przez drugi.

Często zadawane pytania

Czy mogę sam zmienić robots.txt bez konstruktora witryn

Technicznie jest to prosty plik tekstowy i możesz go otworzyć i modyfikować sam. W praktyce ostrożność jest rozsądna: jedna błędna linia może zamknąć całą witrynę dla Google. Poproś o sprawdzenie zmiany kogoś, kto zarządza Twoją witryną, lub najpierw przetestuj zmianę za pomocą narzędzia w Google Search Console, zanim ostatecznie ją wdrożysz.

Czy blokada w robots.txt oznacza, że strona od razu znika z Google

Nie od razu, i nie zawsze w całości. Efekt zwykle buduje się stopniowo w miarę, jak Google napotyka blokadę coraz częściej. Czasami strona pozostaje jeszcze widoczna bez opisu, ponieważ Google zna tytuł, ale nie może przeglądać treści. Wynik w każdym przypadku jest słabszą pozycją niż wtedy, gdy strona była w pełni dostępna.

Nie mam pliku robots.txt, czy to problem

Bez tego pliku Google może w zasadzie wszędzie wejść, więc w tym sensie nie ma bezpośredniej blokady. Mimo to rozsądnie jest go mieć, chociażby po to, aby świadomie wykluczyć kilka ścieżek, takich jak wewnętrzny system wyszukiwania. To również harmonizuje z punktem kontrolnym 1.2, gdzie omawiamy dokładną jego konfigurację, jak można przeczytać w punkcie kontrolnym 1.2.

Dalsze lektury

Jak wygląda Twoja własna strona?

Dwie liczby, w ciągu minuty, bezpłatnie — i nie musisz niczego zostawiać.

Jak łatwo można znaleźć Twoją firmę w Google i w AI? Bezpłatnie, od razu.

Wolisz od razu pełny raport? Rozszerzone skanowanie — € 49 →

Chcesz wiedzieć, na czym to polega?

Ten skaner pokazuje Ci stan. Raport pokazuje Ci przyczyny i kolejność, w której je rozwiązujesz.

  • Dla każdego ustalenia co jest nie tak i co trzeba zrobićBezpłatny skaning daje Państwu status. Raport daje Państwu listę — w zwykłym języku, uporządkowaną według wagi, bez konieczności zrozumienia czegokolwiek technicznego.
  • Wszystkich czterech asystentów AI zamiast jednegoBezpłatny wynik to próba u jednego asystenta. Raport zadaje osiem pytań wszystkim czterem, abyś wiedział, czy chodzi o jednego asystenta, czy o wszystkich.
  • Które firmy rzeczywiście się pojawiająKto otrzyma klienta, którego Państwo tracą? Te nazwy znajdują się w raporcie, z informacją o tym, jak często pojawiają się tam, gdzie Państwo się nie pojawiacie.
  • Głębszy pomiar Państwa strony internetowejBezpłatny skaning sprawdza dziesięć stron. Raport przechodzi przez pięćdziesiąt, a więc także strony, gdzie ostatecznie trafiają Państwa klienci.