Может ли Google действительно просмотреть ваш веб-сайт?
Небольшой технический файл robots.txt определяет, может ли Google просмотреть и отрендерить ваш сайт, и ошибка в нём может полностью остановить вашу видимость в поиске без вашего ведома.
Что это за файл
Каждый веб-сайт имеет, или должен иметь, файл с именем robots.txt. Вы найдёте его, введя после имени вашего домена /robots.txt, например uwbedrijf.nl/robots.txt. Этот файл — первое, что читает Google перед просмотром вашего сайта. Он написан простым текстом и указывает поисковым системам, какие части сайта они могут и не могут посещать.
Вы можете сравнить это с табличкой при входе в здание. Некоторые двери открыты, другие закрыты простой запиской. Проблема в том, что компании иногда случайно вешают неправильную записку. Вместо того чтобы закрыть одну чёрный ход, они закрывают всё здание для посетителей, включая самые важные помещения.
Помимо путей, которые можно или нельзя посещать, речь идёт о чём-то более тонком: о файлах, которые построены на странице. Подумайте о CSS, который отвечает за оформление, и JavaScript, который отвечает за движение и взаимодействие на странице. Если robots.txt блокирует эти файлы, Google может посетить страницу, но не может её хорошо просмотреть. Он видит тогда голую, повреждённую версию вашего сайта.
Это тесно связано с другой контрольной точкой: доступна ли ваша основная содержание и без JavaScript, как мы объясняем в основная содержание доступна без JavaScript. Обе точки касаются одного и того же вопроса: может ли Google видеть вашу страницу так, как её видит посетитель, или Google получает неполное представление, которое плохо оценивается.
Почему это больше чем техническая деталь
Google использует процесс, называемый рендерингом: поисковая система по сути воспроизводит вашу страницу точно так же, как это делает браузер, чтобы увидеть, что действительно видит посетитель. Это возможно только если Google может получить доступ ко всем компонентам, необходимым для этого. Если CSS или JavaScript заблокированы, Google видит голую страницу без оформления, без меню, иногда без текста, который загружается скриптами.
Результат в том, что Google неправильно оценивает, о чём ваша страница. Страница, которая выглядит отлично для посетителей, может показаться Google непонятной или пустой. Это не вопрос просто немного худшей оценки. Это вопрос о том, что она вообще не будет включена в результаты, хотя вы ничего не сделали неправильно с самой содержанием.
Есть разница между страницей, которая не существует, и страницей, которая существует, но сделана недоступной. Это также касается других пунктов в нашем контрольном списке, например того, правильно ли удалённая страница возвращает статус 404, как мы обсуждаем в страница 404 сама по себе полезна. В обоих случаях речь идёт о ясности: покажите Google, что предназначено быть найденным, а что нет.
Как вы сами можете проверить, всё ли в порядке
Введите имя вашего домена, за которым следует /robots.txt, в адресную строку браузера. Появится простой список правил, обычно со словами 'Disallow', за которыми следует путь. Disallow означает: этот путь не может быть посещён. Посмотрите, нет ли там чего-то неожиданного, например одной косой черты, что означает, что весь сайт закрыт.
Особо обратите внимание на правила, которые ссылаются на папки с названиями вроде /wp-content/, /assets/, /css/ или /js/. Это часто именно те папки, в которых находится оформление и взаимодействие вашего сайта. Если они заблокированы, то велика вероятность того, что Google не сможет правильно отрендерить ваши страницы, даже если остальная часть файла выглядит безвредно.
Google Search Console, бесплатный сервис Google для владельцев веб-сайтов, имеет тест, с помощью которого вы можете проверить конкретную страницу на проблемы с рендерингом. Там вы видите пример того, как Google воспринимает вашу страницу. Если это выглядит голо или повреждено, в то время как страница в вашем браузере выглядит хорошо, то это ясный сигнал того, что что-то идёт не так при загрузке CSS, JavaScript или изображений.
Если вы сомневаетесь, был ли определённый путь намеренно исключён или это произошло случайно, обсудите это с тем, кто создавал вашу сайт. Некоторые блокировки намеренны и разумны, например блокирование результатов внутреннего поиска — мы отдельно рассматриваем это на страницах результатов внутреннего поиска с noindex. Другие блокировки — это просто ошибки в параметрах по умолчанию, которые никто никогда не проверял.
Что это стоит, если это не в порядке
Если robots.txt блокирует важные пути, вы бессознательно закрываете части вашего сайта для Google. Это могут быть страницы продуктов, записи в блоге или даже весь сайт после миграции на новую систему. Это происходит чаще, чем думают люди, особенно после переделки веб-сайта, когда параметр, предназначенный для тестовой среды, случайно остаётся на реальном сайте.
Коварство в том, что вы ничего не замечаете в повседневном использовании сайта. Страницы загружаются просто так, посетители, которым дали прямую ссылку, всё ещё могут попасть на них. Только трафик из поисковых систем медленно снижается без явной причины. Многие предприниматели ищут причину в содержании или конкуренции, тогда как проблема находится в техническом файле, который они никогда не открывали.
Когда блокирован только CSS и JavaScript, эффект более тонкий, но не менее вредоносный. Ваши страницы остаются видимыми, но Google оценивает их по неполной картине. Текст, загруженный скриптом, может не учитываться. Страница, которая выглядит отлично для вас, оценивается Google как бедная контентом, со всеми последствиями для вашей позиции в результатах поиска.
Исправление обычно не занимает месяцы работы. Часто дело в том, чтобы изменить несколько строк в файле. Суть в том, что вы должны сначала распознать проблему. Без проверки блокировка иногда остаётся незамеченной годами просто потому, что никто не смотрел на неё после последней корректировки сайта.
Что нужно сделать, чтобы привести это в порядок
Принцип прост: robots.txt должен блокировать только пути, которые вы сознательно хотите исключить, например страницу входа администратора или корзину покупок, которая всё равно не должна появляться в результатах поиска. Всё, что способствует тому, как страница выглядит или работает, должно оставаться доступным. В этом вся суть этой контрольной точки: не закрывать по предосторожности, а целенаправленно перекрывать доступ там, где это необходимо.
Попросите проверить этот файл в рамках более широкого обзора того, что должно быть проиндексировано, а что нет. Этот обзор — матрица индексирования по типам страниц — показывает, какие страницы должны быть видны для Google, а какие сознательно нет, как мы объясняем в матрице индексирования по типам страниц. Robots.txt — это инструмент, с помощью которого эти решения реализуются, а не место, где они принимаются.
Проверяйте этот файл не только при создании сайта, но и после каждого крупного изменения: миграция на другую систему, новый конструктор веб-сайтов или реструктуризация сайта. Это именно те моменты, когда параметры случайно переносятся из тестовой среды. Краткая проверка впоследствии предотвращает превращение временного параметра в постоянный.
Также помните, что robots.txt не стоит отдельно. Он тесно связан с другими сигналами, которые вы даёте Google, такими как инструкция на уровне страницы через тег noindex, о чём больше в noindex через meta robots или X-Robots-Tag. Оба не должны противоречить друг другу. Страница, которую вы хотите показать, не должна открываться через один канал и одновременно блокироваться через другой.
Часто задаваемые вопросы
Могу ли я сам отредактировать robots.txt без конструктора веб-сайтов
Технически это простой текстовый файл, который вы можете открыть и отредактировать самостоятельно. На практике рекомендуется проявить осторожность: одна неправильная строка может закрыть весь ваш сайт для Google. Попросите проверить изменение у того, кто управляет вашим сайтом, или сначала протестируйте адаптацию с помощью инструмента в Google Search Console, прежде чем окончательно внедрять его.
Означает ли блокировка в robots.txt, что страница сразу же исчезнет из Google
Не сразу и не всегда полностью. Эффект часто нарастает постепенно, по мере того как Google чаще встречает блокировку. Иногда страница остаётся видимой без описания, потому что Google знает название, но не может посмотреть содержимое. В любом случае результат будет слабее, чем если бы страница была полностью доступна.
У меня нет файла robots.txt, это проблема
Без этого файла Google в принципе может заходить везде, поэтому в этом смысле прямой блокировки нет. Тем не менее рекомендуется его создать, хотя бы чтобы сознательно исключить несколько путей, например внутреннюю систему поиска. Это также согласуется с контрольной точкой 1.2, где мы рассказываем о точной конфигурации, как описано в контрольной точке 1.2.
Дальнейшее чтение
Как дела с вашим собственным веб-сайтом?
Две цифры, в течение минуты, бесплатно — и вам не нужно ничего оставлять.
Предпочитаете сразу получить полный отчёт? Расширенное сканирование — € 49 →
Хотите узнать, в чем причина?
Эта сканирование показывает вам статус. Отчет показывает вам причины и порядок, в котором их решать.
- По каждому выводу, что не так и что нужно сделатьБесплатное сканирование показывает вам статус. Отчет дает вам список — на обычном языке, в порядке серьезности, без необходимости понимать что-либо техническое.
- Все четыре помощника на базе AI вместо одногоБесплатный результат — это выборочная проверка у одного ассистента. Отчет задает восемь вопросов всем четырем, так что вы узнаете, связано ли это с одним ассистентом или со всеми.
- Какие компании упоминаютсяКто получает клиента, которого вы теряете? Эти имена указаны в отчете с указанием того, как часто они появляются там, где вас нет.
- Более глубокое измерение вашего веб-сайтаБесплатное сканирование проверяет десять страниц. Отчет доходит до пятидесяти, поэтому также до страниц, куда в итоге попадают ваши клиенты.