Почему Google индексирует закрытые веб-страницы



Джон Мюллер из Google объяснил, почему Google индексирует блокированные страницы, а также почему отчеты Search Console, связанные с этим, можно безопасно не учитывать.

Джон Мюллер из Google ответил на вопрос о том, почему Google индексирует страницы, которые запрещены для выполнения обхода с помощью файла robots.txt, и почему можно игнорировать соответствующие отчеты Search Console об этих обходах.

Трафик ботов к URL-адресам с параметрами запроса

Человек, задающий вопрос, подтвердил, что боты создают ссылки на несуществующие URL-адреса с параметрами запросов (?q=xyz) на страницы с мета-тегами noindex, которые также закрыты в robots.txt. Вопрос был вызван тем, что Google сканирует эти ссылки на страницы, блокируется в robots.txt (не видя мета-тег noindex), а затем указывает об этом в Google Search Console как "Индексируется, хотя заблокировано robots.txt."

Человек поинтересовался следующий вопрос:

"Но вот главный вопрос: почему Google индексирует страницы, когда он не может ознакомиться с содержимое? В чем тут выгода?"

Джон Мюллер из Google подтвердил, что если они не могут проникнуть на страницу, они не могут увидеть мета-тег noindex. Он также упомянул оператор site:search, посоветовав пропускать результаты, потому что "средние" пользователи не видят их.

Он написал:

"Да, вы правы: если мы не можем просканировать страницу, мы не можем заметить noindex. Тем не менее, если мы не можем рикжаться страницы, для нас там мало что можно индексировать. Так что, хотя вы можете увидеть некоторые из этих страниц с помощью целевого запроса site:, средний пользователь их не увидит, поэтому я бы не переживал. Noindex также действует (без запрета в robots.txt), это просто означает, что URL-адреса будут сканироваться (и попадут в отчет Search Console как 'обойдены/не индексируются' — ни один из этих статусов не создает проблем для остальной части сайта). Важно, чтобы вы не делали их доступными для обхода и индексации."

Связанный: Google советует сайтам использовать файл robots.txt для блокировки URL-адресов действий.

Выводы:

1. Ответ Мюллера подтверждает пределы использования оператора Site:search для диагностических целей. Одной из причин является то, что он не ассоциирован с обычным поисковым индексом, это совсем отдельная вещь.

Джон Мюллер из Google прокомментировал оператор site search в 2021 году:

"Короткий ответ заключается в том, что запрос site: не предназначен для полноты, а также для диагностических целей.

Запрос site: — это определенный вид поиска, который ограничивает результаты заданным веб-сайтом. Это, по сути, просто слово "site", двоеточие и затем домен веб-сайта.

Этот запрос сужает результаты специфическим веб-сайтом. Он не предназначен для того, чтобы быть исчерпывающей подборкой всех страниц этого сайта."

Оператор site не отражает индекс поиска Google, что приводит к тому, что его ненадежным для осмысления того, какие страницы Google уже учел или нет. Как и другие операторы расширенного поиска Google, они ненадежны как инструменты для выяснения любых вопросов, связанных с тем, как Google распределяет или индексирует контент.

2. Мета-тег noindex без использования robots.txt подходит для таких ситуаций, когда бот создает ссылки на виртуальные страницы, которые выявляются Googlebot.

Мета-тег noindex на страницах, которые не запрещаются в robots.txt, дает возможность Google обойти страницу и прочитать директиву noindex, гарантируя, что страница не отобразится в поисковом индексе, что удобно, если цель состоит в том, чтобы не разрешить страницу в поисковый индекс Google.

3. URL-адреса с мета-тегом noindex породят в Search Console запись "обойдены/не индексируются", что не окажет негативного влияния на остальную часть веб-сайта.

Эти записи в Search Console, в контексте страниц, которые намеренно заблокированы, лишь указывают на то, что Google просканировал страницу, но не включил в индекс. По сути говоря, что это произошло, а не то, что (в этом данном контексте) есть что-то, что нужно исправить. Эта запись полезна для оповещения издателей о страницах, которые непреднамеренно заблокированы мета-тегом noindex или по какой-либо другой причине, не допускающей индексации страницы. Тогда это стоит выяснить.

Leave a Reply

Your email address will not be published. Required fields are marked *