Hi-Tech

Лайфхак: как быстро найти дубли страниц

Но для начала давайте совсем быстро пробежимся по теории. Материал в первую очередь будет полезен как практикующим SEO-специалистам, так и владельцам сайтов.

Немного теории

Подробно останавливаться на данном вопросе не буду, так как тема популярная, и качественной информации в интернете, даже появившейся в последнее время, много. Наверняка многие слышали, что дубли страниц — это плохо. Отмечу только неприятности, которые могут появиться у сайта при наличии дублей:

  • проблемы с индексацией (особенно актуально для крупных сайтов);
  • размытие релевантности и ранжирование нецелевых страниц;
  • потеря естественных ссылок, которые могут появляться на страницах дублей;
  • общая пессимизация проекта и санкции поисковых систем.

Поэтому в процессе продвижения проектов этому вопросу должно уделяться особое внимание.

Также стоит вкратце остановится на двух разновидностях дублей:

  • Частичные дубли — когда страницы имеют общую семантику, решают одни и те же задачи пользователей и имеют похожий контент, но не являются полными дублями. Да, получилось достаточно запутанно, поэтому предлагаю рассмотреть пример: https://vc.ru/category/телеграм и https://vc.ru/category/telegram.

Обе страницы имеют общую семантику, похожий контент и решают одни и те же задачи пользователей, но при этом не являются полными дублями, так как содержимое страниц разное.

Далее в этой статье под дублями будут подразумеваться полные дубли. Выявить полные дубли намного проще, да и проблем они могут привести куда больше из-за своей массовости, а вот с неполными дублями нужно работать точечно и избавляться от них при формировании правильной структуры сайта.

Точка. Итак, мы определились, что проект не должен содержать дубли. И чтобы этого не случилось, а также для предотвращения других негативных последствий, их нужно выявлять и устранять. Особенно критично, когда дубли начинают индексироваться поисковыми системами. О том, как с ними бороться, можно найти много материалов, но если в комментариях будут просьбы рассказать подробнее, то я обязательно это сделаю в одной из следующих статей.

Чтобы никого не запутать, сейчас опустим момент с формированием нужных дублей (например, страниц с UTM-метками).

Выявление полных дублей

Обычно специалисты проверяют у продвигаемого проекта наличие следующих дублей:

Дубли страниц с разными протоколами: http и https. 1.

Выше уже был указан пример такого дубля: http://www.foxtrot.com.ua/ и https://www.foxtrot.com.ua/.

С www и без www. 2.

Например: http://oknadeshevo.ru/ и http://www.oknadeshevo.ru/.

Со слешем на конце URL и без него. 3.

1tv.ru/live и https://www. Например: https://www. 1tv.ru/live/.

Еще пример: https://www.lamoda.ru/p/wa007ewbhbj9/clothes-wallis-bryuki и https://www.lamoda.ru/p/wa007ewbhbj9/clothes-wallis-bryuki/.

При этом каждая страница содержит canonical на себя.

Строчные и прописные буквы во вложенностях URL. 4.

Например: https://www.mosokna.ru/info/osteklenie-detskikh-sadov/ и https://www.mosokna.ru/info/OSTEKLENIE-DETSKIKH-SADOV/.

При том, что страница https://www.mosokna.ru/PLASTIKOVYE-OKNA/ отдаёт 404-й код ответа сервера:

Это пример того, как на разных типах страниц один и тот же принцип формирования дублей обрабатывается по-разному.

Добавления в конце URL: 5.

index.php

home.php

index.html

home.html

index.htm

home.htm

Например: https://www.eldorado.ru/cat/378830466/ и https://www.eldorado.ru/cat/378830466/index.html/.

Как видно, оба URL проиндексированы в «Яндексе»:

А разве это все возможные дубли?

В своей практике я сталкивался с огромным количеством примеров формирования дублей, и самые популярные, которые встречались не единожды, я укажу ниже:

Множественное добавление ////////////////// в конце URL. 6.

Например, http://www.banki.ru/ и http://www.banki.ru////////.

Множественное добавление ////////////////// между вложенностями. 7.

Например, https://moskva.beeline.ru/customers/products/mobile/services/details/nomer-na-vybor/krasivie-nomera/ и https://moskva.beeline.ru/customers///////products///////mobile///////services///////details///////nomer-na-vybor///////krasivie-nomera/.

Ещё пример: https://f.ua/hewlett-packard/15-bs006ur-1zj72ea.html и https://f.ua/hewlett-packard///////15-bs006ur-1zj72ea.html.

Очень часто встречающаяся ошибка.

Добавление произвольных символов в конец URL, формируя новую вложенность. 8.

Например, https://apteka.ru/moskva/apteki/doktor-stoletov_16/ и https://apteka.ru/moskva/apteki/doktor-stoletov_16/Lfz/.

Добавление произвольных символов в существующую вложенность. 9.

Например, https://www.dochkisinochki.ru/brands/nutrilon/ и https://www.dochkisinochki.ru/brands/nutrilonbY5I/.

Добавление вложенности с произвольными символами. 10.

Например, https://www.utkonos.ru/news/item/1343 и https://www.utkonos.ru/news/wg/item/1343.

Не совсем дубль, но страница отдаёт 200-й код ответа сервера, что позволит ей попасть в индекс.

Добавление * в конце URL. 11.

Например, https://www.sportmaster.ru/product/10137329/ и https://www.sportmaster.ru/product/10137329/*/.

Ещё пример: https://docdoc.ru/clinic/set-evropeyskiy-medicinskiy-centr и https://docdoc.ru/clinic/set-evropeyskiy-medicinskiy-centr/*.

Замена нижнего подчеркивания на тире и наоборот. 12.

Например, https://mamsy.ru/filter/zhenshinam_tovary_bolshie_razmery/ и https://mamsy.ru/filter/zhenshinam-tovary-bolshie-razmery/.

Добавление произвольных цифр в конце URL, формируя новую вложенность. 13.

Например, https://apteka.ru/moskva/apteki/doktor-stoletov_16/ и https://apteka.ru/moskva/apteki/doktor-stoletov_16/2488/.

Такие дубли часто формируются со страниц публикаций на WordPress.

Замена вложенностей местами. 14.

Например https://www.toy.ru/catalog/producers/BARBIE-Mattel/ и https://www.toy.ru/producers/catalog/BARBIE-Mattel/.

Отсутствие внутренней вложенности. 15.

Например, https://www.toy.ru/catalog/producers/BARBIE-Mattel/ и https://www.toy.ru/producers/BARBIE-Mattel/.

Пункты 14 и 15 опять же не являются полными дублями, но аналогично пункту 10 отдают 200 код ответа сервера.

Копирование первой вложенности и добавление её в конец URL. 16.

Например, https://www.dochkisinochki.ru/brands/nutrilon/ и https://www.dochkisinochki.ru/brands/nutrilon/brands/.

Дубли .html, .htm или .php для страниц, которые заканчиваются на один из этих расширений. 17.

Например:

Хотите ли вы рисковать появлением такого огромного количества дублей? Все приведённые выше типы дублей были выявлены в индексе поисковых систем более чем у нескольких проектов. Поэтому и важно выявить те дубли, которые формируются и обезопасить себя от попадания их в индекс поисковых систем. Думаю, нет. А практика показывает, что рано или поздно они находят и индексируют такие страницы, хотя ни внутренних, ни внешних ссылок на данные страницы нет.

К тому же важно проверять каждый тип страниц на наличие дублей. Проверять вручную все эти дубли очень долго. Да потому, что страницы категории товаров и страница определённого товара могут иметь разные дубли. Почему? Пример уже был ранее рассмотрен.

Нормальная практика, когда, например, интернет-магазин на OpenCart подключает блог на WordPress. Также в большинстве сайтов могут использоваться разные CMS для разного типа контента. Соответственно и дубли страниц этих CMS будут кардинально отличаться.

В первую очередь сервис делали для своих нужд, ведь он экономит огромное количество времени специалистов, но с радостью готовы с ним поделиться. Поэтому мы и разработали сервис, который формирует все возможные страницы дублей и указывает их ответ сервера.

Как с ним работать и как читать его результаты — сейчас будем разбираться.

Онлайн-сервис поиска дублей страниц

Для начала перейдите по ссылке. 1.

Сервис поиска дублей URL

Подготовьте разные типы страниц сайта, у которого хотите выявить возможные дубли. 2.

Давайте рассмотрим на примере интернет-магазина http://www.foxtrot.com.ua/.

Рекомендуемые к анализу типы страниц и их примеры:

Для новостных и информационных ресурсов это могут быть:

Вбиваем данные страницы в форму ввода и нажимаем кнопку «Отправить запрос»: 3.

Запускается процесс обработки скрипта: 4.

Процесс обработки данных

Немного ожидаем и получаем результат его работы по всем внедрённым страницам:

Таблица с результатами

Анализируем результаты и подготавливаем рекомендации веб-программисту по устранению дублей. 5.

Например, из вышеуказанного примера можно сделать следующие выводы:

  • наличие дублей страниц с протоколами http и https;
  • редирект со страницы без www на www происходит с помощью 302 редиректа (временный редирект);
  • наличие дублей с добавление множественных слешей.

Соответственно, необходимо подготовить следующие рекомендации веб-разработчику:

Определиться, какой протокол всё же основной, и на страницы с этим протоколом настроить 301 редирект. 1.

Например, если основной протокол https, то страница http://www.foxtrot.com.ua/ должна перенаправлять с помощью 301-го редиректа на https://www.foxtrot.com.ua/.

Изменить 302 редирект на 301 при перенаправлении страниц без www на аналогичные с www. 2.

Настроить 301 редирект страниц со множественным добавлением слешей в конце URL на целевые страницы. 3.

Например, страница http://www.foxtrot.com.ua//////// должна с помощью 301 редиректа перенаправлять на http://www.foxtrot.com.ua/.

Поэтому не забывайте мониторить страницы, которые попадают в индекс поисковых систем. Важно понимать, что помимо шаблонных формирований дублей, указанных в данной статье, у вашего проекта могут формироваться уникальные дубли. Помогут в этом «Яндекс.Вебмастер» и Google Search Console.

Проиндексированные страницы в Google Search Console

Update

Так, выкатили обновление, позволяющее перед публикацией статьи определить изменения URL от исходного значения: Сервис будет дорабатываться и дополняться полезными функциями.

Функциональность отличия URL от исходного значения

Если материал вам был полезен, прошу оценить его стрелкой вверх.

До скорых встреч и берегите ваши проекты.

#инструменты #seo

Показать больше

Похожие статьи

Добавить комментарий

Ваш e-mail не будет опубликован. Обязательные поля помечены *

Кнопка «Наверх»
Закрыть