Страницы вида /page/2/, /page/3/ и похожие часто путают с дублями, которые нужно срочно закрыть от индексации. На практике это не всегда так: в WordPress пагинация может быть нормальной частью структуры сайта, а неправильное вмешательство легко ломает обход страниц поисковыми роботами и ухудшает внутреннюю перелинковку.
Если коротко: удалять или закрывать пагинацию нужно не по факту её наличия, а по тому, как она работает на вашем сайте. Для одних проектов достаточно корректного canonical, для других уместен noindex, а robots.txt в этой задаче чаще вреден, чем полезен.
Когда страницы пагинации не нужно закрывать
Если пагинация ведёт на реальные списки записей, товаров, рубрик или архивов, поисковик должен иметь возможность их обходить. Это особенно важно, когда на второй и следующих страницах есть уникальные материалы, которые не попадают в первую выдачу списка.
Оставлять пагинацию открытой обычно разумно в таких случаях:
- на страницах архива есть отдельные записи, а не повтор одного и того же контента;
- пагинация помогает поисковому роботу добраться до глубоких URL;
- страницы списка не создают явных дублей основного текста, а отличаются набором карточек;
- у сайта нормальная внутренняя структура, и пагинация не плодит мусорные URL с одинаковыми параметрами.
Для обычного блога или каталога закрывать /page/2/ только потому, что это «вторая страница», — плохая идея. Поисковик может перестать видеть часть важных URL, особенно если они доступны только через архивы.
Когда дубли пагинации действительно стоит ограничить
Проблема возникает не из-за самой пагинации, а когда WordPress или тема создают несколько URL, ведущих к одному и тому же набору материалов. Тогда в индексе появляются страницы, которые отличаются только адресом, а не содержанием.
Типичные сценарии:
- один и тот же архив доступен с разными параметрами сортировки или фильтрации;
- страницы пагинации дублируются через HTTP и HTTPS, www и без www, со слешем и без него;
- тема генерирует отдельные URL для одной и той же выборки записей;
- на странице пагинации почти нет уникального контента, а в индекс попадают десятки пустых или слабых страниц.
В таких случаях нужно не «рубить» всё подряд, а выбрать правильный способ: canonical, noindex или, в редких случаях, ограничение через robots.txt.
Что выбрать: canonical, noindex или robots.txt
У этих способов разная задача, и подменять один другим не стоит. Ниже — практическое сравнение.
| Способ | Когда подходит | Что делает | Чего не делает |
|---|---|---|---|
canonical | Когда есть несколько URL с одинаковым или почти одинаковым содержанием | Подсказывает поисковику основную версию страницы | Не запрещает обход и не гарантирует исключение из индекса |
noindex | Когда страницу не нужно показывать в поиске, но её можно обходить | Просит не индексировать страницу | Не убирает URL мгновенно и не решает проблему дублей сам по себе |
robots.txt | Когда нужно ограничить обход технических разделов, а не бороться с дублями в индексе | Запрещает роботам сканировать URL | Не удаляет уже проиндексированные страницы и не заменяет noindex |
Для пагинации в WordPress чаще всего безопаснее всего оставить страницы доступными для обхода и при необходимости настроить корректный canonical. Если же конкретный тип страниц не должен попадать в поиск, тогда добавляют noindex, follow на уровне шаблона или SEO-плагина. robots.txt для таких задач используют только в исключительных случаях, потому что запрет на обход мешает поисковику увидеть директиву noindex, если она находится на самой странице.
Почему robots.txt — не лучший способ убрать дубли пагинации
Это частая ошибка: в robots.txt добавляют запрет на /page/ и ждут, что дубли исчезнут из поиска. На деле поисковик может продолжать хранить URL в индексе как известный адрес, просто без возможности нормально переобойти страницу и увидеть изменения.
Есть ещё один практический минус: если вы закроете пагинацию в robots.txt, робот может не дойти до части записей, которые доступны только через архивные страницы. Для контентных сайтов это риск потерять глубину обхода.
Поэтому robots.txt имеет смысл только тогда, когда вы точно понимаете, что закрываете технический мусор, а не рабочую навигацию. Для борьбы с дублями пагинации это обычно не первый выбор.
Как настроить canonical для пагинации в WordPress
Во многих темах и SEO-плагинах canonical уже генерируется автоматически. Это хорошо, если на странице пагинации указан сам URL текущей страницы как канонический, а не первая страница архива. Для обычной пагинации это нормальная схема: /category/, /category/page/2/, /category/page/3/ — разные страницы, и у каждой должен быть свой адрес.
Проверить это можно в исходном коде страницы или через инструменты для вебмастеров. На второй странице архива должен быть тег вида:
<link rel="canonical" href="https://example.com/category/page/2/" />Если вместо этого все страницы пагинации ссылаются canonical на первую страницу архива, поисковик может начать считать вторую и последующие страницы менее самостоятельными. Для некоторых типов архивов это допустимо, но для обычной пагинации списка записей чаще лучше оставлять каноническим именно текущий URL.
Если canonical ломается из-за темы или плагина, сначала проверьте, не переопределяет ли его SEO-плагин. У популярных решений для WordPress это часто настраивается без кода. Если же тема выводит неправильный canonical вручную, исправлять нужно именно шаблон, а не пытаться компенсировать проблему в robots.txt.
Когда уместен noindex
noindex нужен не для всех страниц пагинации подряд, а для тех, которые не несут самостоятельной ценности в поиске. Например, это может быть архив с очень тонким содержанием, страницы внутренней сортировки или результаты фильтров, которые создают почти бесконечное число комбинаций.
Для WordPress это обычно реализуют через SEO-плагин или через изменение мета-тега в шаблоне. Важный момент: если вы ставите noindex, не нужно одновременно закрывать эти страницы в robots.txt. Поисковик должен иметь возможность зайти на страницу и увидеть директиву noindex.
Проверка простая: откройте страницу пагинации и убедитесь, что в исходном коде есть мета-тег вида:
<meta name="robots" content="noindex,follow" />Если у вас стоит follow, поисковик может проходить по ссылкам на этой странице, но сам URL не должен попадать в индекс. Это полезно, когда страница нужна для навигации, но не нужна как посадочная из поиска.
Что делать, если дубли создаёт не сама пагинация, а параметры URL
На практике чаще всего проблема не в чистом /page/2/, а в сочетании пагинации с параметрами сортировки, фильтрации или трекинга. Например, одна и та же страница может открываться как с параметрами, так и без них, а поисковик воспринимает это как разные URL.
В такой ситуации сначала нужно понять, какой адрес должен быть основным. Обычно это чистый URL без лишних параметров. Дальше:
- для параметров, которые не должны индексироваться, используйте
noindexили настройку SEO-плагина; - для дублей с одинаковым содержанием оставляйте один канонический URL;
- не плодите редиректы на каждую комбинацию параметров без необходимости — это усложняет обход и поддержку.
Если дубли возникают из-за темы или плагина фильтров, иногда проще отключить генерацию индексируемых страниц для этих комбинаций, чем потом чистить уже накопленный мусор в индексе.
Как проверить, что вы не сломали SEO после изменений
После настройки не ограничивайтесь визуальной проверкой в браузере. Откройте несколько страниц пагинации и проверьте три вещи:
- страница открывается по нужному URL без лишних редиректов;
- в исходном коде есть корректный
canonical; - если вы ставили
noindex, он действительно присутствует на странице, а не только в настройках плагина.
Дополнительно проверьте, не закрыли ли вы в robots.txt то, что должно оставаться доступным для обхода. Для этого достаточно открыть файл /robots.txt и посмотреть, нет ли там слишком широких правил вроде запрета на весь каталог с архивами.
Если сайт уже был в индексе с дублями, изменения не сработают мгновенно. Поисковику нужно время на переобход. Это нормально: сначала он увидит новые сигналы, потом начнёт пересматривать старые URL.
Практический вывод для WordPress-сайта
Для обычной пагинации в WordPress не нужно автоматически ставить запрет на индексацию. Если страницы /page/2/ и дальше — это рабочая навигация по контенту, оставьте их доступными, проверьте корректный canonical и не мешайте поисковику обходить архивы.
noindex используйте тогда, когда конкретные страницы пагинации или архивы не должны участвовать в поиске. robots.txt оставьте для технических ограничений, а не для борьбы с дублями. Такой порядок обычно безопаснее и для SEO, и для поддержки сайта.