На небольших сайтах проблема обычно выглядит не как «катастрофа в индексе», а как набор слабых страниц: архивы тегов без смысла, страницы авторов без контента, результаты поиска, пагинация, служебные URL с параметрами. Они не всегда вредят сами по себе, но часто размывают краулинговый бюджет и мешают поисковику быстрее добираться до действительно полезных материалов.
Задача здесь не в том, чтобы закрыть от индексации всё подряд. Нормальный сценарий — оставить в индексе страницы, которые реально отвечают на запрос, а тонкие и дублирующие URL либо объединить, либо закрыть, либо пометить как noindex там, где это уместно.
Что именно считать тонкой страницей в WordPress
В WordPress под эту проблему чаще всего попадают не записи, а системные страницы и архивы. У них есть URL, они доступны роботу, но пользы для поиска в них мало или она дублируется с другими страницами.
Типичные кандидаты на чистку
- архивы тегов, если тегов много, а записей в них мало;
- страницы авторов на сайте с одним редактором;
- внутренний поиск вида
?s=...; - страницы пагинации архивов, если они не несут самостоятельной ценности;
- URL с параметрами сортировки, фильтров, UTM и технических хвостов;
- пустые или почти пустые рубрики, которые дублируют другие разделы;
- страницы вложений медиафайлов, если они не используются как отдельные посадочные.
Важно: не стоит автоматически закрывать все архивы. Если рубрика или тег реально собирают тематический кластер и дают трафик, их лучше доработать, а не прятать.
Диагностика: как понять, что проблема именно в индексации, а не в контенте
Сначала нужно отделить «тонкие» страницы от просто слабых по качеству материалов. Для этого смотрят не только на текст, но и на то, как URL ведут себя в поиске и в обходе роботом.
Что проверить в первую очередь
- отчёт по страницам в Google Search Console: какие URL исключены, какие продублированы, какие просканированы, но не проиндексированы;
- список URL с параметрами в логах или аналитике;
- архивы тегов, авторов и дат в карте сайта;
- наличие одинаковых title и meta description на разных URL;
- страницы вложений, которые индексируются вместо исходных записей;
- дубли из-за HTTP/HTTPS, www/non-www, слэша на конце и параметров.
Если у вас есть доступ к серверным логам, полезно посмотреть, какие URL робот посещает чаще всего. Иногда именно служебные страницы съедают заметную часть обхода, хотя в поиске они не нужны.
Пошаговое решение: что закрывать, что объединять, а что оставлять
Ниже — рабочая схема, которая подходит для большинства проектов на WordPress. Она не требует радикальных изменений и позволяет двигаться поэтапно.
Шаг 1. Уберите из индекса страницы поиска и служебные URL
Внутренний поиск почти никогда не должен индексироваться. То же касается страниц с параметрами сортировки, если они не являются самостоятельными посадочными. Для таких URL обычно достаточно noindex,follow или серверного запрета на генерацию индексации в SEO-плагине.
Если нужен кодовый вариант для поисковой страницы, можно добавить мета-тег через wp_head:
add_action('wp_head', function () {
if (is_search()) {
echo '<meta name="robots" content="noindex,follow">' . "\n";
}
});Это не заменяет SEO-настройки плагина, но помогает в проектах, где нужно быстро закрыть именно поиск.
Шаг 2. Закройте страницы вложений, если они не нужны как отдельные URL
Медиа-страницы часто индексируются отдельно от контента, хотя на них почти нет смысла. Если тема или плагин не используют их осознанно, лучше редиректить вложение на сам файл или на родительскую запись.
add_action('template_redirect', function () {
if (is_attachment()) {
$parent = wp_get_post_parent_id(get_the_ID());
if ($parent) {
wp_safe_redirect(get_permalink($parent), 301);
exit;
}
$file = wp_get_attachment_url(get_the_ID());
if ($file) {
wp_safe_redirect($file, 301);
exit;
}
}
});Такой подход полезен, если в индексе уже накопились десятки или сотни пустых attachment-страниц.
Шаг 3. Разберитесь с архивами тегов и авторов
Если на сайте один автор, архив автора почти всегда лишний. Теги тоже стоит проверять вручную: если тегов слишком много и каждый собирает одну-две записи, это не помогает навигации и часто создаёт дублирующий слой.
Варианта тут три:
| Подход | Когда уместен | Компромисс |
|---|---|---|
| noindex | архив не нужен в поиске, но полезен пользователю | страница остаётся доступной по ссылкам |
| редирект | архив пустой или дублирует другой раздел | нужно аккуратно выбрать целевой URL |
| доработка контента | архив имеет потенциал как посадочная | потребуется текст, описание и внутренняя перелинковка |
Если вы используете SEO-плагин, удобнее задавать noindex через его интерфейс. Кодом это имеет смысл делать только для точечных случаев, когда нужна своя логика.
Шаг 4. Приведите к одному виду канонические URL
Дубли часто возникают не из-за контента, а из-за разных вариантов одного и того же адреса. Проверьте, что сайт отдаёт один основной формат: с HTTPS, с нужным доменом, с единым правилом для слэша. Это базовая вещь, но именно она часто ломает картину индексации.
Если у вас есть страницы с параметрами, которые не должны создавать отдельные документы, используйте канонический URL на основную версию. В WordPress это можно задать через фильтр wpseo_canonical только если у вас установлен Yoast SEO, но для универсального решения лучше опираться на настройки SEO-плагина или серверные редиректы. Не стоит плодить самописную каноникал-логику без необходимости.
Когда лучше использовать плагин, а когда код
Для большинства сайтов удобнее решать вопрос через SEO-плагин: там есть управление noindex для архивов, медиа, авторов и таксономий. Код нужен, когда требуется точечная логика, например закрыть поиск, отдельный тип архивов или редиректить вложения.
Если нужен инструмент для чистки дублей, служебных страниц и технических хвостов, можно посмотреть в сторону Clearfy Pro: https://wpshop.ru/plugins/clearfy. Но даже с плагином всё равно нужно понимать, какие URL вы убираете и зачем.
Проверка результата после внедрения
После изменений не смотрите только на «страница закрыта» в админке. Нужна проверка на уровне реального ответа сервера и индексации.
Что проверить вручную
- откройте проблемный URL в браузере и посмотрите исходный код: есть ли
noindex; - проверьте статус ответа: 200, 301 или 404 должны соответствовать вашей логике;
- посмотрите, не остались ли URL в sitemap.xml;
- в Search Console отправьте на проверку несколько примеров;
- убедитесь, что внутренние ссылки не ведут массово на закрытые страницы;
- сравните количество исключённых и проиндексированных URL до и после изменений, но без ожидания мгновенного эффекта.
Для быстрой проверки на сервере удобно использовать curl:
curl -I https://example.com/?s=test
curl -I https://example.com/sample-attachment/
Если вы видите 200 OK там, где ожидали редирект или noindex, значит правило не сработало или его перехватывает тема/плагин.
Частые ошибки и как их исправить
Закрыли страницу в robots.txt вместо noindex
Это частая ошибка. Если URL уже в индексе, запрет в robots.txt не гарантирует удаление. Поисковик может продолжать хранить адрес без возможности переобхода. Для тонких страниц чаще нужен именно noindex или редирект.
Скрыли архив, но оставили на него десятки внутренних ссылок
Если страница закрыта, но на неё продолжают активно ссылаться меню, блоки и хлебные крошки, робот всё равно будет её регулярно находить. Сначала уберите или сократите ссылки, потом меняйте индексируемость.
Редиректите всё подряд на главную
Это плохая практика для вложений, тегов и архивов. Массовый редирект на главную создаёт нерелевантные переходы и мешает поисковику понять структуру сайта. Лучше отправлять на ближайший смысловой URL: родительскую запись, рубрику или страницу-замену.
Оставили в sitemap URL, которые закрыли от индексации
Такой конфликт сбивает сигналы. Если страница закрыта, она не должна оставаться в карте сайта. Иначе поисковик получает противоречивые указания.
Сделали noindex, но забыли про пагинацию
Пагинированные архивы часто остаются в индексе даже после закрытия первой страницы. Проверьте, как ведут себя /page/2/, /page/3/ и аналогичные URL. Иногда именно они создают основной шум.
Практические советы по безопасности и производительности
Чистка индексации не должна ломать сайт. Перед массовыми изменениями сделайте резервную копию базы и файлов, а на боевом сайте меняйте правила по одному блоку за раз. Это особенно важно, если у вас нестандартная тема или несколько SEO- и кеш-плагинов одновременно.
С точки зрения производительности полезно убрать генерацию лишних архивов и страниц, которые не используются. Но не отключайте таксономии или архивы только ради скорости, если они реально нужны пользователям. Сначала измерьте, какие URL дают трафик и внутренние переходы, потом принимайте решение.
Если на сайте много технических дублей, имеет смысл сначала навести порядок в структуре URL, а уже потом заниматься контентом. Иначе вы будете лечить симптомы, а не причину.
Короткий чек-лист перед публикацией изменений
- проверены Search Console и sitemap;
- определены страницы, которые должны остаться в индексе;
- для служебных URL выбран
noindexили редирект; - вложения и пустые архивы обработаны отдельно;
- внутренние ссылки не ведут на закрытые страницы;
- после правок проверены заголовки ответа и исходный код;
- карта сайта обновлена и не содержит лишних URL.
Если после внедрения вы видите, что поисковик перестал тратить время на мусорные URL, а в отчётах стало меньше исключённых дублей и служебных страниц, значит логика настроена правильно. Дальше уже можно точечно дорабатывать отдельные архивы и слабые посадочные, а не бороться с хаосом на уровне всего сайта.