Мусорные страницы: как GET-параметры раздувают индекс и топят сайт

Владелец сайта открывает Яндекс.Вебмастер и видит цифру, которая не сходится ни с какой логикой: страниц на сайте — 240, а в поиске участвует 18 700. Первая реакция — радость: «сайт растёт». Вторая, через месяц, когда позиции по основным запросам просели, — паника. На самом деле произошло вот что: робот утонул в мусоре. Тысячи адресов вида ?sort=price, ?utm_source=telegram, ?page=2&filter=1&filter=3 — это те же самые 240 страниц, показанные роботу под разными именами. И каждый такой адрес отъедает часть лимита, который поисковик выделил на ваш сайт.
Мусорные страницы — одна из самых недооценённых технических проблем в русскоязычном SEO. Она не выглядит как катастрофа: сайт работает, страницы открываются, ошибок в консоли нет. Но именно она объясняет, почему новая категория не попадает в индекс третий месяц, почему обновлённые тексты робот не переобходит и почему в выдаче по бренду вылезает страница с сортировкой по убыванию цены вместо главной. Разберём проблему целиком: откуда берётся мусор, как измерить его объём и как вычистить индекс — с конкретными настройками для Яндекса.
Что такое мусорные страницы и откуда они берутся
Мусорная страница — любой URL, который отдаёт содержимое, уже доступное по другому адресу, и при этом не несёт самостоятельной ценности для поиска. Ключевое слово здесь — «самостоятельной». Страница второй сортировки каталога полезна человеку, который хочет посмотреть товары от дешёвых к дорогим. Но для поиска она бесполезна: пользователь из выдачи должен попадать на нормальную категорию, а не на её произвольный срез.
Источников мусора немного, и они одинаковы почти на всех сайтах:
- Параметры сортировки и отображения.
?sort=,?order=,?view=list,?per_page=48. Плодятся комбинаторно: три сортировки × два вида отображения × три размера страницы = 18 копий одной категории. - Фильтры каталога. Самый опасный источник. Умный фильтр на 12 параметров создаёт миллионы теоретических URL, и робот с удовольствием обходит их все, если ему не сказать «не надо».
- UTM-метки и рекламные параметры.
utm_source,utm_medium,yclid,gclid,ysclid,etext. Попадают в индекс, когда кто-то поставил ссылку с меткой у себя на сайте или в соцсетях. - Параметры сессий и корзины.
PHPSESSID,?add_to_cart=,?compare=— устаревшая, но всё ещё встречающаяся история на самописных движках. - Пагинация без канонизации. Страницы 2, 3, 4… с одинаковыми title и description.
- Служебные и технические адреса. Печатные версии
?print=Y, AJAX-эндпоинты, отдающие HTML, версии для слабовидящих.
Отдельно стоит упомянуть параметр etext — «хвост», который Яндекс сам добавляет к ссылкам из своей выдачи и из некоторых своих сервисов. Владельцы сайтов регулярно получают письма из Вебмастера с темой «Найдены страницы-дубли с GET-параметрами» именно из-за него. Это не ошибка сайта в привычном смысле, но реагировать на неё нужно — иначе Яндекс будет считать дубли реальной проблемой.
Чем именно вредят мусорные страницы
Вред здесь не абстрактный «поисковик не любит дубли», а вполне измеримый, и он идёт по трём направлениям.
Первое — краулинговый бюджет. Робот приходит на сайт с ограниченным числом обращений за визит. Если из 500 обращений 430 уходят на сортировки и фильтры, до новых товаров и обновлённых текстов очередь дойдёт нескоро. Подробно механика лимитов разобрана в материале о том, почему Яндекс не индексирует ваши страницы — здесь важно понимать, что мусор ест этот ресурс напрямую.
Второе — размывание релевантности. Когда десять URL содержат один текст, поисковику приходится выбирать, какой из них показывать. Выбор не всегда падает на правильный. Классическая картина: по запросу «купить диван недорого» в выдаче стоит /divany/?sort=price_asc вместо /divany/. Страница со странным адресом и обрезанным title собирает меньше кликов, а внешние ссылки, которые вели на нормальную категорию, работают на другой адрес. Это частный случай того, что называют каннибализацией запросов.
Третье — общая оценка качества сайта. Яндекс давно оценивает не только отдельные страницы, но и сайт целиком. Ресурс, где 90% индекса — низкокачественные технические копии, получает худшую оценку по всем документам. Это та же логика, по которой работает наказание за тонкий контент: массив бесполезных страниц тянет вниз даже хорошие.
Как измерить масштаб проблемы за 15 минут
Прежде чем чистить, нужно понять объём. Три источника данных, каждый показывает свой срез.
Яндекс.Вебмастер
Раздел «Индексирование» → «Страницы в поиске». Смотрим общее число и сравниваем с реальным количеством страниц на сайте. Дальше — «Статистика обхода»: там видно, какие именно URL робот скачивал за последние дни, и мусор бросается в глаза сразу. Отдельно проверяем «Диагностика» → там же появляется уведомление о дублях с GET-параметрами и, что важнее, раздел «Незначащие GET-параметры», где Яндекс сам предлагает список подозрительных параметров. Полный разбор интерфейса — в гайде по Яндекс Вебмастеру.
Поисковые операторы
Быстрая грубая оценка прямо в выдаче. Вбиваем site:вашсайт.ru и смотрим число. Затем site:вашсайт.ru inurl:? — сколько из них с параметрами. Метод неточный, Яндекс округляет, но порядок величины показывает.
Логи сервера
Самый честный источник: он показывает, куда робот реально ходил, а не что попало в индекс. Выгружаем access.log за неделю, фильтруем по user-agent Яндекса и считаем распределение по URL. Обычно результат обескураживает: на топ-20 «мусорных» шаблонов приходится больше половины всех визитов робота. Методика разобрана в материале про анализ логов сервера.
Инструменты чистки: что чем закрывать
Главная ошибка при чистке — использовать один инструмент для всех случаев. У каждого своя зона ответственности, и подмена одного другим даёт либо неполный эффект, либо новые проблемы.
| Инструмент | Что делает | Когда применять | Чего НЕ делает |
|---|---|---|---|
| Clean-param в robots.txt | Говорит Яндексу: этот параметр не меняет содержимое, склей адреса | UTM-метки, yclid, etext, ysclid, сессии, сортировки | Не работает в Google; не убирает страницу из индекса мгновенно |
| rel=canonical | Указывает основную версию страницы; вес передаётся на неё | Пагинация, фильтры с полезным содержимым, печатные версии | Это рекомендация, а не приказ — поисковик может проигнорировать |
| Disallow в robots.txt | Запрещает обход раздела или шаблона URL | Служебные разделы, корзина, личный кабинет, поиск по сайту | Не гарантирует удаления из индекса; блокирует передачу веса |
| meta noindex | Разрешает обход, но запрещает показ в поиске | Малоценные, но нужные людям страницы; пустые результаты фильтра | Не экономит краулинговый бюджет — робот всё равно заходит |
| 301-редирект | Жёстко склеивает адреса, передаёт вес | Слэш/без слэша, upper/lower case, index.php, www | Не подходит для параметров, нужных пользователю прямо сейчас |
| Удаление страницы в Вебмастере | Ускоряет исключение конкретного URL из индекса | Точечно, когда мусор уже попал в поиск и мешает | Не решает причину — без правок вернётся |
Clean-param: главный инструмент для Яндекса
Директива, которую большинство сайтов не использует вообще, хотя она решает проблему точнее всех остальных. Синтаксис:
User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign&utm_term&utm_content
Clean-param: yclid&gclid&ysclid&etext&from
Clean-param: sort&order&view /catalog/
Первый блок убирает рекламные метки по всему сайту. Второй — «хвосты» Яндекса и Google. Третий показывает важную возможность: параметры можно ограничить конкретным разделом, добавив путь после списка.
Принципиальное отличие Clean-param от Disallow: при запрете через Disallow робот просто не ходит на адрес, и весь накопленный вес такого URL пропадает. При Clean-param робот понимает, что это тот же документ, и переносит все сигналы на чистый адрес. Для страниц, на которые ведут внешние ссылки с метками, разница принципиальна.
Важная деталь: Clean-param работает только для Яндекса. Если сайт продвигается и в Google, для него ту же задачу решают canonical и настройка параметров в Search Console. Что из этого важнее для вашего проекта — вопрос распределения аудитории, он разобран в сравнении Яндекса и Google.
Canonical: где помогает, а где вредит
Канонический адрес — рекомендация поисковику считать основной другую страницу. Работает хорошо, когда страницы действительно почти идентичны. Плохо — когда содержимое отличается существенно: поисковик проигнорирует указание, а вы будете думать, что проблема решена.
Типичные ошибки с canonical, которые встречаются в каждом втором аудите:
- Канонический адрес указывает сам на себя на всех страницах, включая мусорные. Формально всё правильно, фактически бесполезно — страница с сортировкой объявляет каноничной саму себя.
- Все страницы пагинации канонизируются на первую. Спорная практика: товары со страниц 2+ могут выпасть из индекса. Правильнее оставить самоканонизацию плюс настроить перелинковку.
- Canonical ведёт на страницу, закрытую в robots.txt. Робот не может её прочитать, указание игнорируется.
- Canonical ведёт на 404 или редирект. Сигнал теряется полностью.
Подробный разбор всех сценариев — в отдельном материале о канонических URL.
Отдельный разговор: фильтры каталога
Фильтры — источник, где мусор и ценность перемешаны, и потому чистить их сложнее всего. Часть комбинаций фильтра — это готовые посадочные страницы под реальный спрос. «Диваны угловые» ищут 4 000 раз в месяц, «диваны угловые бежевые с ящиком для белья длиной 240 см» — ноль раз, но такой URL фильтр сгенерирует.
Рабочий подход выглядит так:
| Тип комбинации | Есть ли спрос | Решение |
|---|---|---|
| Один популярный параметр («угловые», «кожаные») | Да, сотни–тысячи показов | Открыть, дать ЧПУ-адрес, свои title/H1/текст |
| Два совместимых параметра («угловые кожаные») | Иногда, десятки–сотни | Открывать выборочно по данным Вордстата |
| Три и более параметров | Практически нет | Закрыть от индексации |
| Диапазоны цен, ползунки | Нет | Закрыть всегда |
| Пустая выдача фильтра | Нет | noindex + корректный ответ сервера |
Такая структура одновременно решает две задачи: убирает мусор и создаёт десятки посадочных под низкочастотный спрос, которые часто дают больше суммарного трафика, чем главные категории. Механика подробно разобрана в статьях про пагинацию и фильтры в интернет-магазине и про НЧ-запросы и длинный хвост. Если каталог большой и разбирать его вручную нереально, имеет смысл посмотреть в сторону programmatic SEO — но с осторожностью, чтобы не заменить один вид мусора другим.
Пошаговый план чистки
Порядок здесь важен: если начать с массового закрытия, можно случайно выкинуть страницы, которые приносили трафик.
- Выгрузите список всех проиндексированных URL. Вебмастер → «Страницы в поиске» → скачать архив. Это отправная точка, к которой вы будете возвращаться для контроля.
- Сопоставьте с данными по трафику. Выгрузите из Метрики страницы входа из поиска за последние полгода. Любой URL с параметрами, который приносил визиты, требует отдельного решения — возможно, это не мусор, а нужная людям страница.
- Сгруппируйте мусор по шаблонам. Не по отдельным адресам, а по типам: все с
?sort=, все сutm_, все с тремя и более фильтрами. Обычно получается 10–20 групп. - Назначьте каждой группе инструмент по таблице выше.
- Внесите правки. robots.txt — Clean-param и Disallow, шаблоны — canonical и noindex, сервер — редиректы.
- Проверьте, что не закрыли лишнего. Инструмент «Анализ robots.txt» в Вебмастере: прогоните через него 30–50 важных URL и убедитесь, что они разрешены.
- Отправьте ключевые страницы на переобход и дождитесь обновления. Ускорить помогает IndexNow.
- Контролируйте динамику месяц. Число страниц в поиске должно снижаться, число обходов важных страниц — расти.
Чего ожидать по срокам и результату
Чистка индекса — не тот случай, когда результат виден назавтра. Робот переобходит сайт постепенно, и исключение мусора растягивается на недели.
| Срок после правок | Что происходит | Что смотреть |
|---|---|---|
| 1–3 дня | Робот считывает новый robots.txt, начинает учитывать Clean-param | Статистика обхода: доля мусорных URL падает |
| 1–2 недели | Мусор начинает выпадать из индекса пачками | «Страницы в поиске»: общее число снижается |
| 3–6 недель | Освободившийся бюджет уходит на нормальные страницы | Растёт число обходов важных разделов, ускоряется индексация нового |
| 2–3 месяца | Стабилизация; позиции по основным запросам подтягиваются | Позиции, трафик из органики, доля страниц с показами |
Отдельно предупрежу о нормальной реакции, которая пугает владельцев: в первые недели график «страниц в поиске» падает вниз резко, иногда в разы. Это ожидаемо — уходит мусор. Одновременно с этим количество страниц, которые реально получают показы, должно расти или как минимум не меняться. Именно вторая метрика важна, а не первая.
Частые ошибки при чистке
- Закрыть всё, что с вопросительным знаком. Под раздачу попадают полезные страницы фильтров, которые приносили НЧ-трафик. Всегда сверяйтесь с Метрикой перед закрытием.
- Использовать Disallow вместо Clean-param для меток. Ссылки с UTM, поставленные партнёрами, теряют вес полностью.
- Ставить noindex и Disallow одновременно. Робот не может прочитать noindex на закрытой странице — она может висеть в индексе годами.
- Забыть про sitemap.xml. Если мусорные адреса попали в карту сайта, вы сами приглашаете робота их обходить. Настройка разобрана в материале про robots.txt и sitemap.xml.
- Не проверить внутренние ссылки. Бесполезно закрывать сортировки, если на них ведут ссылки из меню и с каждой карточки товара — робот будет находить их снова. Проверьте внутреннюю перелинковку.
- Сделать один раз и забыть. Новый модуль, новая рекламная кампания, новый фильтр — и мусор возвращается. Проверка индекса должна быть в регулярном чек-листе.
Как не создавать мусор заново
Чистка — лечение симптома. Чтобы проблема не возвращалась, нужны правила на уровне разработки:
- Любой новый GET-параметр согласуется с тем, кто отвечает за SEO, до релиза.
- Сортировки и виды отображения реализуются через POST или хранятся в куках, а не в адресе.
- Фильтры по умолчанию закрыты; открываются точечно под подтверждённый спрос.
- Все внутренние ссылки ведут на канонические адреса — без меток и параметров.
- Раз в квартал — сверка числа страниц в индексе с реальным числом страниц сайта.
Эти правила стоят дешевле любой последующей чистки и входят в базовый пакет работ по внутренней оптимизации сайта.
Вывод
Мусорные страницы — редкий случай в SEO, когда работа даёт предсказуемый результат без творчества и без бюджета на ссылки. Вы не создаёте новый контент и не покупаете размещения: вы просто перестаёте тратить внимание поисковика впустую. На сайтах с большим каталогом эффект от чистки индекса часто превышает эффект от полугода написания текстов — просто потому, что тексты, которые робот не успевал переобойти, наконец начинают учитываться.
Сложность в том, что работа требует аккуратности: одна лишняя строка в robots.txt может закрыть от индексации коммерческий раздел, а неверный canonical — обнулить трафик категории. Если каталог большой, фильтров много, а цена ошибки измеряется заявками, разумнее доверить чистку тем, кто делал её десятки раз. Мы разбираем такие проекты с полного технического аудита, показываем структуру мусора в цифрах и правим её по приоритету — от того, что съедает бюджет робота сильнее всего. Посмотрите наши кейсы и напишите нам через страницу контактов — разберём ваш индекс и покажем, сколько страниц из него можно и нужно убрать.
Закажите SEO-продвижение в SEO ПРОГРЕСС
20 лет опыта, 250+ успешных кейсов. Бесплатный аудит и консультация.
Получить консультациюКомментарии
Дмитрий Ковалёв
У нас магазин на 1200 товаров, а в Вебмастере 46 тысяч страниц. Думал, это хорошо. Пошёл смотреть статистику обхода — там сплошные сортировки. Спасибо, глаза открыли.
Алина
А Clean-param можно указывать для всех параметров одной строкой или каждый отдельно?
Admin
Можно перечислять через & в одной строке — это удобнее и работает так же. Разбивают на несколько строк обычно тогда, когда для части параметров нужно ограничить действие конкретным разделом каталога.
Сергей П.
Закрыл всё через Disallow полгода назад. Судя по статье, зря — надо было Clean-param. Переделаю.
Admin
Disallow не «переносит» накопленный вес — он просто закрывает адрес от обхода, и всё, что на него ссылалось, теряется. Clean-param в этом смысле мягче: робот понимает, что это тот же документ, и переносит сигналы на чистый адрес. Для страниц с внешними ссылками разница принципиальная.
Марина Волкова
Самое ценное — таблица с инструментами. Наконец понятно, чем canonical отличается от noindex по задачам, а не по определению.
Игорь
После чистки число страниц в поиске упало с 18 тысяч до 900. Первые две недели было страшно. Через полтора месяца трафик вырос на 34%.
Наталья Р.
Подскажите, а etext откуда вообще берётся? У нас его сотни в индексе, при том что мы никаких меток не ставили.
Admin
Это «хвост», который Яндекс сам добавляет к ссылкам из своих сервисов. Сайт тут ни при чём, но реагировать нужно: добавьте etext в Clean-param и отметьте параметр как незначащий в разделе «Незначащие GET-параметры» в Вебмастере.
Антон
Про краулинговый бюджет знал, но не связывал с мусором так наглядно. Пошёл выгружать логи.
Ольга Терентьева
У нас Битрикс, умный фильтр наплодил около 200 тысяч комбинаций. Как их закрывать массово, вручную нереально.
Admin
Вручную и не нужно. В Битриксе комбинации закрываются на уровне настроек умного фильтра: открываете только свойства с подтверждённым спросом, остальное отдаёт noindex. Плюс Clean-param на сортировки и параметры отображения. Это настройка на день, а не перебор 200 тысяч адресов.
Владимир
Сделал по шагам. На пункте 2 (сверка с Метрикой) нашёл 40 страниц фильтров, которые приносили трафик. Чуть не закрыл их вместе со всем остальным.
Ксения
А сколько ждать эффекта, если сайт небольшой, страниц 300?
Admin
На небольших сайтах краулинговый бюджет обычно не является узким местом, поэтому эффект будет скромнее и в основном за счёт устранения дублей — это 3–6 недель. Основной выигрыш от чистки получают проекты с каталогом от нескольких тысяч страниц.
Роман Гусев
Пункт про sitemap отдельно порадовал. У нас в карте сайта лежали адреса с utm-метками, сами себе робота приглашали.
Евгения
Спасибо за предупреждение про noindex + Disallow одновременно. У нас именно так и было сделано, страницы висели в индексе два года.
Admin
Классическая ловушка: робот не может прочитать noindex на странице, закрытой в robots.txt, поэтому она может висеть в индексе годами. Правильный порядок — сначала открыть в robots.txt, дождаться переобхода с noindex, и только потом при желании закрывать обход.
Оставить комментарий