«Просканирована, но пока не проиндексирована» — это не баг Google и не «подождите недельку». Это решение: робот страницу видел, прочитал и счёл, что она не стоит места в индексе. Лечится не кнопкой «Запросить индексирование», а причиной — дубли, пустые шаблоны, страницы-сироты. В Яндексе у того же диагноза другое имя: «малоценная или маловостребованная страница».
Разбираем, почему поисковики отказываются индексировать страницы, которые ты им честно отдал в sitemap, и что с этим делать по порядку. Без магии и без «прогона по твиттеру».
Два статуса, которые путают
В GSC, отчёт «Индексирование страниц», есть два похожих статуса. Разница между ними принципиальная.
- «Обнаружена, не проиндексирована» — Google знает про URL (из sitemap или по ссылке), но даже не сходил на него. Обычно это про бюджет сканирования и приоритеты: сайт медленный, страниц много, сигналов важности мало.
- «Просканирована, но пока не проиндексирована» — сходил, скачал, отрендерил. И отказался. Вот это уже оценка качества, а не очередь.
Слово «пока» в названии — утешительный приз. На практике страница может висеть в этом статусе годами. Официальное описание статусов — в справке Google по отчёту об индексировании.
В Яндекс.Вебмастере смотри «Индексирование → Страницы в поиске → Исключённые». Причина «Малоценная или маловостребованная страница» — родной брат гугловского статуса. Логика та же: робот решил, что страница не нужна пользователям или дублирует то, что уже есть.
Почему это происходит: пять причин по частоте
Порядок — по тому, как часто я это вижу на аудитах. Не по учебнику.
1. Шаблонные дубли
Карточки товаров, которые отличаются только цветом. Страницы услуг «в Минске», «в Гомеле», «в Бресте» с одним текстом и заменённым названием города. Теги блога, где на каждом по одной статье. Для поисковика это одна и та же страница в десяти копиях — он берёт одну, остальные выкидывает.
Интернет-магазин стройматериалов, 2024 год: в статусе «просканирована, не проиндексирована» висело около 1 800 URL. Больше половины — карточки-клоны одной позиции в разных фасовках, с одинаковым описанием от поставщика слово в слово. Склеили фасовки в одну карточку с выбором варианта — за два месяца статус ушёл у большинства. Как правильно собирать карточки, разбирал в статье про SEO карточек товара.
2. Пустые или почти пустые страницы
Категория с двумя товарами и без текста. Страница фильтра с нулём результатов. Статья на 300 слов, которая пересказывает то, что есть на тысяче других сайтов. Не про объём ради объёма — про то, что на странице нет ничего, чего нет у других.
3. Страницы-сироты
На страницу нет ни одной внутренней ссылки — только запись в sitemap. Для поисковика это сигнал «владелец сам не считает её важной». Типичная история после редизайна: старые статьи выпали из меню и листингов, sitemap их по-прежнему отдаёт, а навигацией до них не дойти.
Как проверить: Screaming Frog, режим краула + загрузка sitemap, отчёт «Orphan URLs». Если сирот больше 10% от sitemap — у тебя проблема с внутренней перелинковкой, а не с индексацией.
4. Мусор, который ты сам отдал роботу
Параметры сортировки, UTM-метки во внутренних ссылках, версии для печати, страницы поиска по сайту. Всё это жрёт ресурс сканирования и размывает качество сайта в целом. Робот начинает считать, что у тебя 70% страниц — мусор, и к остальным 30% относится с подозрением.
Закрывается это правильным robots.txt и canonical — подробно в статье про настройку robots.txt, а для каталогов — про фильтры интернет-магазина.
5. Контент, который робот не увидел
Текст подгружается скриптом после клика, отзывы — через виджет в iframe, описание услуги спрятано в табы, которые рендерятся только на клиенте. Google рендерит JS, но не всегда и не сразу. Яндекс — ещё хуже. В итоге робот видит шапку, футер и пустоту.
Проверка: «Проверка URL» в GSC → «Проверить страницу на сайте» → «Просмотр проверенной страницы» → вкладка HTML. Ищи там свой основной текст поиском по странице. Нет текста — нет индексации, и дело не в качестве.
Что делать: порядок действий
Не хватай всё сразу. Меняешь пять вещей одновременно — потом не поймёшь, что сработало.
- Выгрузи список. GSC → «Индексирование страниц» → кликаешь на статус → экспорт. Отдаёт до 1 000 примеров, для большинства сайтов хватает. Из Вебмастера исключённые выгружаются там же, в «Страницах в поиске».
- Разложи по шаблонам. Не по одному URL — по типам: карточки, фильтры, теги, статьи, пагинация. Обычно 80% проблемы сидит в одном-двух шаблонах.
- По каждому шаблону реши: нужен он в индексе или нет. Честно. Тег блога с одной статьёй не нужен. Страница «Ремонт двигателя в Бресте», если ты в Бресте не работаешь, — тоже.
- Ненужное — убери из индекса осознанно. noindex, canonical на основную версию, 301 при склейке, 410 если страницы больше нет. И убери всё это из sitemap — sitemap должен содержать только то, что ты хочешь видеть в поиске.
- Нужное — усиль. Уникальный текст под интент, а не под «объём 2000 знаков». Ссылки с сильных страниц: с главной, из категорий, из популярных статей.
- Только после этого — переобход. «Запросить индексирование» в GSC, «Переобход страниц» в Вебмастере. Не раньше.
| Тип страницы | Частая причина | Что делать |
|---|---|---|
| Карточки-варианты (цвет, размер) | Дубль описания | Склеить в одну карточку с выбором, остальные — 301 или canonical |
| Страницы «услуга + город» | Один текст с заменой топонима | Оставить только города, где реально работаешь, и дать каждому свой контент: адрес, сроки, кейсы, цены |
| Теги блога | 1-2 статьи на тег | noindex или удалить теги целиком |
| Фильтры каталога | Комбинаторный взрыв URL | В индекс — только фильтры со спросом в Wordstat, остальное закрыть |
| Статьи блога | Пересказ чужого + сирота | Переписать с опытом и цифрами, поставить ссылки из листингов и соседних статей |
| Пагинация | Похожие листинги | Обычно норм, если canonical на себя. Не лечить, если остальное в порядке |
Чего делать не надо
Долбить кнопку «Запросить индексирование» по сотне URL в день. У неё суточная квота, и она не меняет оценку качества. Робот придёт, посмотрит на ту же пустую страницу и примет то же решение.
Гнать страницы через Indexing API. Официально он только для вакансий и прямых трансляций — это написано прямо в документации Google. Для остального это ускорение визита робота, не больше. Ускорил визит к плохой странице — получил быстрый отказ.
Покупать «индексаторы» и прогоны по соцсетям. Я в 2019-м честно тестил пару таких сервисов на тестовом сайте с тонким контентом. Страницы ненадолго залетали в индекс и через 2-3 недели вылетали обратно. Деньги в трубу.
И ещё — не пугайся самой цифры. Если у тебя интернет-магазин на 20 000 URL и 3 000 из них не в индексе — это может быть абсолютно нормально, если там фильтры и мусор. Смотри, какие страницы вылетели, а не сколько.
Когда это правда проблема сайта целиком
Если в статусе висят не фильтры и теги, а твои главные коммерческие страницы — услуги, категории, основные статьи — это уже не про отдельные URL. Это про доверие к сайту целиком.
Сайт услуг в областном центре РБ: новый домен, 40 страниц, половина — «услуга + район города» под копирку. Через три месяца Google проиндексировал 11. Причём выкинул не только районные клоны, но и пару нормальных страниц услуг — видимо, решил, что на сайте в целом мало ценного. Удалили 18 клонов, оставшиеся расписали нормально, добавили реальные фото объектов и цены. Ещё через полтора месяца в индексе было 30 из 32.
Вывод простой: мусорные страницы тянут вниз хорошие. Удалять — не страшно. Страшно держать.
Как понять, что стало лучше
Смотри не на общее число «Проиндексировано», а на конкретные шаблоны. Сделай в GSC отдельные sitemap по типам страниц — sitemap-uslugi.xml, sitemap-catalog.xml, sitemap-blog.xml. Тогда в отчёте можно фильтровать индексирование по каждому sitemap и видеть, какой шаблон чинится, а какой нет.
Сроки — от двух недель до двух-трёх месяцев. Быстрее у сайтов, куда робот и так ходит часто. На новом домене с десятком внешних ссылок — медленнее, и тут ничего не ускоришь, кроме нормальной работы над контентом и ссылками.
Сколько у тебя сейчас страниц в этом статусе? И главное — ты вообще знаешь, какие это страницы, или смотрел только на цифру на графике?