Чаще всего страницы не индексируются из-за блокировки в robots.txt, ошибок 4xx/5xx, медленной загрузки (больше 3 секунд) или отсутствия внутренних ссылок. В 80% случаев проблема решается исправлением одной из 12 технических причин.
По моим наблюдениям, владельцы сайтов ищут сложные причины, хотя обычно всё банально: разработчики забыли убрать запрет из robots.txt или страница недоступна для краулера.
Проверка robots.txt - главная причина блокировки
Первым делом проверяю файл robots.txt на домене через прямой адрес site.ru/robots.txt. Если разработчики работали на закрытой версии сайта, там могут остаться строки:
User-agent: *
Disallow: /
Эта директива запрещает индексацию всего сайта. Ещё встречаю частичные блокировки нужных разделов:
Disallow: /catalog/
Disallow: /services/
Для проверки конкретной страницы использую инструмент в Яндекс.Вебмастере: раздел «Инструменты» → «Анализ robots.txt». Вставляю URL страницы и вижу, разрешён ли доступ для Yandex.
В Google Search Console аналогичный инструмент находится в разделе «Настройки» → «Средство проверки robots.txt».

Статус ответа сервера: ошибки 4xx и 5xx
Страницы с ошибками 404, 403, 500-503 не индексируются. Проверяю статус через любой онлайн-сервис или браузерные инструменты разработчика (F12 → Network).
Частые проблемы:
404 - страница не найдена. Обычно из-за неправильного URL в sitemap.xml или внутренних ссылках.
403 - доступ запрещён. Проблема с правами доступа на хостинге.
500-503 - ошибки сервера. Нужно смотреть логи хостинга или обращаться к разработчикам.
В Яндекс.Вебмастере эти ошибки показываются в разделе «Индексирование» → «Страницы в поиске» → фильтр «Исключённые».
Скорость загрузки и доступность для роботов
Страницы, загружающиеся дольше 3-5 секунд, роботы могут пропускать или индексировать с задержкой. Проверяю через Google PageSpeed Insights или GTmetrix.
Ключевые параметры для роботов:
Time to First Byte (TTFB) - время отклика сервера. Норма до 200-300 мс.
Полная загрузка HTML - должна быть до 1-2 секунд.
Доступность сервера - роботы должны получать стабильный ответ.
Если сайт на слабом хостинге или сервер перегружен, роботы получают таймауты и откладывают индексацию.
В логах сервера ищу записи с User-Agent содержащим «Yandex» или «Googlebot». Если их нет - роботы не могут добраться до страниц.
Внутренние ссылки и навигация сайта
Страницы без внутренних ссылок остаются «сиротами» - роботы их не находят при обходе сайта. Проверяю несколько путей:
Есть ли ссылка на страницу в главном меню, каталоге или футере.
Указана ли страница в sitemap.xml.
Ведут ли на неё ссылки с других страниц сайта.
Использую команду site:domain.ru в Яндексе и Google для проверки текущего индекса. Если страницы нет в выдаче, ищу путь к ней через внутреннюю перелинковку.
Для массовой проверки внутренних ссылок подключаю Screaming Frog или похожий краулер. Он показывает все страницы, на которые нет внутренних ссылок.
Настройка sitemap.xml и его отправка
Sitemap должен содержать только те страницы, которые нужно индексировать. Проверяю через прямой адрес site.ru/sitemap.xml или site.ru/sitemap_index.xml.
Частые ошибки в sitemap:
URL с параметрами (?page=1, ?sort=price) вместо чистых адресов.
Страницы с noindex в мета-тегах.
Неактуальные URL, которые возвращают 404.
Отсутствие важных разделов сайта.
После исправления отправляю sitemap в поисковики:
Яндекс.Вебмастер: «Индексирование» → «Файлы Sitemap»
Google Search Console: «Файлы Sitemap» в левом меню
Обычно обработка занимает от нескольких дней до недели. Статус обработки показывается в тех же разделах.
Мета-теги и директивы индексации
Проверяю HTML-код страницы на наличие блокирующих директив. Открываю исходный код (Ctrl+U) и ищу в секции <head>:
<meta name='robots' content='noindex'> - запрещает индексацию
<meta name='robots' content='noindex, nofollow'> - запрещает индексацию и переход по ссылкам
Правильные директивы для индексируемых страниц:
<meta name='robots' content='index, follow'> или вообще отсутствие мета-тега robots.
Ещё проверяю канонические ссылки:
<link rel='canonical' href='https://site.ru/page/'>
Если canonical указывает на другую страницу, текущая не будет индексироваться как дублированная.
Проверка через инструменты поисковиков
Для точной диагностики использую официальные инструменты:
Яндекс.Вебмастер:
«Инструменты» → «Проверка ответа сервера» - показывает, как Яндекс видит страницу
«Индексирование» → «Переобход страниц» - принудительная отправка URL на индексацию
Google Search Console:
«Проверка URL» в верхней строке - детальный анализ страницы
«Запросить индексирование» после проверки URL
В отчёте «Проверка URL» Google показывает:
Доступна ли страница для сканирования
Есть ли блокировки в robots.txt
Корректность HTML и ключевых элементов
Мобильная версия страницы
Согласно документации поисковиков (https://yandex.ru/support/webmaster/), принудительная отправка не гарантирует быструю индексацию, но помогает привлечь внимание роботов к обновлённым страницам.
Дублированный контент и тонкие страницы
Страницы с дублированным или слишком коротким контентом поисковики могут исключать из индекса. Проверяю несколько факторов:
Объём уникального текста - менее 100-200 слов считается «тонким контентом»
Повторение контента с других страниц сайта
Автоматически генерируемые описания без уникальной информации
Для поиска дублей использую команды:
site:domain.ru «точная фраза из контента»
Поиск по фрагменту заголовка страницы
В Яндекс.Вебмастере дубли отображаются в разделе «Индексирование» → «Страницы в поиске» с пометкой «Дубликат».
Технические ограничения и лимиты краулинга
У поисковых роботов есть лимиты на количество запросов к сайту в единицу времени. Если сайт большой или медленный, роботы могут не успевать обходить все страницы.
Факторы, влияющие на скорость краулинга:
Авторитет домена - новые сайты обходятся реже
Технические характеристики сервера
Размер сайта и частота обновления контента
В Яндекс.Вебмастере можно настроить скорость обхода в разделе «Инструменты» → «Скорость обхода». Доступны варианты от «Медленнее» до «Быстрее».
Для новых сайтов рекомендую начинать с малого количества страниц и постепенно добавлять контент, а не публиковать сразу тысячи страниц.
Проблемы с JavaScript и динамическим контентом
Если важный контент загружается через JavaScript, роботы могут его не увидеть. Это касается:
Текста, подгружаемого после загрузки страницы
Элементов навигации и внутренних ссылок
Динамически генерируемых заголовков и описаний
Проверяю через «Проверка ответа сервера» в Яндекс.Вебмастере - там показывается HTML, который видит робот. Если важные элементы отсутствуют, нужно дублировать их в серверном HTML.
Google лучше обрабатывает JavaScript, но для надёжности критически важный контент должен быть в исходном HTML-коде страницы.
Региональные и языковые настройки
Страницы могут не индексироваться в определённых регионах из-за неправильных настроек. Проверяю:
Геотаргетинг в Яндекс.Вебмастере: «Настройки» → «Региональность»
Hreflang-разметку для многоязычных сайтов
IP-адрес сервера и его географическое расположение
Для российской аудитории лучше использовать хостинг в России или СНГ. Серверы в США или Европе могут замедлять индексацию Яндексом.
В Google Search Console региональные настройки находятся в разделе «Настройки» → «Настройки сайта».

Мониторинг индексации и план действий
Для постоянного контроля индексации настраиваю регулярные проверки:
Еженедельный мониторинг команды site:domain.ru в Яндексе и Google
Отслеживание новых страниц в разделах вебмастеров
Проверка корректности работы sitemap.xml
План действий при проблемах с индексацией:
1. Проверить доступность страницы и статус ответа сервера
2. Убедиться в отсутствии блокировок в robots.txt
3. Проверить мета-теги robots и canonical
4. Добавить внутренние ссылки на страницу
5. Включить URL в sitemap.xml и отправить в поисковики
6. При необходимости использовать принудительную отправку на индексацию
Обычно после устранения технических проблем индексация происходит в течение 1-2 недель для Яндекса и 3-7 дней для Google.



