Когда сайт быстро увеличивает количество посадочных страниц, одной из самых интересных задач становится не создание контента, а работа с поисковыми роботами.
На практике два поисковика могут абсолютно по-разному относиться к одному и тому же проекту.
Мы наблюдаем это на собственном туристическом проекте GoToPlace, где архитектура рассчитана на большое количество страниц по городам, путешествиям, отелям, экскурсиям и транспорту.
Главный вывод: количество существующих URL почти ничего не говорит о количестве страниц, которым поисковая система готова доверять.
Распространённое представление выглядит так:
создали страницу → добавили в sitemap → робот пришёл → страница должна попасть в индекс.
В реальности sitemap только помогает поисковой системе обнаружить URL. Решение о том, стоит ли хранить страницу в основном индексе, принимает сама поисковая система.
Поэтому ситуация, когда робот успешно обходит URL, но он затем исчезает из индекса, не обязательно означает техническую ошибку.
Поисковик может повторно оценивать ценность страницы, её уникальность и место в архитектуре проекта.
На массовом сайте нельзя смотреть только одну страницу.
Нужно анализировать весь шаблон.
Если из индекса выпадает большое количество однотипных страниц, проверяем:
— одинаково ли формируются title и H1; — корректны ли canonical; — нет ли нескольких URL для одной сущности; — существуют ли страницы без полезных данных; — есть ли на них внутренние ссылки; — не попадают ли в sitemap технические комбинации; — доступен ли основной контент без выполнения сложного клиентского JavaScript.
Так гораздо быстрее найти системную причину.
На молодом большом сайте возникает соблазн постоянно что-то улучшать.
Сегодня поменять title, завтра URL, послезавтра структуру хлебных крошек, потом canonical.
Каждое изменение по отдельности может быть логичным. Но поисковая система видит постоянно меняющийся объект.
Поэтому после исправления серьёзных технических проблем иногда полезнее какое-то время не перестраивать архитектуру, а дать поисковику повторно переобойти сайт и сформировать устойчивое представление о нём.
Это особенно важно при анализе результатов.
Если один поисковик уже забрал большую часть страниц, а другой индексирует значительно осторожнее, нельзя автоматически заключать, что второй «сломался».
У систем отличаются алгоритмы обхода, оценки качества и распределения ресурсов робота.
Поэтому правильный вопрос не «почему цифры разные», а:
какие типы страниц принимает каждый поисковик и чем принятые страницы отличаются от исключённых?
Для крупного проекта этот анализ значительно полезнее общей цифры покрытия.
Массовая отправка URL имеет смысл только после того, как шаблоны достаточно стабильны.
Если ускорять обнаружение слабых страниц, можно добиться обратного эффекта: робот быстрее увидит большое количество URL, которые ему не нужны.
Гораздо полезнее постепенно укреплять структуру сайта, внутренние связи и качество конкретных типов страниц.
Большой сайт необходимо воспринимать не как набор миллионов отдельных документов, а как систему шаблонов.
Если шаблон качественный, его можно масштабировать.
Если шаблон проблемный, масштабирование лишь превращает небольшую SEO-ошибку в проблему на сотнях тысяч URL.
Поэтому наш порядок работы сейчас выглядит так:
Именно такой подход позволяет строить крупный поисковый проект без постоянной борьбы с последствиями собственной автоматизации.