Краулинг — это процесс обхода сайта поисковыми роботами для обнаружения и анализа страниц. Во время краулинга робот переходит по ссылкам, считывает код страницы, проверяет контент, мета-теги, статус ответа сервера и другие технические параметры.
Краулинг предшествует индексации: сначала поисковая система должна найти и просканировать страницу, а уже затем принять решение, добавлять ли ее в индекс. Если робот не может добраться до нужного URL, страница может не появиться в поиске, даже если она качественная и полезная.
На эффективность краулинга влияют структура сайта, глубина вложенности страниц, внутренняя перелинковка, карта сайта, скорость загрузки, количество ошибок 404 и 500, редиректы, дубли и закрытые разделы. Для крупных сайтов особенно важно распределять crawl budget: поисковый робот должен чаще обходить приоритетные страницы, а не тратить время на технический мусор и бесконечные комбинации фильтров.