AI-краулеры уже читают sitemap.xml — и это важно в России
Новости
В Google заявили, что AI-кранглеры уже посещают sitemap.xml и RSS-фиды — и это не случайность. John Mueller подтвердил в подкасте, что видел такие запросы в своих логах, хотя назвать конкретные системы не стал.
John Mueller из Google подтвердил, что AI-тренировочные краулеры, вероятно, уже обращаются к sitemap.xml и RSS-фидам — и делают это без прямой поддержки через Search Console. Это важно, потому что многие системы, включая AI, не имеют интерфейса для ручной отправки карты сайта. Если файл не имеет стандартного имени или не указан в robots.txt, он может остаться незамеченным. Mueller предлагает оставить sitemap.xml и публиковать RSS-фиды — так краулеры быстрее его найдут.
Он также уточнил, что llms.txt — это не замена sitemap.xml. Формат Markdown не подходит для автоматической обработки системами Google, и в текущий момент он не используется для индексации. Даже SEO-инструменты, которые его обрабатывают, не являются краулерами поисковых систем. Попытки использовать llms.txt как основной способ передачи структуры сайта — это надежда, а не реальность.
Ещё один важный момент: если в Search Console пишет «Не удалось получить доступ» к валидному sitemap, это не всегда ошибка в файле. По словам Мюллера, причины могут быть в нагрузке на сервер или в низком спросе на краулинг. Google может пропустить карту, если не видит в ней нового или важного контента. Это значит, что качество и актуальность контента — не просто рекомендация, а часть алгоритма, влияющего на видимость.
Считаю, что ключевое здесь — не то, что AI уже читает sitemap, а то, что он делает это без официального интерфейса. Это означает, что стандартные практики поисковой оптимизации остаются актуальными, но требуют пересмотра: если вы хотите, чтобы ваш контент попал в AI-системы, нужно не только писать его, но и делать так, чтобы его можно было найти. Использование стандартных имен и публикация RSS — это простые шаги, которые работают и сейчас.
На мой взгляд, не стоит тратить усилия на llms.txt. Это не замена, и даже если в будущем формат станет поддерживаться, сейчас он не даёт никакой пользы. Лучше сосредоточиться на том, что уже работает: открытые, доступные и структурированные данные. Их и будут читать краулеры, включая AI.
Мы в Cetera такие интеграции ставим на очередь обмена, когда в проекте есть RSS-фиды. В таких случаях сначала проверяем, как они выглядят в логах, и убеждаемся, что они доступны без блокировок. У нас это обычно решается на этапе архитектуры — до запуска.
Это часть нашей работы — Создание и разработка. Создание интернет-проекта — комлексная услуга, включающая весь производственный цикл: от сбора требований до запуска готового ресурса в интернете. Создание и разработка
Автор: Святослав Семенов из Cetera Labs
Новость для бизнеса в Димитровграде, Россия