Открытый веб без иллюзий: что сбор данных роботами меняет для SEO и видимости сайтаРазбор того, как политика для поисковых и нейросетевых роботов влияет на индексацию, цитируемость в ответах ИИ, трафик и контроль над контентом.
July 28
13 minutes

Открытый веб без иллюзий: что сбор данных роботами меняет для SEO и видимости сайта

20 июля 2026 года судья Ивонн Гонсалес Роджерс отклонила ключевые DMCA-претензии Google к SerpApi: по пересказу Search Engine Journal, защита SearchGuard охраняет рекламную модель Google, а не авторское право. Для SEO это означает простую вещь: решение по scraping и AI-crawlers больше нельзя сводить к одному переключателю в robots.txt. Видимость сайта теперь раскладывается минимум на четыре слоя: индексация в поиске, использование контента для обучения моделей, появление в ответах ИИ-поиска и пользовательские заходы ассистентов на страницу.

Для digital-маркетинга это уже практический вопрос, а не юридическая экзотика. Один и тот же сайт может одновременно хотеть трафик из Google, цитируемость в ответах нейросетей, защиту закрытых разделов и контроль над тем, какие материалы уходят в обучающие выборки. Ошибка начинается там, где все эти цели смешивают в одно правило.

Почему спор Google и SerpApi касается не только юристов

В центре дела оказался не сам факт автоматического сбора данных, а попытка привязать антибот-защиту к авторскому праву. По пересказу Search Engine Journal, суд не принял логику, в которой обход SearchGuard автоматически равен незаконному обходу защиты авторского контента. При этом для части претензий по изображениям из Knowledge Panel Google оставили узкий коридор на доработку, но общий сигнал уже понятен: не каждая техническая стена вокруг публичной страницы даёт сильную правовую защиту.

Для владельцев сайтов это неприятно по двум причинам.

Первая: старая позиция "мы открыты для поиска, но закрыты для нежелательных машин" стала хуже держаться как универсальная формула. Веб уже давно читают не только поисковики, но и сервисы ответов, обучающие боты, ассистенты и агенты, которые приходят по пользовательскому запросу.

Вторая: сам рынок видимости меняется быстрее, чем успевают обновляться привычные SEO-чеклисты. Ещё недавно спор шёл вокруг индексации и сниппетов. Сейчас к этому добавились ответы в ChatGPT, Gemini и других интерфейсах, где бренд может быть назван ещё до клика по классической выдаче.

Если смотреть на ситуацию глазами маркетинга, вопрос звучит так: каким машинам сайт разрешает читать себя, для какой цели и с какими потерями или выгодами для видимости. Это уже часть контент-стратегии, а не только серверной настройки.

Что решение по сбору данных роботами и обходчикам нейросетей меняет для SEO

Главный сдвиг в том, что термин "боты" перестал быть полезной категорией сам по себе. По документации Google и OpenAI, у разных роботов разная функция, и влияние на SEO у них тоже разное.

1. Поисковая индексация и ранжирование

Здесь по-прежнему критичен доступ поискового робота. Если закрывается Googlebot, страдает обычная видимость в Google Search, Discover, новостных и других поисковых поверхностях Google. Это классический слой SEO, и его нельзя путать с нейросетевыми сценариями.

2. Использование контента для обучения моделей

По документации Google, Google-Extended позволяет управлять тем, может ли уже собранный Google контент использоваться для обучения будущих поколений Gemini и для некоторых сценариев grounding. При этом Google отдельно указывает, что этот токен не влияет на включение сайта в Google Search и не является сигналом ранжирования.

Google-Extended does not impact a site's inclusion in Google Search.

Для SEO-команды это редкий случай, когда можно ограничивать один сценарий использования контента, не теряя обычную поисковую индексацию.

3. Появление сайта в ответах ИИ-поиска

По документации OpenAI, OAI-SearchBot отвечает за появление сайтов в поисковых функциях ChatGPT. Там же прямо сказано: если сайт закрыт от OAI-SearchBot, он не будет показываться в поисковых ответах ChatGPT, хотя может всё ещё встречаться как навигационная ссылка.

Это уже отдельный канал видимости. Он не заменяет Google Search, но для части запросов начинает конкурировать с ним за первый контакт с брендом.

4. Пользовательские заходы ассистентов на страницу

У OpenAI есть ещё ChatGPT-User. По официальной документации, он используется для действий, инициированных пользователем, и robots-правила могут на него не распространяться так же, как на классический автоматический crawl. Для маркетинга это важная деталь: даже хорошо настроенная политика для обучения моделей и поисковых роботов не даёт полной картины, если не учтены пользовательские визиты агентов.

Именно поэтому обсуждение scraping и AI-crawlers нельзя вести в терминах "разрешить всё" или "запретить всё". У сайта обычно не одна задача, а несколько разных задач с конфликтующими интересами.

Где сайты сами режут себе видимость

Ошибки здесь чаще всего не технически сложные. Они происходят из-за того, что команды путают управление обходом, индексацией и обучением моделей.

robots.txt пытаются использовать как кнопку исчезновения

Google в своей документации прямо предупреждает: robots.txt нужен в первую очередь для управления обходом, а не для гарантированного удаления страницы из поиска. Если на закрытую страницу ведут ссылки, URL всё равно может появиться в выдаче без описания. Для полного исключения Google рекомендует noindex, защиту паролем или удаление страницы.

На практике это означает следующее: если бренд закрывает раздел в robots.txt, а потом удивляется, что URL всё ещё всплывает в поиске, проблема не в поисковике, а в неверно выбранном инструменте.

Одним запретом перекрывают и поиск, и нейросетевую видимость

Многие команды действуют резко: видят рост AI-ботов в логах и ставят жёсткий запрет всем подряд. После этого вместе с тренировочными обходчиками легко отрезать и те поверхности, где бренд мог бы получать упоминания, цитаты и переходы.

Особенно болезненно это для медиа, SaaS и экспертных блогов. У таких проектов часть ценности создаётся не только прямыми кликами, но и повторяемым присутствием в ответах систем, которые агрегируют источники. Когда бренд исчезает из этой прослойки, просадка сначала незаметна, а через несколько месяцев бьёт по спросу на уровне брендовых запросов, прямых заходов и упоминаний.

Не разделяют публичный и служебный контур

Открытая статья, база знаний, PDF с исследованием, личный кабинет, тестовый стенд и экспорт отчёта часто лежат под одним доменом, но требуют разной политики доступа. Если всё это регулируется одной общей директивой, сайт почти неизбежно либо теряет полезную видимость, либо оставляет лишние лазейки для обходчиков.

Для SEO и контент-маркетинга безопаснее мыслить не доменом целиком, а типами страниц. Статья в блоге и кабинет клиента решают разные задачи и не должны жить под одинаковыми правилами для роботов.

Не отслеживают эффект после изменения правил

Правила для роботов нередко меняют как инфраструктурную мелочь: разработчик обновил robots.txt, CDN добавил защиту, плагин по умолчанию закрыл нового робота. Через месяц команда замечает падение охватов в поиске ответов нейросетей, но связать причину уже трудно.

В этот момент полезно сводить вместе данные веб-аналитики, логи обхода, брендовые запросы и мониторинг упоминаний. Когда после изменения правил бренд стали реже цитировать или обсуждать, это лучше видно в связке поисковых и репутационных сигналов. Для слоя мониторинга бренда, SMM и Telegram-маркетинга такую картину удобно дополнять данными из FollowPulse, а не смотреть на SEO изолированно.

Политика доступа по типам страниц: рабочая матрица

Вместо спора "быть открытыми или закрытыми" полезнее собрать матрицу по разделам сайта.

Публичные статьи и исследования

Если цель раздела — охваты, цитируемость и органическая видимость, обычно имеет смысл:

  • оставлять доступ для Googlebot;
  • отдельно решать вопрос по OAI-SearchBot, если важна видимость в поисковых ответах ChatGPT;
  • отдельно решать вопрос по Google-Extended и GPTBot, если команда не хочет отдавать контент в обучающие сценарии;
  • не закрывать такие страницы через robots.txt, если потом ожидается стабильная индексация.

Для контент-маркетинга это сегодня самый частый компромисс: страница открыта для поиска и для цитирования в поисковых ИИ, но ограничена для обучения моделей там, где это технически возможно.

Коммерческие посадочные страницы

Здесь логика тоньше. Бренду нужна индексация и сохранение конверсии, но не всегда нужна широкая эксплуатация контента для обучения систем. Если у страницы нет уникальной экспертной ценности, а текст служит в первую очередь продажам, решение закрыть обучающие обходчики может быть оправдано. При этом закрывать поискового робота или убирать страницу через noindex было бы прямой потерей SEO-видимости.

База знаний и документация

Это один из самых спорных типов контента. С одной стороны, такие страницы хорошо решают пользовательский интент и часто получают цитаты. С другой, именно они удобнее всего для автоматического ответа без перехода на сайт. Если документация приносит лиды за счёт экспертного доверия, её стоит измерять не только по кликам, но и по косвенным эффектам: брендовому спросу, упоминаниям, ссылкам, вовлечённости в соцсетях, росту поисковых заходов по смежным темам.

Закрытые разделы, личные кабинеты, выгрузки, служебные страницы

Здесь не стоит надеяться на вежливость роботов. Google отдельно пишет, что robots.txt не подходит для защиты чувствительного контента. Если раздел действительно не должен читаться машинами и людьми извне, нужны пароль, авторизация, ограничения на уровне сервера, токены доступа и понятная политика кэширования.

Что делать SEO- и маркетинговой команде после дела Google

Практический вывод из спора Google и SerpApi не в том, что "скрапинг победил". Такой вывод был бы слишком грубым. Вывод в другом: контроль над видимостью становится послойным, и каждая цель требует своего инструмента.

Разделить цель каждого раздела сайта

Для каждого крупного блока сайта стоит зафиксировать, что важнее:

  • индексироваться в поиске;
  • попадать в ответы ИИ-поиска;
  • быть закрытым от обучения моделей;
  • быть полностью недоступным извне.

Пока этого разделения нет, политика для роботов почти всегда получается случайной.

Проверить реальные правила, а не только файл robots.txt

Нужна ревизия не только robots.txt, но и meta robots, заголовков ответа, CDN-правил, WAF, плагинов CMS и настроек кэша. На практике ограничение доступа часто появляется не там, где его ищут SEO-специалисты.

Сверить технические решения с моделью дистрибуции контента

Если компания делает ставку на экспертный блог, исследования, аналитика соцсетей и мониторинг бренда, полное закрытие от всех AI-crawlers может лишить её новой точки цитируемости. Если же сайт живёт за счёт закрытых данных, платного архива или внутренних инструментов, приоритеты будут другими. Одинаковой политики для всех проектов здесь уже нет.

Настроить наблюдение после изменений

После любой правки правил доступа стоит смотреть минимум на четыре сигнала:

  • индексацию и сканирование в поиске;
  • появление бренда и материалов в ответах ИИ-поиска;
  • изменения в брендовом спросе и переходах;
  • динамику упоминаний и обсуждений в соцсетях и мессенджерах.

Для SMM и digital-маркетинга это особенно важно: часть эффекта проявляется не в позиции страницы, а в том, как бренд начинает или перестаёт фигурировать в обсуждении темы.

Чеклист

  1. Разбить сайт на типы страниц: публичные статьи, коммерческие страницы, документация, закрытые разделы, файлы и архивы.
  2. Для каждого типа отдельно решить, нужны ли индексация, цитируемость в ИИ-поиске, участие в обучении моделей и полный запрет внешнего доступа.
  3. Проверить robots.txt, meta robots, HTTP-заголовки, правила CDN и WAF, чтобы не путать управление обходом с управлением индексацией.
  4. Для страниц, которые не должны появляться в поиске, использовать noindex, пароль или удаление, а не рассчитывать только на robots.txt.
  5. После изменений сверить логи обхода с данными по видимости: индекс, брендовые запросы, цитируемость в ответах ИИ, упоминания бренда.
  6. Отдельно пересмотреть политику для Google-Extended, OAI-SearchBot, GPTBot и пользовательских агентских запросов, не смешивая их в одно правило.

FAQ

Потеряет ли сайт позиции в Google, если закрыть Google-Extended

По документации Google, Google-Extended не влияет на включение сайта в Google Search и не используется как сигнал ранжирования. Такой запрет касается сценариев обучения будущих моделей Gemini и некоторых режимов grounding, но не классической индексации.

Можно ли остаться в поиске Google и при этом не отдавать контент на обучение нейросетям

Да, частично. Для Google это как раз сценарий Google-Extended: поисковую индексацию и использование контента для обучения можно разделять. Для OpenAI похожую роль выполняет запрет GPTBot, но при этом нужно отдельно решить, нужен ли доступ OAI-SearchBot для видимости в поисковых ответах ChatGPT.

Почему robots.txt не убирает страницу из поиска полностью

Потому что robots.txt управляет обходом, а не гарантированным исключением URL из выдачи. Если на страницу ссылаются другие сайты, Google может знать о её существовании и показывать адрес в поиске даже без полноценного обхода. Для полного исключения нужны noindex, защита доступа или удаление страницы.

Стоит ли закрывать OAI-SearchBot, если трафика из ChatGPT почти нет

Это зависит от стратегии. Если бренд работает в темах, где ответы ИИ уже становятся первым касанием, ранний отказ от такой видимости может обойтись дороже, чем кажется по текущему трафику. Если же контент не должен использоваться в этом канале вовсе, запрет может быть осознанным. Решение лучше принимать по типам страниц, а не по домену целиком.

Достаточно ли запретить всех ботов в robots.txt, чтобы защитить закрытые разделы

Нет. Google прямо указывает, что robots.txt не подходит для защиты чувствительной информации. Закрытые разделы нужно убирать за авторизацию, пароль, серверные ограничения доступа и корректную настройку индексации.

Короткий вывод для маркетинга: политика доступа для роботов стала частью SEO-стратегии и мониторинга бренда. Когда нужна связка данных по упоминаниям, Telegram-маркетингу и аналитике соцсетей, это удобно собирать в FollowPulse.

Пользуйся FollowPulse и получай:

  • Аналитику соцсетей
  • Умный поиск информации
  • Рост своего бренда

Пробный доступ — от 10 рублей.

Попробовать FollowPulse

0
0
0

Comments

Sign in to leave comments

The comments - 0