robots.txt больше не решает всё: доступ сайта для ChatGPT и AI-поиска нужно разделить
OpenAI прямо указывает: правила robots.txt могут не применяться к ChatGPT-User, когда страницу запрашивает пользователь ChatGPT или Custom GPT. При этом видимость сайта в поисковых ответах ChatGPT управляется другим агентом — OAI-SearchBot, а запрет на обучение моделей связан с GPTBot. Одна строка Disallow больше не описывает политику доступа к сайту.
Для digital-маркетинга это уже техническая задача с продуктовым последствием. Неправильная настройка может одновременно закрыть страницы от ChatGPT Search, оставить открытым сбор контента для обучения или создать у команды ложное ощущение, что прямой запрос страницы через ChatGPT надёжно заблокирован.
Почему robots.txt для ChatGPT больше нельзя настраивать «одним ботом»
В документации OpenAI перечислены агенты с разными функциями. Их нельзя считать взаимозаменяемыми.
- GPTBot обходит доступный контент, который может использоваться для обучения базовых моделей OpenAI.
- OAI-SearchBot используется для показа сайтов в поисковых функциях ChatGPT. OpenAI рекомендует разрешить его в robots.txt, если сайт должен появляться в поисковых ответах.
- ChatGPT-User может посещать страницу по действию пользователя: например, когда пользователь просит ChatGPT изучить конкретную ссылку. OpenAI подчёркивает, что это не автоматический обход веба и что из-за пользовательской природы запроса правила robots.txt могут не применяться.
Это три разных сценария, и у каждого своя цена для маркетинга.
Запрет GPTBot не означает запрет OAI-SearchBot. Разрешение OAI-SearchBot не означает согласие на обучение моделей. А правило для ChatGPT-User не стоит воспринимать как техническую гарантию, что по ссылке никто не сможет получить публичную страницу.
robots.txt выражает правила для добросовестных автоматических агентов. Он не заменяет авторизацию, защиту приложения, контроль доступа на уровне сервера или WAF.
Именно здесь часто возникает ошибка. В файл добавляют общий запрет для «ботов ИИ», а через несколько недель SEO-команда замечает, что материалы перестали попадать в ответы ChatGPT. Или, наоборот, в robots.txt запрещают GPTBot и считают, что сайт больше не доступен для любых сценариев с ChatGPT.

robots.txt и AI-поиск: сначала выбрать цель, потом писать правило
Рабочая настройка начинается не с копирования чужого robots.txt, а с ответа на три вопроса.
Нужно ли показывать сайт в поисковых ответах ChatGPT
Если контент-маркетинг рассчитывает на дополнительное обнаружение материалов через AI-поиск, OAI-SearchBot нужно разрешить. По официальной документации OpenAI, сайт, отказавшийся от OAI-SearchBot, не должен показываться в поисковых ответах ChatGPT, хотя может остаться доступным как навигационная ссылка.
Для блога это особенно чувствительно на страницах, где есть самостоятельная ценность: инструкции, определения с контекстом, оригинальные исследования, публичная документация, аналитические разборы. Видимость в AI-поиске не равна переходам и не заменяет обычную поисковую оптимизацию, но закрывать этот канал без решения владельца сайта тоже не стоит.
Разрешено ли использовать контент для обучения моделей
Это отдельное решение. Если политика бренда или правообладателя не допускает такое использование, для GPTBot задают запрет. Доступ OAI-SearchBot при этом можно сохранить.
Такой подход разделяет две вещи, которые часто смешивают: участие в поисковой выдаче ChatGPT и согласие на использование материалов для обучения. Для публичного медиа или блога это может быть разумным компромиссом: статьи остаются доступными для поиска и цитирования, но команда явно сообщает позицию по GPTBot.
Требуется ли технически закрыть страницы от пользовательского запроса
Если страница содержит закрытые данные, личный кабинет, коммерческие условия для ограниченной аудитории, файлы для клиентов или другую непубличную информацию, robots.txt недостаточен. Нужны авторизация, проверка прав доступа, ограничения на уровне CDN или WAF, а также отсутствие чувствительных данных в публичной HTML-версии страницы.
ChatGPT-User важен именно в этой точке. OpenAI не обещает, что robots.txt будет применяться к запросам, инициированным пользователем. Поэтому файл robots.txt нельзя считать средством защиты закрытого контента.
Базовая схема robots.txt для сайта, который хочет присутствовать в ChatGPT Search
Для сайта, который хочет разрешить поиск ChatGPT, но не хочет разрешать GPTBot использовать контент для обучения, логика может выглядеть так:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
Это пример структуры, а не готовая политика для любого домена. Перед публикацией нужно проверить, нет ли в файле общего блока User-agent: *, который уже закрывает нужные разделы, и нет ли отдельных правил для служебных директорий.
Если сайт доступен для поисковых систем, обычно нет причин открывать для OAI-SearchBot административные разделы, страницы входа, параметры фильтрации, технические копии и URL с персональными данными. Ограничения для этих путей должны быть частью общей технической SEO-политики, а не реакцией только на AI-поиск.
Например, для публичного блога может понадобиться разрешить обход статей и категорий, но закрыть служебные разделы:
User-agent: OAI-SearchBot
Allow: /blog/
Allow: /guides/
Disallow: /admin/
Disallow: /login/
Disallow: /search/
Disallow: /?s=
Такой вариант требует проверки именно на инфраструктуре сайта. Поведение CMS, параметры URL, CDN-кэширование и уже существующие директивы могут изменить результат. Если у сайта сложная архитектура, безопаснее согласовать правило с SEO-специалистом и разработкой, а затем проверить фактические ответы сервера.
Почему не стоит добавлять ChatGPT-User в robots.txt как единственную защиту
Технически строку для ChatGPT-User добавить можно. Практической гарантии доступа она не даёт: официальная документация OpenAI говорит, что к пользовательским действиям robots.txt может не применяться.
Поэтому такая запись может служить только декларацией предпочтения, но не контролем доступа. Для чувствительных разделов полезнее проверить четыре слоя:
- Страница действительно требует авторизацию, а не просто скрыта из меню.
- Сервер не отдаёт содержимое страницы до проверки сессии.
- CDN, кэш и предпросмотры не создают публичных копий данных.
- WAF или серверные правила ограничивают нежелательные обращения, если задача связана с нагрузкой или безопасностью.
Что проверить до изменения файла
Обновление robots.txt выглядит небольшой задачей, но ошибка в одном символе может затронуть весь сайт. Перед изменением полезно собрать короткую карту текущих правил.
1. Найти фактический robots.txt
Файл должен быть доступен по адресу https://домен.ru/robots.txt. Важно проверить конечный URL после редиректов, код ответа сервера и содержимое, которое видят внешние агенты. В некоторых проектах robots.txt формируется CMS или проксируется через CDN, поэтому файл в репозитории и файл на домене могут отличаться.
2. Разобрать общие директивы
Нужно посмотреть, какие группы агентов уже есть в файле, какие разделы закрыты для User-agent: * и какие правила заданы для Googlebot или Bingbot. Добавление новой группы не должно случайно открыть технические страницы или переопределить полезные ограничения.
3. Отделить индексацию от доступа
robots.txt управляет обходом, но не всегда удаляет уже известную страницу из поисковых систем. Для страниц, которые нельзя показывать в поиске, могут потребоваться noindex, удаление URL из публичного доступа, корректные канонические адреса или работа с параметрами. Смешивать эти задачи в одном файле опасно.
4. Проверить публичность контента
Если маркетинговая команда тревожится из-за того, что ChatGPT может прочитать страницу по ссылке, сначала нужно проверить саму страницу без авторизации и в режиме инкогнито. Публичный URL нельзя сделать закрытым только директивой для робота.

Как измерять эффект для digital-маркетинга и аналитики соцсетей
После изменения robots.txt не стоит ожидать мгновенных выводов по трафику. OpenAI указывает, что адаптация поисковых систем к обновлению robots.txt может занять около 24 часов. Но и после этого связь между разрешением OAI-SearchBot, появлением в ответах и переходами не будет линейной.
Нужна отдельная наблюдаемость, иначе дискуссия об AI-видимости быстро превращается в набор скриншотов из чатов.
Логи сервера и CDN
Первый источник — журналы обращений. В них стоит отслеживать запросы с заявленными агентами OAI-SearchBot, GPTBot и ChatGPT-User, путь запроса, код ответа, частоту и IP-адреса. OpenAI публикует диапазоны IP-адресов для своих агентов; при необходимости это позволяет команде инфраструктуры проверять подлинность запросов, а не доверять только строке User-Agent.
Логи не измеряют охваты в ответах ChatGPT, но помогают ответить на базовые вопросы: обращался ли агент к нужной странице, не получает ли он 403 или 5xx, не упирается ли обход в редирект или блокировку CDN.
Органический трафик и брендовый поиск
Далее нужны привычные показатели SEO: органические показы, переходы, доля брендовых запросов, страницы входа и качество сессий. Изменение robots.txt не следует объявлять причиной роста или падения без контрольного периода: на эти метрики влияют сезонность, обновления поисковиков, публикации и работа конкурентов.
Полезно помечать дату изменения в журнале SEO-экспериментов и сравнивать динамику на уровне групп страниц, а не только общего трафика сайта. Например, отдельно смотреть базу знаний, статьи блога и продуктовые страницы.
Упоминания и репутационные сигналы
AI-поиск влияет не только на клики. Материалы бренда могут становиться источником для ответов, а пользователи — обсуждать или пересказывать эти ответы в соцсетях и Telegram. Здесь пригодятся мониторинг бренда и аналитика соцсетей: отслеживание названия компании, названий продуктов, ссылок на ключевые материалы и формулировок, которые команда использует в экспертных статьях.
FollowPulse помогает собирать упоминания бренда и отслеживать динамику публикаций в соцсетях и Telegram. Для команды это способ связать техническое решение по AI-видимости с фактическими репутационными и контентными сигналами, а не оценивать его по отдельным примерам.
Типичные ошибки при настройке доступа для AI-поиска
Блокировать GPTBot и считать, что сайт исчез из ChatGPT Search. За присутствие в поисковых ответах отвечает OAI-SearchBot. Запрет GPTBot относится к другому сценарию.
Открывать все URL ради AI-видимости. Публичными для обхода должны быть полезные канонические страницы. Фильтры, служебные параметры, поиск по сайту и личные разделы не получают ценность от дополнительного обхода.
Считать robots.txt системой безопасности. Директива не заменяет авторизацию. Если данные нельзя раскрывать, их не должно быть на публичной странице.
Проверять только строку User-Agent. Её легко подделать. Для критичных решений стоит сопоставлять запросы с опубликованными диапазонами IP, а правила WAF тестировать на ограниченной группе запросов.
Менять файл без наблюдения. После публикации нужно проверить ответ robots.txt, коды ответов целевых страниц, логи и доступность sitemap. Иначе проблема может остаться незамеченной до следующего технического аудита.
Переносить правила одного AI-сервиса на другой. У провайдеров различаются названия агентов, цели обхода и отношение к robots.txt. Политика должна строиться по функциям конкретного агента, а не по общему ярлыку «ИИ-бот».
Чеклист
- Зафиксировать цель: разрешить AI-поиск, запретить обучение моделей, снизить нагрузку или закрыть приватный раздел.
- Проверить опубликованный
robots.txtна основном домене и все существующие общие директивы. - Отдельно настроить GPTBot и OAI-SearchBot в соответствии с выбранной политикой.
- Не считать правило для ChatGPT-User надёжной защитой; закрытые страницы перевести за авторизацию и проверить серверный доступ.
- Проверить, что целевые статьи отдают корректный HTTP-ответ, канонический URL и доступны без технических блокировок.
- После изменения изучить логи сервера или CDN, включая коды ответа и реальные пути запросов агентов.
- Зафиксировать дату обновления и наблюдать органический трафик, брендовые упоминания и контентные сигналы отдельно от краткосрочных колебаний.
FAQ
Нужно ли разрешать GPTBot, чтобы статьи попадали в поиск ChatGPT
Нет. По документации OpenAI, для показа сайтов в поисковых функциях ChatGPT используется OAI-SearchBot. GPTBot связан с обходом контента, который может использоваться для обучения базовых моделей.
Можно ли запретить ChatGPT читать сайт через robots.txt
Полагаться на это как на защиту нельзя. OpenAI пишет, что для ChatGPT-User правила robots.txt могут не применяться, потому что запрос инициирован пользователем. Для закрытого содержимого нужны авторизация и серверные ограничения.
Что произойдёт, если запретить OAI-SearchBot
OpenAI сообщает, что сайты, отказавшиеся от OAI-SearchBot, не будут показываться в поисковых ответах ChatGPT. При этом сайт может по-прежнему отображаться как навигационная ссылка.
Через сколько обновится доступ после изменения robots.txt
OpenAI указывает ориентир около 24 часов для адаптации поисковых систем к обновлению robots.txt. Реальный результат зависит от обхода конкретных URL, доступности сервера и состояния кэшей.
Нужно ли открывать для OAI-SearchBot все страницы сайта
Нет. Разрешать стоит канонические публичные страницы, которые полезны для обнаружения: статьи, справочные материалы, продуктовые страницы. Личные кабинеты, административные пути, технические параметры и внутренний поиск лучше обрабатывать по общей политике технического SEO и безопасности.
Как проверить, что запрос действительно пришёл от OpenAI
Строки User-Agent недостаточно. OpenAI публикует IP-диапазоны для своих агентов. Для технической проверки нужно сопоставить журнал запроса с актуальными опубликованными диапазонами и правилами инфраструктуры.
Короткая политика доступа для AI-поиска экономит часы спорной диагностики: разделить GPTBot, OAI-SearchBot и ChatGPT-User, затем проверить это по логам и метрикам. FollowPulse поможет дополнить техническую проверку мониторингом бренда и Telegram Analytics.
Пользуйся FollowPulse и получай:
- Аналитику соцсетей
- Умный поиск информации
- Рост своего бренда
Пробный доступ — от 10 рублей.
Комментарии
Комментариев - 0