Check if your brand is visible to AI Search

GPTBot: веб-краулеры OpenAI и что они означают для вашего сайта

Руководство по пользовательскому агенту GPTBot, OAI-SearchBot и правилам OpenAI GPTBot robots.txt, которые определяют, будет ли…

Published: 12 июля, 2026 - Updated: 13 июля, 2026

2 минут на чтение

У Вас есть вопрос?

Не уверены, блокирует ли ваш robots.txt цитирование в ChatGPT?

Если вы недавно проверяли журналы сервера, вы, вероятно, видели GPTBot. Меньше людей замечают его более тихого собрата, OAI-SearchBot, находящегося рядом с ним и выполняющего другую работу. Путаница между ними — самая распространённая ошибка в настройках AI robots.txt, и она незаметно лишает сайты их цитирования в ChatGPT, при этом никто не понимает почему.

Два краулера чётко разделены по одной линии: обучение против поиска. Ошибитесь с этой линией в robots.txt, и вы можете потерять цитирование, от которого никогда не собирались отказываться.


GPTBot против OAI-SearchBot: два разных краулера OpenAI

GPTBot и OAI-SearchBot — это отдельные краулеры с отдельными задачами: GPTBot собирает контент для обучения моделей OpenAI, в то время как OAI-SearchBot индексирует страницы, чтобы ChatGPT мог извлекать и цитировать их в ответах поиска. Рассматривать их как один «бот OpenAI» — вот где большинство файлов robots.txt ошибаются.

OpenAI использует небольшое семейство пользовательских агентов, и разделение между обучением и поиском является намеренным. Согласно собственной документации краулеров OpenAI, каждая настройка независима: веб-мастер может разрешить OAI-SearchBot появляться в результатах поиска, одновременно запрещая GPTBot, чтобы исключить контент из обучения модели. Это вся стратегическая головоломка, которую упускают большинство SEO-команд.

На самом деле существует четыре агента OpenAI, о которых стоит знать, а не два:

  • GPTBot: массовый краулер, питающий конвейер обучения OpenAI.
  • OAI-SearchBot: индексирует страницы специально для функций поиска и цитирования ChatGPT.
  • ChatGPT-User: срабатывает только тогда, когда реальный пользователь просит ChatGPT получить конкретный URL в режиме реального времени.
  • OAI-AdsBot: проверяет целевые страницы объявлений, отправленных в ChatGPT, на соответствие политике. Он посещает только страницы, отправленные в качестве объявлений, и согласно документации OpenAI, его данные также не используются для обучения модели.
Матрица 2x2, классифицирующая четыре краулера OpenAI — GPTBot, OAI-SearchBot, ChatGPT-User и OAI-AdsBot — по типу триггера сканирования и тому, используется ли каждый для обучения модели AI.

Большинство руководств, опубликованных в 2023–2024 годах, упоминают только GPTBot, потому что OAI-SearchBot ещё не существовал. Если ваш robots.txt не обновлялся с тех пор, есть большая вероятность, что он незаметно блокирует именно тот краулер, который отвечает за ваше цитирование в ChatGPT сегодня.


Что делает каждый краулер и почему это важно

GPTBot собирает веб-контент, который может использоваться для обучения и улучшения генеративных AI-моделей OpenAI. OAI-SearchBot создаёт индекс в реальном времени, который обеспечивает функции поиска и цитирования ChatGPT, и он вообще не используется для обучения. Практическая разница: один влияет на то, что модель знает в долгосрочной перспективе, другой влияет на то, появляетесь ли вы прямо сейчас.

Блок-схема, сравнивающая конвейер обучения GPTBot с конвейером цитирования OAI-SearchBot, показывающая, как robots.txt независимо блокирует каждый краулер OpenAI.

GPTBot (текущий пользовательский агент: GPTBot/1.4, полная строка: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot) существует для питания конвейера обучения OpenAI и ничего больше. Заблокируйте его, и ваш контент не будет обучать будущие модели. Он не влияет на поиск ChatGPT; это отдельная система.

OAI-SearchBot (текущий пользовательский агент: OAI-SearchBot/1.4; его полная строка длиннее, чем у GPTBot, используя префикс в стиле Chrome: Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot) моложе, более целенаправлен и сканирует для поддержания свежего индекса для ответов в реальном времени. Блокировка его не защищает вашу интеллектуальную собственность от обучения. Она полностью удаляет вас из поверхности ответов ChatGPT. Если ваша цель — видимость в AI-поиске, это краулер, который имеет значение. Номера версий обоих агентов периодически меняются, поэтому сопоставляйте по подстроке GPTBot или OAI-SearchBot, а не привязывайтесь к точной строке версии.

ChatGPT-User (пользовательский агент: ChatGPT-User/1.0) — это исключение. Это вообще не автоматическое сканирование. Он срабатывает только тогда, когда кто-то вводит ваш URL в ChatGPT и просит модель прочитать его, или взаимодействует с пользовательским GPT через GPT Actions. OpenAI прямо об этом говорит: поскольку эти запросы инициируются пользователем, правила robots.txt могут даже не применяться к ним так, как они применяются к автоматическим краулерам. Блокировка его редко полезна. Она может нарушить запрос, который пользователь явно запросил, и это не точка контроля для отказа от поиска в любом случае; это работа OAI-SearchBot.

КраулерПользовательский агент (основная строка)НазначениеИспользуется для обучения?Влияет на цитирование в ChatGPT?
GPTBotGPTBot/1.4Массовое сканирование для обучения моделиДаНет (только косвенно)
OAI-SearchBotOAI-SearchBot/1.4Индексирование поиска в реальном времениНетДа, напрямую
ChatGPT-UserChatGPT-User/1.0Запрос страницы, инициированный пользователемНетНет, robots.txt может даже не применяться
OAI-AdsBotOAI-AdsBot/1.0Проверяет целевые страницы объявлений на соответствие политикеНетНет

Вывод: это независимые рычаги, а не один переключатель. Управляйте ими отдельно, и вы контролируете, как экосистема OpenAI взаимодействует с вашим сайтом.


Конфигурация robots.txt: разрешить один, заблокировать другой

Вы настраиваете GPTBot и OAI-SearchBot независимо в одном файле robots.txt, используя отдельные блоки User-agent. Разрешение одного и запрет другого не влияет на поведение другого. Это конфигурация, которую большинство контент-ориентированных сайтов должны использовать в 2026 году: оставаться подходящими для цитирования, отказаться от обучения.

Рекомендуемая настройка для большинства издателей, видимых в поиске ChatGPT, отказавшихся от обучения:

# Allow ChatGPT search citations
User-agent: OAI-SearchBot
Allow: /
# Allow user-triggered fetches (someone pastes your URL into ChatGPT)
User-agent: ChatGPT-User
Allow: /
# Opt out of training data collection
User-agent: GPTBot
Disallow: /

Максимальная видимость AI: разрешить оба краулера, принять, что контент также может использоваться для обучения:

User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /

Полный отказ: нет цитирования, нет обучения, обычно зарезервировано для контента за платным доступом или регулируемого контента:

User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /

Гибридный контроль на уровне путей. Многие корпоративные сайты не принимают решение «всё или ничего». Они открывают блог и документацию и блокируют области учётных записей и внутренние инструменты:

User-agent: GPTBot
Disallow: /account/
Disallow: /checkout/
Disallow: /internal-kb/
Allow: /
User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /checkout/
Disallow: /internal-kb/
Allow: /

Несколько вещей, которые стоит знать, прежде чем вы отправите любую из этих конфигураций:

  • robots.txt — это запрос, а не механизм принуждения. Хорошо воспитанные краулеры соблюдают его, но сам по себе он не имеет юридической силы.
  • Ожидайте примерно 24 часа, чтобы системы OpenAI отразили изменение robots.txt в поведении, связанном с поиском.
  • Правила на уровне каталогов работают только в том случае, если они находятся под правильным блоком User-agent. Случайный Allow: / под неправильным агентом отменяет ваше намерение.

Проверка: диапазоны IP и шаблоны сканирования

Вы проверяете краулер, утверждающий, что он GPTBot или OAI-SearchBot, сопоставляя запрос с опубликованными диапазонами IP OpenAI, а не доверяя только строке пользовательского агента. Пользовательские агенты могут быть подделаны; диапазоны IP подделать гораздо сложнее. OpenAI публикует машиночитаемые JSON-файлы для каждого агента специально для того, чтобы эту проверку можно было автоматизировать.

Опубликованные диапазоны находятся по предсказуемым URL:

  • openai.com/gptbot.json (диапазоны GPTBot)
  • openai.com/searchbot.json (диапазоны OAI-SearchBot)
  • openai.com/chatgpt-user.json (диапазоны ChatGPT-User)
Справочная таблица пользовательских агентов краулеров OpenAI и JSON-файлов диапазонов IP для GPTBot, OAI-SearchBot, ChatGPT-User и OAI-AdsBot, показывающая, какие краулеры используются для обучения модели AI.

Практический рабочий процесс проверки выглядит следующим образом:

  1. Поиск в журналах доступа к серверу соответствующей подстроки (GPTBot, OAI-SearchBot, ChatGPT-User).
  2. Извлечение запрашивающего IP из каждой соответствующей строки журнала.
  3. Перекрёстная проверка этого IP с соответствующим файлом диапазона JSON.
  4. Отметка любого запроса, который утверждает, что является краулером OpenAI, но не соответствует опубликованному диапазону. Это поддельный или несвязанный бот, а не OpenAI.

Одна деталь, которая сбивает с толку аудиты журналов: когда GPTBot или OAI-SearchBot получают сам файл robots.txt, документация OpenAI отмечает, что они могут добавить дополнительный маркер robots.txt к строке пользовательского агента, специально для того, чтобы журналы без полных данных о пути всё ещё могли отличить проверку robots.txt от обычного запроса страницы. Если вы ищете в журналах только по пользовательскому агенту, учитывайте этот маркер, иначе вы можете дважды подсчитать или неправильно классифицировать запросы.

О шаблонах сканирования: OpenAI заявил, что если сайт разрешает как GPTBot, так и OAI-SearchBot, он может повторно использовать результаты одного сканирования для обеих целей, а не сканировать одни и те же страницы дважды. Идентичные следы сканирования для обоих агентов не обязательно означают два отдельных прохода. Не читайте объём сканирования как показатель того, какой агент «более агрессивен». Проверьте, какой агент фактически попадает в ваши журналы, и сопоставьте эти IP с опубликованными диапазонами.


Влияние на цитирование в ChatGPT

Блокировка OAI-SearchBot удаляет ваш контент из ответов поиска ChatGPT, даже если GPTBot уже сканировал и обучался на тех же страницах в другом месте. Согласно документации OpenAI, сайт, отказавшийся от участия, не будет отображаться в цитируемых ответах поиска, хотя он всё ещё может появиться как простая навигационная ссылка. Отказ влияет на включение уровня цитирования, а не на каждое упоминание. Это разрушает старое предположение: «если AI уже знает о моём сайте, я защищён». В 2026 году знание и цитирование — это отдельные системы.

Несколько последствий, которые стоит усвоить:

  • Сайт может быть «известен» модели и всё ещё невидим в ответах поиска. Данные обучения и индекс цитирования в реальном времени не взаимодействуют друг с другом.
  • Разрешение GPTBot не влияет на то, цитируют ли вас сегодня. Обучение влияет на будущую версию модели, а не на результаты поиска ChatGPT на этой неделе.
  • Файл robots.txt, унаследованный от шаблона 2023 года, является распространённой, невидимой причиной отсутствия цитирования. OAI-SearchBot не существовал, когда многие из этих файлов были написаны, поэтому он часто попадает под общее правило «блокировать все боты OpenAI», которое предшествует ему.
  • Блокировка на уровне путей всё ещё применяется. Если OAI-SearchBot разрешён на всём сайте, но заблокирован на вашем лучшем длинном контенте, этот контент не появится в ответах ChatGPT, независимо от того, насколько он силён.

Если ваша контент-стратегия зависит от видимости в AI-поиске, а для большинства конкурентных ниш в 2026 году это всё больше так, доступ OAI-SearchBot не является необязательным. Это единственная строка конфигурации, которая определяет, есть ли у вашей лучшей работы шанс быть процитированной вообще.


Проверьте настройку видимости вашего AI

Прочитать контрольный список — это одно; знать, правильно ли настроен ваш собственный сайт — другое. Неправильно настроенные правила robots.txt, устаревшие шаблоны «блокировать весь AI» и ошибки на уровне путей достаточно распространены, чтобы угадывание не было надёжной стратегией.

Инструмент AI Visibility от ICODA проверяет именно это: доступен ли ваш сайт для OAI-SearchBot и других краулеров, которые определяют право на цитирование AI, и где находятся пробелы. Если GPTBot и OAI-SearchBot были одной недифференцированной строкой в вашем файле robots.txt, стоит потратить пять минут, чтобы подтвердить, что вы случайно не отказываетесь от цитирования, которое вам нужно.


Часто задаваемые вопросы

Нет, блокировка GPTBot не влияет на Google. OpenAI и Google используют совершенно отдельные краулеры и отдельные системы, поэтому правило запрета GPTBot не затрагивает ваши рейтинги. Единственный способ, которым вы можете пострадать, — это если вы используете ленивый блок User-agent: *, который захватывает Googlebot вместе с GPTBot. Проверьте свой robots.txt построчно — если у GPTBot есть свой собственный выделенный блок, всё в порядке.

Robots.txt не имеет юридической силы, это правда, это запрос, а не замок. Но OpenAI на практике соблюдал его, и вы можете проверить фактический трафик GPTBot или OAI-SearchBot по их опубликованным диапазонам IP, чтобы подтвердить, что они соблюдают ваши правила. Реальный риск не в том, что OpenAI игнорирует robots.txt, а в том, что какой-то другой бот подделывает строку пользовательского агента, чтобы обойти фильтры, которые проверяют только имя. Если вы хотите уверенности, проверяйте IP, а не только пользовательский агент.

Нет, блокировка его сейчас только останавливает будущие сканирования, она не стирает то, что уже встроено в обученную модель. Обучение происходит циклами, поэтому всё, что GPTBot захватил до того, как вы его заблокировали, всё ещё может проявляться в поведении модели в течение месяцев или дольше. Если ваша цель — «удалить мой старый контент из данных обучения ChatGPT», robots.txt не может сделать это ретроактивно. Что он может сделать, так это остановить попадание нового контента в будущем.

Вероятно, нет, и блокировка его обычно имеет обратный эффект. ChatGPT-User срабатывает только тогда, когда реальный человек вставляет ваш URL в ChatGPT и просит его прочитать страницу, поэтому блокировка его просто нарушает запрос, который кто-то явно запросил. Это не имеет ничего общего с обучением, и это также не рычаг отказа от цитирования в поиске, это работа OAI-SearchBot. Сохраните свои усилия по блокировке для GPTBot или OAI-SearchBot в зависимости от того, что вы на самом деле пытаетесь контролировать.

Да, именно для этого и созданы эти два краулера. Запретите GPTBot, чтобы отказаться от обучения, и отдельно разрешите OAI-SearchBot, чтобы ваши страницы оставались подходящими для цитирования в ответах поиска ChatGPT. Это не один переключатель, это независимые настройки в одном файле robots.txt. Компромисс заключается в том, что вы доверяете разделению OpenAI фактически действовать на практике, и OpenAI заявил, что две системы не пересекаются, но вы полагаетесь на их слово в этом.

Поделиться

Оцените статью

Rate this post