Рабочее значение

Краулер следует набору URL, получает HTTP-ответы и может передавать содержимое в следующий этап системы. Разные роботы одного провайдера могут иметь разные назначения: поиск, обучение модели или пользовательский fetch. Поэтому имя провайдера нельзя использовать как единственную классификацию.

Источники раздела:[1] Google Search Central[2] OpenAI Developers

Как отличать

Краулер не равен браузеру человека, индексатору или retrieval-компоненту. Сервер видит сетевой запрос, статус и переданные заголовки, но обычно не видит, сохранила ли система документ, по какому запросу его выбрала или показала ли пользователю.

Источники раздела:[1] Google Search Central[2] OpenAI Developers

Пример

Запрос с User-Agent OAI-SearchBot и HTTP 200 показывает, что клиент с таким заголовком получил страницу. Чтобы назвать его подтверждённым OpenAI-ботом, нужно дополнительно сверить адрес по официальной процедуре; даже после этого событие остаётся fetch, а не citation.

Проверка

Сохраняйте время, URL, статус, объём ответа, User-Agent и приватно обработанный сетевой идентификатор. Проверяйте официальный список ботов, CIDR или forward-confirmed reverse DNS. Отдельно отмечайте spoofed или неподтверждённую автоматизацию.

Предел интерпретации

Отсутствие визита в коротком окне не означает, что страница неизвестна системе: она могла быть получена раньше, через другой URL или другой компонент. Визит также не доказывает хранение, положительную оценку качества или использование текста в ответе.

Что это не доказывает

  • Проверка личности зависит от опубликованных провайдером механизмов и полноты логов. Прокси, кэши и неполные IP-списки могут оставлять событие в категории вероятной или подозрительной автоматизации.

Источники

  1. 1
    Google Search technical requirementsGoogle Search Central · official · 11 сент. 2026 г.
  2. 2
    Overview of OpenAI crawlersOpenAI Developers · official · 11 сент. 2026 г.

История исправлений

Существенных исправлений пока нет.