Рабочее значение
Краулер следует набору URL, получает HTTP-ответы и может передавать содержимое в следующий этап системы. Разные роботы одного провайдера могут иметь разные назначения: поиск, обучение модели или пользовательский fetch. Поэтому имя провайдера нельзя использовать как единственную классификацию.
Источники раздела:[1] Google Search Central[2] OpenAI Developers
Как отличать
Краулер не равен браузеру человека, индексатору или retrieval-компоненту. Сервер видит сетевой запрос, статус и переданные заголовки, но обычно не видит, сохранила ли система документ, по какому запросу его выбрала или показала ли пользователю.
Источники раздела:[1] Google Search Central[2] OpenAI Developers
Пример
Запрос с User-Agent OAI-SearchBot и HTTP 200 показывает, что клиент с таким заголовком получил страницу. Чтобы назвать его подтверждённым OpenAI-ботом, нужно дополнительно сверить адрес по официальной процедуре; даже после этого событие остаётся fetch, а не citation.
Проверка
Сохраняйте время, URL, статус, объём ответа, User-Agent и приватно обработанный сетевой идентификатор. Проверяйте официальный список ботов, CIDR или forward-confirmed reverse DNS. Отдельно отмечайте spoofed или неподтверждённую автоматизацию.
Предел интерпретации
Отсутствие визита в коротком окне не означает, что страница неизвестна системе: она могла быть получена раньше, через другой URL или другой компонент. Визит также не доказывает хранение, положительную оценку качества или использование текста в ответе.
Что это не доказывает
- Проверка личности зависит от опубликованных провайдером механизмов и полноты логов. Прокси, кэши и неполные IP-списки могут оставлять событие в категории вероятной или подозрительной автоматизации.
Источники
- 1Google Search technical requirementsGoogle Search Central · official · 11 сент. 2026 г.
- 2Overview of OpenAI crawlersOpenAI Developers · official · 11 сент. 2026 г.
История исправлений
Существенных исправлений пока нет.