{
  "@context": "https://schema.org",
  "@type": "DefinedTerm",
  "schema_version": "1.1",
  "content_item_id": "dictionary-crawler.ru",
  "translation_group_id": "dictionary-crawler",
  "locale": "ru",
  "type": "glossary",
  "section": "dictionary",
  "slug": "crawler",
  "title": "краулер — Crawler",
  "description": "Краулер — автоматизированный клиент, который запрашивает URL для обнаружения, обновления или другого документированного назначения. Совпадение User-Agent недостаточно для подтверждения личности робота, а успешный запрос доказывает только получение ответа сервером — не индексирование, retrieval или цитирование.",
  "direct_answer": "Краулер — автоматизированный клиент, который запрашивает URL для обнаружения, обновления или другого документированного назначения. Совпадение User-Agent недостаточно для подтверждения личности робота, а успешный запрос доказывает только получение ответа сервером — не индексирование, retrieval или цитирование.",
  "sections": [
    {
      "heading": "Рабочее значение",
      "paragraphs": [
        "Краулер следует набору URL, получает HTTP-ответы и может передавать содержимое в следующий этап системы. Разные роботы одного провайдера могут иметь разные назначения: поиск, обучение модели или пользовательский fetch. Поэтому имя провайдера нельзя использовать как единственную классификацию."
      ],
      "source_ids": [
        "google-crawl",
        "openai-bots"
      ]
    },
    {
      "heading": "Как отличать",
      "paragraphs": [
        "Краулер не равен браузеру человека, индексатору или retrieval-компоненту. Сервер видит сетевой запрос, статус и переданные заголовки, но обычно не видит, сохранила ли система документ, по какому запросу его выбрала или показала ли пользователю."
      ],
      "source_ids": [
        "google-crawl",
        "openai-bots"
      ]
    },
    {
      "heading": "Пример",
      "paragraphs": [
        "Запрос с User-Agent OAI-SearchBot и HTTP 200 показывает, что клиент с таким заголовком получил страницу. Чтобы назвать его подтверждённым OpenAI-ботом, нужно дополнительно сверить адрес по официальной процедуре; даже после этого событие остаётся fetch, а не citation."
      ]
    },
    {
      "heading": "Проверка",
      "paragraphs": [
        "Сохраняйте время, URL, статус, объём ответа, User-Agent и приватно обработанный сетевой идентификатор. Проверяйте официальный список ботов, CIDR или forward-confirmed reverse DNS. Отдельно отмечайте spoofed или неподтверждённую автоматизацию."
      ]
    },
    {
      "heading": "Предел интерпретации",
      "paragraphs": [
        "Отсутствие визита в коротком окне не означает, что страница неизвестна системе: она могла быть получена раньше, через другой URL или другой компонент. Визит также не доказывает хранение, положительную оценку качества или использование текста в ответе."
      ]
    }
  ],
  "published_at": "2026-09-11",
  "modified_at": "2026-09-11",
  "data_through": "2026-09-11",
  "next_review_at": "2026-10-11",
  "author": "GeoAeoAle Editorial",
  "origin": "editorial",
  "publisher": "GeoAeoAle Editorial",
  "license": "https://creativecommons.org/licenses/by/4.0/",
  "canonical_url": "https://geoaeoale.com/ru/dictionary/crawler/",
  "claims": [
    {
      "claim_id": "crawler-scope",
      "text": "Подтверждённый визит краулера требует сочетания заявленного User-Agent с официальным IP-диапазоном или проверенным rDNS, если платформа публикует такой метод.",
      "status": "inference",
      "confidence": "medium",
      "source_ids": [
        "google-crawl",
        "openai-bots"
      ],
      "publication_status": "public",
      "confidentiality": "public"
    }
  ],
  "sources": [
    {
      "source_id": "google-crawl",
      "canonical_url": "https://developers.google.com/search/docs/essentials/technical",
      "title": "Google Search technical requirements",
      "publisher": "Google Search Central",
      "source_type": "official",
      "locale": "en",
      "published_at": null,
      "checked_at": "2026-09-11",
      "sha256": "5fff9bd0dd8ef5fe14fdbc1b7debbf79ef3b8b6b507b21b87ac5e62b2ba25b30",
      "license": "Source terms apply",
      "visibility": "public"
    },
    {
      "source_id": "openai-bots",
      "canonical_url": "https://developers.openai.com/api/docs/bots",
      "title": "Overview of OpenAI crawlers",
      "publisher": "OpenAI Developers",
      "source_type": "official",
      "locale": "en",
      "published_at": null,
      "checked_at": "2026-09-11",
      "sha256": "ccbdef3018bd08dceaacb7fe0ea07a2020d25e201ab84aa44625827aac925440",
      "license": "Source terms apply",
      "visibility": "public"
    }
  ],
  "related_slugs": [
    "ai-visibility",
    "retrieval",
    "source-attribution"
  ],
  "limitations": [
    "Проверка личности зависит от опубликованных провайдером механизмов и полноты логов. Прокси, кэши и неполные IP-списки могут оставлять событие в категории вероятной или подозрительной автоматизации."
  ],
  "corrections": []
}