{
  "@context": "https://schema.org",
  "@type": "Report",
  "schema_version": "1.1",
  "content_item_id": "weekly-research-2026-08-03.ru",
  "translation_group_id": "weekly-research-2026-08-03",
  "locale": "ru",
  "type": "research",
  "section": "research",
  "slug": "weekly-research-2026-08-03",
  "title": "Еженедельный GEO-ресерч: доступность для обхода — это несколько разных политик",
  "description": "Как разделять поисковый, обучающий, агентный и рекламный доступ к сайту.",
  "direct_answer": "Политика доступа к сайту должна описывать конкретного робота и цель его визита. Разрешение или запрет одного User-Agent не даёт общего вывода о поисковой индексации, обучении, агентном fetch или рекламе.",
  "sections": [
    {
      "heading": "Исследовательский вопрос и рынок",
      "paragraphs": [
        "Этот выпуск рассматривает практическую ошибку «разрешить всех AI-ботов» или «запретить всех AI-ботов». В реальности публичный сайт может быть нужен поиску, answer-engine, обучающему сборщику, агенту, рекламной системе и мониторингу, причём у каждого класса свои цели и политика. Официальные документы OpenAI и Google дают названия и назначение части роботов, но не раскрывают полный путь от обхода к ответу. Поэтому результатом исследования является матрица решений, а не обещание индексации."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots",
        "google-robots"
      ]
    },
    {
      "heading": "Классы доступа OpenAI",
      "paragraphs": [
        "OpenAI отдельно описывает поисковые, пользовательские и обучающие сценарии. Это означает, что владелец сайта может принять разные решения: разрешать поисковому роботу для обнаружения страниц, не разрешать сборщик обучения, ограничивать агентный fetch или оставить его открытым для конкретного опыта. Название User-Agent само по себе недостаточно: проверяйте официальные диапазоны IP или reverse DNS там, где оператор их публикует, и не доверяйте произвольной строке заголовка. Политика должна быть версионированной и объяснять, зачем принято каждое правило."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots"
      ]
    },
    {
      "heading": "robots.txt и его пределы",
      "paragraphs": [
        "Google определяет robots.txt как способ сообщить краулеру, какие пути можно обходить. Это не пароль, не удаление уже известного URL и не гарантия, что поисковая система не сохранит заголовок или ссылку. Закрытый путь также может быть доступен обычному пользователю, если нет авторизации. Для приватных материалов нужен контроль доступа на сервере. Для публичных страниц robots.txt следует проверять вместе с HTTP-ответом, canonical, sitemap, noindex и фактическим обходом. Иначе одна строка robots.txt будет неправильно описана как полная политика видимости."
      ],
      "source_ids": [
        "google-robots",
        "google-crawl"
      ]
    },
    {
      "heading": "Поиск, обучение, агент и реклама",
      "paragraphs": [
        "Четыре решения нельзя объединять в один переключатель. Поисковый обход связан с обнаружением и индексными сигналами; обучение — с отдельной лицензией или политикой использования данных; пользовательский fetch — с конкретным запросом человека; рекламный бот — с оценкой рекламного размещения. Разрешение одного класса не означает, что сайт будет процитирован. Запрет другого класса не означает исчезновение домена из всех поверхностей. В публичной документации нужно показывать таблицу «цель → робот → разрешение → что это не доказывает»."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots",
        "google-robots",
        "google-crawl"
      ]
    },
    {
      "heading": "Как проверять на практике",
      "paragraphs": [
        "Проверка начинается с inventory URL и ожидаемых статусов. Для каждого оператора сохраните User-Agent, дату, IP-проверку, URL, HTTP-код, redirect chain, размер ответа и наличие закрывающих директив. Отдельно проверьте страницу через обычный браузер и через авторизованный тестовый путь. Не отправляйте в публичный pipeline закрытые снимки или клиентские URL. Если CDN выдаёт challenge, это наблюдение о доступности, но не доказательство запрета со стороны оператора. Повторяйте тест после изменения правила и храните diff."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots",
        "google-robots",
        "google-crawl"
      ]
    },
    {
      "heading": "Ошибки интерпретации",
      "paragraphs": [
        "Самая опасная ошибка — назвать отсутствие визита доказательством отсутствия в AI-ответах. Другие ошибки: считать User-Agent подлинным без проверки IP, считать разрешение robots.txt гарантией crawl, смешивать OpenAI SearchBot и GPTBot, публиковать закрытый источник через sidecar, а также использовать общий score для технической доступности и фактической цитаты. Каждое утверждение должно иметь уровень: observed, inference или hypothesis. Если данных недостаточно, правильное значение — unknown, а не ноль."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots",
        "google-robots",
        "google-crawl"
      ]
    },
    {
      "heading": "Вывод и пересмотр",
      "paragraphs": [
        "Публичная политика GeoAeoAle должна быть адресной: перечислять классы доступа, цель, техническое правило и границу вывода. Контент можно разрешать поиску и пользователю, не открывая закрытые артефакты и не обещая цитирование. Следующий пересмотр нужен при изменении документации, IP-диапазонов, CDN-политики или появлении нового типа робота. Дата 11 октября 2026 года — контрольная точка, а не декоративная дата обновления."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots",
        "google-robots",
        "google-crawl"
      ]
    },
    {
      "heading": "Решение для редакционного реестра",
      "paragraphs": [
        "Реестр должен хранить не только allow или deny, но и цель правила, дату проверки и фактический результат. Для одного URL полезно иметь отдельные строки для поискового краулера, пользовательского fetch и обучающего сбора; рядом указывается, подтверждён ли оператор официальным диапазоном IP или reverse DNS. При изменении CDN, WAF или robots.txt старую запись нельзя перезаписывать без истории. Это позволяет сравнить обещанную политику с реальным HTTP-доступом и не публиковать громкий вывод по одному заголовку. В публичной статье такая схема превращает техническое решение в воспроизводимую процедуру: читатель видит, что проверялось, когда, каким способом и какой вывод всё ещё недоступен."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots",
        "google-robots",
        "google-crawl"
      ]
    },
    {
      "heading": "Контрольный список перед публикацией",
      "paragraphs": [
        "Перед публикацией редактор должен ответить на четыре вопроса. Какая именно цель доступа описывается: поиск, обучение, пользовательский запрос, агент или реклама? Какой оператор и какой путь подтверждены документом? Что реально наблюдалось в HTTP или в интерфейсе, а что осталось неизвестным? И какая дата следующего пересмотра нужна, если политика или инфраструктура изменятся? Ответы записываются рядом с claim, а не прячутся в техническом приложении. Такой контроль защищает читателя от распространённой ошибки: превратить разрешение robots.txt в обещание индексации или принять один неудачный запрос за полное отсутствие страницы. Он также делает еженедельный выпуск полезным для инженера: из текста можно сразу извлечь тест, ожидаемый результат и условие остановки."
      ],
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots",
        "google-robots",
        "google-crawl"
      ]
    },
    {
      "heading": "Редакционная репликация",
      "paragraphs": [
        "Публичная документация описывает границы доступа, но не раскрывает весь внутренний путь выбора источника. Поэтому корректная публикация должна показывать конкретную формулировку документа, дату проверки и область, на которую она распространяется. Там, где документация молчит, мы используем метку unknown и предлагаем воспроизводимый тест. Это сохраняет пользу материала и не превращает предположение о поведении краулера в факт."
      ]
    }
  ],
  "published_at": "2026-08-03",
  "modified_at": "2026-08-03",
  "data_through": "2026-08-03",
  "next_review_at": "2026-10-11",
  "author": "GeoAeoAle Editorial",
  "origin": "editorial",
  "topics": [
    "weekly-research"
  ],
  "publisher": "GeoAeoAle Editorial",
  "license": "https://creativecommons.org/licenses/by/4.0/",
  "canonical_url": "https://geoaeoale.com/ru/research/weekly-research-2026-08-03/",
  "claims": [
    {
      "claim_id": "wr0803-policy",
      "text": "Разные классы роботов OpenAI имеют разные цели и требуют раздельной политики.",
      "status": "observed",
      "confidence": "high",
      "source_ids": [
        "openai-publishers-faq-2026-08-03",
        "openai-bots"
      ],
      "publication_status": "public",
      "confidentiality": "public"
    },
    {
      "claim_id": "wr0803-boundary",
      "text": "robots.txt задаёт инструкции обхода, но не является механизмом авторизации или гарантией индексации.",
      "status": "observed",
      "confidence": "high",
      "source_ids": [
        "google-robots",
        "google-crawl"
      ],
      "publication_status": "public",
      "confidentiality": "public"
    }
  ],
  "sources": [
    {
      "source_id": "openai-publishers-faq-2026-08-03",
      "canonical_url": "https://help.openai.com/en/articles/12627856-publishers-and-developers-faq",
      "title": "Publishers and developers FAQ",
      "publisher": "OpenAI",
      "source_type": "official",
      "locale": "en",
      "published_at": null,
      "checked_at": "2026-09-11",
      "sha256": "521cc5d325ad3c0c80501178613bf585b2449af4b68f100eb942b83f3ee1110a",
      "license": "Source terms apply",
      "visibility": "public"
    },
    {
      "source_id": "openai-bots",
      "canonical_url": "https://developers.openai.com/api/docs/bots",
      "title": "Overview of OpenAI crawlers",
      "publisher": "OpenAI Developers",
      "source_type": "official",
      "locale": "en",
      "published_at": null,
      "checked_at": "2026-09-11",
      "sha256": "ccbdef3018bd08dceaacb7fe0ea07a2020d25e201ab84aa44625827aac925440",
      "license": "Source terms apply",
      "visibility": "public"
    },
    {
      "source_id": "google-robots",
      "canonical_url": "https://developers.google.com/search/docs/crawling-indexing/robots/intro",
      "title": "Introduction to robots.txt",
      "publisher": "Google Search Central",
      "source_type": "official",
      "locale": "en",
      "published_at": null,
      "checked_at": "2026-09-11",
      "sha256": "549549689880625483238eea25463220d4ca54d96bfde30360343966cb4ac6ea",
      "license": "Source terms apply",
      "visibility": "public"
    },
    {
      "source_id": "google-crawl",
      "canonical_url": "https://developers.google.com/search/docs/essentials/technical",
      "title": "Google Search technical requirements",
      "publisher": "Google Search Central",
      "source_type": "official",
      "locale": "en",
      "published_at": null,
      "checked_at": "2026-09-11",
      "sha256": "5fff9bd0dd8ef5fe14fdbc1b7debbf79ef3b8b6b507b21b87ac5e62b2ba25b30",
      "license": "Source terms apply",
      "visibility": "public"
    }
  ],
  "related_slugs": [
    "crawler",
    "robots-txt",
    "indexability"
  ],
  "limitations": [
    "Документация описывает заявленные правила доступа, но не раскрывает внутренний выбор источников; отсутствие наблюдения следует считать unknown, а не нулём."
  ],
  "corrections": []
}