Рабочее значение
Робот сначала может запросить /robots.txt, выбрать группу правил по своему User-Agent и применить Allow или Disallow к URL-пути. Поведение при недоступном файле, поддерживаемые директивы и обработка конфликтов определяются документацией конкретного робота.
Источники раздела:[1] Google Search Central[2] OpenAI Developers
Как отличать
robots.txt относится к обходу, meta robots и X-Robots-Tag — к обработке конкретного ответа, а login или сетевой контроль — к доступу. Sitemap может быть указан в robots.txt, но остаётся отдельным механизмом обнаружения URL.
Источники раздела:[1] Google Search Central[2] OpenAI Developers
Пример
Правило Disallow: /private/ просит выбранного робота не запрашивать этот путь. Человек и несовместимый бот всё ещё могут открыть URL, если сервер не требует авторизации. Поэтому размещать секретный документ по такому адресу опасно.
Проверка
Откройте файл как обычный текст, проверьте HTTP-статус, синтаксис, группы User-Agent и совпадение путей для каждого важного робота. Затем сделайте тестовый запрос снаружи и убедитесь, что приватные маршруты действительно требуют авторизацию независимо от файла.
Предел интерпретации
Разрешение в robots.txt не заставляет робота прийти, а запрет не удаляет ранее известный URL из всех систем. Разные боты поддерживают разные директивы; правила для одного User-Agent нельзя автоматически переносить на другой.
Что это не доказывает
- Перед изменением проверьте официальную документацию каждого named crawler и влияние на существующие поисковые функции. Ошибка в широкой группе User-Agent может непреднамеренно закрыть полезный обход.
Источники
- 1Introduction to robots.txtGoogle Search Central · official · 11 сент. 2026 г.
- 2Overview of OpenAI crawlersOpenAI Developers · official · 11 сент. 2026 г.
История исправлений
Существенных исправлений пока нет.