Что документировано

У двух агентов разные заявленные назначения. PerplexityBot относится к поисковому обходу, а Perplexity-User получает страницу в контексте пользовательского действия. Сведение обоих в категорию «AI crawler» уничтожает важную часть сигнала: регулярное discovery и fetch для конкретного запроса становятся неразличимыми.

Разделение ролей помогает сформулировать осторожный вопрос: какой тип доступности мы наблюдаем? Bot показывает заявленный поисковый обход, User — обращение, инициированное продуктовым сценарием. Ни один из них не описывает внутренний индекс, ranking или полный путь от запроса к ответу.

Источники раздела:[1] Perplexity Docs

Как подтвердить агента

Не доверяйте одному User-Agent: его можно скопировать. Сопоставьте адрес с актуальным официальным IP endpoint, сохраните версию списка и время проверки. Если используется DNS-проверка, выполните reverse и forward-confirmed reverse lookup. Несовпавший запрос остаётся claimed или unknown, а не попадает в статистику подтверждённых ботов.

Что записывать

Минимальная строка содержит timestamp, URL, status, размер ответа, полную строку User-Agent, результат IP-проверки и роль. Сырые IP не нужны в долгосрочной аналитике: после сетевой проверки их можно обрезать и HMAC-хэшировать по политике приватности. Агрегаты PerplexityBot и Perplexity-User показываются отдельно.

Короткий reproducible check можно выполнить на одном URL: отправить обычный HEAD/GET, записать ответ сервера, затем сопоставить User-Agent и IP с текущим официальным списком и повторить через неделю. Смена списка или ответа должна создать новую версию проверки, а не молча переписать старую.

Источники раздела:[1] Perplexity Docs

Что лог не доказывает

Успешный ответ 200 подтверждает доставку ресурса этому запросу. Он не раскрывает, попал ли документ в индекс, был ли отобран retrieval, использован ли факт, показана ли ссылка и перешёл ли человек. Для цитирования нужен сохранённый ответ с видимой атрибуцией конкретного URL.

Рабочий пример

Если сервер видит запрос с User-Agent PerplexityBot, сначала сохраните время, URL, статус и подтверждение диапазона IP. Это наблюдаемый обход. Если позже пользовательский ответ Perplexity содержит ссылку на тот же URL, это отдельное наблюдение: совпадение не доказывает, что именно этот обход породил цитату. В отчёте храните две строки, а не одну конверсию.

Чек-лист действия

Перед классификацией запроса проверьте User-Agent, официальный список диапазонов, обратное и прямое DNS-подтверждение, URL и код ответа. Разделяйте crawler, user fetch и неизвестную автоматизацию. Не блокируйте агента только по имени; сначала зафиксируйте правило и риск. Любое утверждение о цитировании подтверждайте отдельным архивом ответа.

Что остаётся неизвестным

Документация Perplexity объясняет назначение PerplexityBot и Perplexity-User, но не показывает, какой из полученных документов вошёл в candidate set конкретного ответа и почему одна ссылка оказалась видимой, а другая — нет. Поэтому даже подтверждённый Perplexity-User фиксируется как пользовательский fetch, пока рядом не сохранён сам ответ с точным URL.

Решение для отчёта

В аналитике держите отдельные поля: подтверждённый обход, пользовательский fetch, реферер и наблюдаемая цитата. Сводный показатель допустим только как технический счётчик запросов, но не как показатель влияния на ответы. Каждую неделю проверяйте правила классификации на нескольких реальных логах.

Что это не доказывает

  • Диапазоны IP и назначения агентов могут измениться; документацию нужно проверять перед изменением firewall или отчёта.

Источники

  1. 1
    Perplexity crawlersPerplexity Docs · official · 11 сент. 2026 г.

История исправлений

Существенных исправлений пока нет.