Вопрос и рамка недели

Вопрос этой недели — какие свежие публикации действительно меняют измерение AI-видимости и объяснение изменений в ответах. Материал объединяет четыре первичных работы, опубликованные или обновлённые в августе 2026 года. Это не рейтинг платформ и не обещание получить цитаты. Единица анализа — конкретный эксперимент, его выборка и артефакт. Мы разделяем fetch, retrieval, mention, citation и referral: совпадение этих событий по времени не доказывает, что одно вызвало другое. Такой каркас нужен, потому что слово «видимость» часто смешивает технический доступ, выбор источника и поведение человека.

Контекст диалога — часть условия теста

В исследовании от 3 августа сравнивали многоходовые разговоры, сохраняя последнюю реплику одинаковой. Модель получала либо полный разговор, либо только последний вопрос, либо короткое восстановление истории. В 44,7% наблюдений полный разговор и вопрос без истории дали материально разные ответы; судья считал часть различий способной изменить действие пользователя. Это не доказывает, что длинная история всегда лучше и не измеряет веб-поиск. Но результат делает некорректным сравнение двух замеров, если один запуск был продолжением диалога, а другой — чистым вопросом. В паспорте теста надо хранить conversation_state и способ передачи истории.

Повторы показывают неполноту одного ответа

В медицинской выборке от 13 августа три production-чатбота подбирали первичные исследования для 20 клинических вопросов и сравнивались с экспертным набором Cochrane. Один ответ находил в среднем 39,2% включённых работ; объединение четырёх повторов находило 74,2% хотя бы раз. Формулировка от лица исследователя давала больший охват, чем пациентская. Эти проценты относятся только к двадцати медицинским вопросам и не переносятся на бренды или коммерческий поиск. Практический вывод уже переносим как метод: считать стабильное ядро, совокупный охват и редкий хвост отдельно. Пропуск в одном ответе не доказывает отсутствия источника в знаниях системы.

Цитируемость без доказательности опасна

Лабораторная работа от 11 августа многократно переписывала уже найденные документы, чтобы генеративная система чаще их цитировала. При повторных вмешательствах тексты накапливали неподтверждённые утверждения; механизм, вознаграждавший проверяемое содержание, давал лучший баланс в benchmark. Это не production-аудит ChatGPT, Google или Perplexity и не раскрывает их алгоритмы. Для редакционной метрики нужно держать раздельно candidate set, показ ссылки, поддержку конкретного тезиса и отсутствие новых ошибок. Рост citation share сам по себе не является успехом, если источник перестал быть проверяемым.

Что означает наблюдение об AI-generated provenance

Аудит Google AI Overview от 25–29 мая на 2 597 YMYL-запросах обнаружил, что страницы, помеченные коммерческим AI-detector как AI-generated, среди наблюдаемой выборки цитировались чаще. Однако это наблюдение не устанавливает причинность: detector спорен, качество и конфаундеры контролировались ограниченно, а авторская связь с компанией-детектором требует осторожности. Особенно важно, что разрыв в основном возникал у URL вне собранного organic top-100. Поэтому provenance можно изучать как экспериментальный признак, но нельзя советовать генерировать тексты ради citation.

Ограничения и следующая проверка

S01 измерял генерацию без веб-поиска; нужно проверить, меняет ли история query rewriting и набор ссылок в search-enabled режимах. S02 относится к медицинским вопросам, S03 — к симуляции, S04 — к наблюдательному аудиту с чувствительной классификацией. Ни одна работа не раскрывает универсальный фактор ранжирования. Следующий воспроизводимый тест должен заранее фиксировать чистый вопрос или продолжение, делать минимум четыре повтора, сохранять полный ответ и отдельно проверять citation и поддерживающий фрагмент. Результат следует публиковать с абсолютными числами, периодом, языком, выборкой и уровнем уверенности.

Минимальный протокол для редакции

Перед каждым сравнением запишите точный вопрос, язык, регион, поверхность, режим и состояние диалога. Сохраните полный ответ, все ссылки, время и версию страницы. Для каждого результата задайте отдельный verdict: fetch, mention, citation, supporting evidence или referral. Если источники отличаются, не называйте это изменением ранжирования без matched-панели. Читателю нужно показать не только красивую цифру, но и знаменатель, исключения и границу применимости. Такой протокол превращает еженедельную заметку в накопительную базу: новый запуск можно сравнить со старым, а исправление не стирает прежнее наблюдение.

Редакционный вывод

Главная ошибка недели — называть системой известным то, что было проверено только один раз. Практически полезная публикация должна показывать вопрос, условие, источник и ограничение. Если разговор продолжался, это часть теста; если ответ повторили, это часть метода; если ссылка появилась, нужно проверить, какой именно тезис она поддерживает. Такой формат позволяет читателю отличить новое знание от красивого предположения. Он также сохраняет историю: следующий цикл может подтвердить, уточнить или опровергнуть вывод, не переписывая старую дату и не скрывая расхождение.

Единица наблюдения: от URL до действия

Для мониторинга ответ нужно разложить на уровни: кандидат, извлечение, упоминание, ссылка, поддержка тезиса и действие пользователя. Эти события расходятся: страница может попасть в candidate set, но не быть процитированной; ссылка может вести на домен, но не поддерживать конкретную фразу. Поэтому отчёт должен хранить матрицу событий, полный ответ, условия диалога и доказательный фрагмент, а не одну оценку visibility. Повторяемый протокол превращает еженедельную заметку в накопительную базу: следующий запуск сравнивается с прежним без переписывания исходного наблюдения.

Что это не доказывает

  • Выборки, модели, языки и поверхности различаются; наблюдения нельзя переносить на весь веб или объявлять причинными эффектами.

Источники

  1. 1
    Conversation history changes model answersPrimary research · primary-research · 11 сент. 2026 г.
  2. 2
    Chatbots retrieve different subsets of evidencePrimary research · primary-research · 11 сент. 2026 г.
  3. 3
    Citation optimization and evidence qualityPrimary research · primary-research · 11 сент. 2026 г.
  4. 4
    Auditing AI-generated provenance and citation qualityProceedings of Machine Learning Research · primary-research · 11 сент. 2026 г.

История исправлений

Существенных исправлений пока нет.