Один вопрос — пять разных ответов: насколько стабильна AI-видимость бренда

2026-09-03 08:25:39 Время чтения 8 мин 111

Один и тот же вопрос не гарантирует один и тот же список компаний. Это уже видно во внешних исследованиях повторяемости AI-рекомендаций: порядок, состав shortlist и источники могут расходиться между прогонами. Поэтому один скриншот выглядит убедительно, но почти ничего не говорит о стабильности AI-видимости.

Чтобы проверить этот разброс на конкретном рынке, можно провести полевой тест: сформировать 100 запросов и повторить каждый три раза в ChatGPT, Perplexity, Gemini, DeepSeek и YandexGPT. Получится 1500 ответов при одинаковых исходных формулировках. В них нужно отдельно фиксировать состав брендов, порядок, роль компании и источники. До завершения такого теста нельзя приписывать выборке проценты или объявлять лидера.

Главный принцип измерения: AI-видимость нужно описывать как распределение, а не как одну позицию. Отчет должен показывать, в скольких повторах появился бренд, где он стоял и какие ссылки использовались.

Как устроить полевой тест

  1. Один и тот же набор из 100 запросов без изменения порядка слов.
  2. Пять AI-платформ: ChatGPT, Perplexity, Gemini, DeepSeek и YandexGPT.
  3. Три независимых прогона каждого запроса.
  4. Фиксированные дата, язык, регион и режим веб-поиска, насколько это позволяет платформа.
  5. Отдельная запись брендов, порядка упоминаний, ссылок и доменов.
  6. Ручная проверка ответов, где название компании использовано неоднозначно.

Три повтора не превращают ответ в точную статистическую оценку. Это минимальный рабочий слой, который показывает, насколько опасно опираться на единичную генерацию. Для запросов, влияющих на бюджет или отчет клиенту, повторов может потребоваться больше.

Список брендов и общий смысл нужно разделить

Два ответа могут использовать одинаковые критерии выбора и при этом называть разные компании. Возможен и обратный случай: состав shortlist совпадает, но аргументы меняются. Если отчет хранит только факт упоминания, эти два вида расхождения превращаются в одну цифру и причина изменения теряется.

Поэтому в протоколе полезно заранее разделить лидирующую позицию, основной shortlist и дополнительные варианты. Если бренд три раза подряд остается первым, это более устойчивый сигнал, чем единичное появление в блоке «также можно рассмотреть». Но такой вывод можно сделать только после повторов, а не по одному выбранному снимку.

Присутствие и порядок нужно считать раздельно

Компания может оставаться в каждом прогоне, но перемещаться со второго места на четвертое. Для показателя «бренд упомянут» ничего не изменится. Для коммерческого выбора разница заметна: пользователь чаще обращает внимание на первые варианты и аргументы рядом с ними.

Вместо одной средней позиции лучше хранить распределение: сколько раз бренд был первым, входил в топ-3, оставался в основном списке или появлялся только дополнительно. Такая запись показывает диапазон, а не притворяется статичной поисковой выдачей.

Источники могут меняться при похожем ответе

Еще один разрыв возникает между текстом и ссылками. Два ответа могут рекомендовать одну и ту же компанию, но опираться на разные страницы: официальный сайт, обзор, каталог или материал СМИ. Для бренда это разные сценарии. В первом случае работает собственный контент, во втором позицию поддерживает внешняя площадка.

Поэтому стабильность цитирования нужно считать отдельно от стабильности упоминаний. Иначе источник исчезает, бренд остается, а общий показатель не замечает перемену.

Разные модели нельзя складывать в одну строку

ChatGPT, Perplexity, Gemini, DeepSeek и YandexGPT используют разные модели, поисковые механизмы и источники. Расхождение между ними не является ошибкой замера. Это часть реального пользовательского пути. Бренд может быть устойчив в одной системе и почти отсутствовать в другой.

Сводный процент удобен для презентации, но решения принимаются по разрезам. Если основная аудитория использует две платформы, именно они должны получить больший вес. Универсальная средняя по пяти системам способна скрыть проблему на ключевом рынке.

Внешний бенчмарк подтверждает масштаб разброса

В опубликованном в августе 2026 года исследовании LLM Audit один вопрос задавали одной модели пять раз. Полностью одинаковый набор брендов получился только в 15% сочетаний вопроса и модели, одинаковый порядок - в 9,6%. При этом первая названная компания сохранялась заметно чаще - в 75,1% прогонов. Это хорошо объясняет разницу между устойчивым лидером и нестабильным хвостом списка.

Переносить эти проценты на будущий полевой тест Metricore нельзя: набор моделей, режимы, язык и число повторов будут отличаться. Внешний бенчмарк нужен не для подстановки чужой цифры в отчет, а для обоснования методики: единичная генерация плохо описывает вероятностную систему.

Какие метрики использовать

  1. Доля появлений: в скольких повторах бренд присутствует в ответе.
  2. Доля топ-3: как часто компания входит в первые три варианта.
  3. Стабильность первого места: сохраняется ли лидер между прогонами.
  4. Пересечение shortlist: какая часть набора брендов повторяется.
  5. Разброс позиции: минимальное, максимальное и типичное место.
  6. Стабильность источника: как часто повторяются домен и конкретный URL.
  7. Стабильность аргумента: сохраняется ли причина рекомендации.

Сколько повторов нужно

Для регулярного мониторинга три повтора - разумный минимум для приоритетных запросов. Он уже отделяет устойчивое присутствие от единичного появления. Для небольшого теста бюджета можно сделать пять повторов на самых коммерческих формулировках и один-три на длинном хвосте.

  1. Один прогон подходит для разведки и поиска примеров, но не для вывода о позиции.
  2. Три прогона показывают базовый разброс и не делают исследование слишком дорогим.
  3. Пять и более повторов нужны там, где сравниваются небольшие изменения или принимается решение о бюджете.
  4. Повторы не заменяют разные формулировки. Перефразированный запрос является отдельным слоем вариативности.

Как должен выглядеть честный отчет

В отчете нужно хранить не только процент видимости, но и условия: платформа, модель или режим, дата, язык, регион, веб-поиск, число повторов и правила обработки ошибок. Рядом с итогом показывается разброс. Например: бренд появился в двух из трех прогонов, один раз вошел в топ-3, использовались четыре разных домена.

Отдельно сохраняются полные ответы. Без них невозможно понять, почему цифра изменилась: бренд действительно исчез, переместился в хвост, получил другое написание или был упомянут как источник, а не как рекомендация.

Вывод

AI-видимость не похожа на фиксированную позицию в поиске. Это распределение результатов, которое зависит от модели, режима поиска, формулировки и генерации. Один ответ может быть полезным примером, но не измерением.

Практический стандарт простой: повторять важные запросы, разделять присутствие, позицию и источники, а модели показывать отдельно. Metricore позволяет сохранять эти срезы и сравнивать их во времени. Чем дороже решение, которое принимается по отчету, тем меньше в нем должно быть уверенности, построенной на одном скриншоте.