Один и тот же вопрос не гарантирует один и тот же список компаний. Это уже видно во внешних исследованиях повторяемости AI-рекомендаций: порядок, состав shortlist и источники могут расходиться между прогонами. Поэтому один скриншот выглядит убедительно, но почти ничего не говорит о стабильности AI-видимости.
Чтобы проверить этот разброс на конкретном рынке, можно провести полевой тест: сформировать 100 запросов и повторить каждый три раза в ChatGPT, Perplexity, Gemini, DeepSeek и YandexGPT. Получится 1500 ответов при одинаковых исходных формулировках. В них нужно отдельно фиксировать состав брендов, порядок, роль компании и источники. До завершения такого теста нельзя приписывать выборке проценты или объявлять лидера.
Главный принцип измерения: AI-видимость нужно описывать как распределение, а не как одну позицию. Отчет должен показывать, в скольких повторах появился бренд, где он стоял и какие ссылки использовались.
Три повтора не превращают ответ в точную статистическую оценку. Это минимальный рабочий слой, который показывает, насколько опасно опираться на единичную генерацию. Для запросов, влияющих на бюджет или отчет клиенту, повторов может потребоваться больше.
Два ответа могут использовать одинаковые критерии выбора и при этом называть разные компании. Возможен и обратный случай: состав shortlist совпадает, но аргументы меняются. Если отчет хранит только факт упоминания, эти два вида расхождения превращаются в одну цифру и причина изменения теряется.
Поэтому в протоколе полезно заранее разделить лидирующую позицию, основной shortlist и дополнительные варианты. Если бренд три раза подряд остается первым, это более устойчивый сигнал, чем единичное появление в блоке «также можно рассмотреть». Но такой вывод можно сделать только после повторов, а не по одному выбранному снимку.
Компания может оставаться в каждом прогоне, но перемещаться со второго места на четвертое. Для показателя «бренд упомянут» ничего не изменится. Для коммерческого выбора разница заметна: пользователь чаще обращает внимание на первые варианты и аргументы рядом с ними.
Вместо одной средней позиции лучше хранить распределение: сколько раз бренд был первым, входил в топ-3, оставался в основном списке или появлялся только дополнительно. Такая запись показывает диапазон, а не притворяется статичной поисковой выдачей.
Еще один разрыв возникает между текстом и ссылками. Два ответа могут рекомендовать одну и ту же компанию, но опираться на разные страницы: официальный сайт, обзор, каталог или материал СМИ. Для бренда это разные сценарии. В первом случае работает собственный контент, во втором позицию поддерживает внешняя площадка.
Поэтому стабильность цитирования нужно считать отдельно от стабильности упоминаний. Иначе источник исчезает, бренд остается, а общий показатель не замечает перемену.
ChatGPT, Perplexity, Gemini, DeepSeek и YandexGPT используют разные модели, поисковые механизмы и источники. Расхождение между ними не является ошибкой замера. Это часть реального пользовательского пути. Бренд может быть устойчив в одной системе и почти отсутствовать в другой.
Сводный процент удобен для презентации, но решения принимаются по разрезам. Если основная аудитория использует две платформы, именно они должны получить больший вес. Универсальная средняя по пяти системам способна скрыть проблему на ключевом рынке.
В опубликованном в августе 2026 года исследовании LLM Audit один вопрос задавали одной модели пять раз. Полностью одинаковый набор брендов получился только в 15% сочетаний вопроса и модели, одинаковый порядок - в 9,6%. При этом первая названная компания сохранялась заметно чаще - в 75,1% прогонов. Это хорошо объясняет разницу между устойчивым лидером и нестабильным хвостом списка.
Переносить эти проценты на будущий полевой тест Metricore нельзя: набор моделей, режимы, язык и число повторов будут отличаться. Внешний бенчмарк нужен не для подстановки чужой цифры в отчет, а для обоснования методики: единичная генерация плохо описывает вероятностную систему.
Для регулярного мониторинга три повтора - разумный минимум для приоритетных запросов. Он уже отделяет устойчивое присутствие от единичного появления. Для небольшого теста бюджета можно сделать пять повторов на самых коммерческих формулировках и один-три на длинном хвосте.
В отчете нужно хранить не только процент видимости, но и условия: платформа, модель или режим, дата, язык, регион, веб-поиск, число повторов и правила обработки ошибок. Рядом с итогом показывается разброс. Например: бренд появился в двух из трех прогонов, один раз вошел в топ-3, использовались четыре разных домена.
Отдельно сохраняются полные ответы. Без них невозможно понять, почему цифра изменилась: бренд действительно исчез, переместился в хвост, получил другое написание или был упомянут как источник, а не как рекомендация.
AI-видимость не похожа на фиксированную позицию в поиске. Это распределение результатов, которое зависит от модели, режима поиска, формулировки и генерации. Один ответ может быть полезным примером, но не измерением.
Практический стандарт простой: повторять важные запросы, разделять присутствие, позицию и источники, а модели показывать отдельно. Metricore позволяет сохранять эти срезы и сравнивать их во времени. Чем дороже решение, которое принимается по отчету, тем меньше в нем должно быть уверенности, построенной на одном скриншоте.