Google Research опубликовал исследование: современные языковые модели хранят почти всё, что им показывали, но не могут это вспомнить по требованию. Факты закодированы в 95–98% случаев, а воспроизвести модель не может 26–34% из них — проблема не в памяти, а в извлечении.
Отдельно исследователи показали, что мешает извлечению: если в вопросе сущности переставлены относительно того порядка, в котором факт встречался при обучении, модель вспоминает хуже. Факт вида «Oasis сыграли первый концерт в клубе Boardwalk» закодирован с группой в роли субъекта; вопрос, где субъектом становится клуб, срабатывает реже.
Для маркетинга это звучит абстрактно ровно до того момента, когда посмотришь на собственные замеры видимости в ответах ИИ-моделей.
В рамках работы с одним из наших клиентов задавали вопросы шести ИИ-каналам по три раза. Девятнадцать вопросов были небрендовыми — так, как спрашивает клиент, который ещё не знает имён: где заказать, сколько стоит, кого посоветуете. Один вопрос содержал имя компании прямо в формулировке.
Разрыв между ними абсолютный. На брендовом вопросе компания названа в 18 ответах из 18. На девятнадцати небрендовых — от нуля до трёх упоминаний, причём в пятнадцати вопросах из девятнадцати компания не названа ни разу.
Это ровно та асимметрия, о которой пишет Google Research, только на живом маркетинговом материале. Когда бренд стоит субъектом вопроса, модель охотно достаёт про него всё, что знает. Когда бренд должен появиться в роли рекомендации, извлечение не срабатывает, хотя факты о компании модели известны: она их сама показывает, если спросить прямо.
Первая реакция на такой разрыв — дописать на сайт побольше про себя. В замере видимости бренда в ответах ИИ-моделей видно, почему это работает слабо.
По четырём вопросам из двадцати наши страницы были в источниках ответа, а бренд в самом ответе не назывался. Модель прочитала сайт, использовала его как справку и не вынесла имя компании в текст. Приписка не случилась, хотя источник дошёл.
Механика извлечения объясняет, почему так: страница отвечает на вопрос «что такое продвижение в нейросетях», а не на вопрос «кто этим занимается». Роль компании в тексте — автор справки, а не объект рекомендации. Модель извлекает из страницы её собственную роль, и связку задачи с компанией из неё не собирает.
Компания — субъект утверждения. Не «услуги по продвижению в нейросетях оказываются нашей командой», а «Звонко измеряет видимость брендов в ответах нейросетей». Разница не стилистическая: во втором варианте имя стоит в той позиции, из которой факт потом извлекается.
Задача названа словами клиента. Формулировки в описании компании должны совпадать с тем, как спрашивают. Клиент не спрашивает про генеративную оптимизацию — он спрашивает, кто поможет попасть в ответы ChatGPT.
Связка компании с задачей повторяется на разных площадках. Одна страница на своём сайте даёт один источник. Тот же тезис в отраслевом обзоре, в каталоге и в чужой подборке даёт несколько независимых подтверждений — и именно они попадают в ответы на небрендовые вопросы.
Описание совпадает у всех источников. Разночтения в названии, в перечне услуг и в специализации ломают связывание сущностей: для модели это разные объекты.
Отдельный практический вывод из той же работы: переформулировка вопроса на извлечение влияет слабо. Значит, подобрать волшебную формулировку, при которой модель начнёт называть бренд, нельзя — вопросы задаёт клиент, а не маркетолог.
Второй вывод оттуда же: редкие факты вспоминаются хуже. В переводе на язык брендов — компания с тремя упоминаниями в отрасли извлекается хуже компании с тридцатью. Это делает работу над видимостью в ИИ похожей не на техническую оптимизацию, а на равномерное присутствие в отраслевом поле.
Третий вывод — увеличенное время рассуждения возвращает от 40 до 65% потерянных фактов — то есть часть разрыва снимается не работой бренда, а развитием самих систем. Ждать этого как решения не стоит, но учитывать при планировании горизонта полезно.
Наконец, масштаб обучения проблему не снимает: авторы прямо пишут, что рост объёма данных извлечение не чинит. Значит, механика, из-за которой бренд не всплывает на небрендовых вопросах, никуда не денется сама по себе.
Сроки при этом честнее оценивать в месяцах: индексы обновляются постепенно, а связка задачи с компанией становится устойчивой только после нескольких независимых подтверждений.
Разрыв между брендовым и небрендовым вопросом — это не проблема известности бренда, а свойство извлечения. Модель знает про компанию достаточно, чтобы рассказать по прямому запросу, и не достаёт её там, где нужна рекомендация.
Измеряется этот разрыв просто: доля небрендовых вопросов, где бренд назван хотя бы раз. У большинства компаний она близка к нулю, и именно она, а не суммарное число упоминаний, показывает реальное положение дел.
Работать с ним стоит через конструкцию описания и через число независимых источников, а не через объём текста на своём сайте.
Как устроен такой замер и что он показывает на разных нишах, мы его проводим сами и помогаем растить видимость брендов в ответах ИИ-моделей.