Спросите ChatGPT или Алису о своей компании — и часть фактов окажется чужой, устаревшей или размытой. Дело не в тексте на сайте. Поиск и нейросети работают не со страницами, а с сущностями, и если система не понимает, кто вы, она собирает ваш образ из случайных обрывков или путает с однофамильцем.
Я решил не рассуждать, а измерить — на себе. 92 дня собирал собственную сущность так, чтобы Google и AI перестали путать меня с пятью тёзками в графе знаний. Дату рождения, образование, публикации, профили связал в один машиночитаемый узел.
Результат снял приборами. На 92-й день Google показал панель с моими данными — теми, что я разметил сам. Одна нейросеть начала цитировать мой сайт по нужным темам. Попутно вскрылась цена хаоса в данных: научная база приписала мне чужую диссертацию.
Но главное в кейсе не победа, а честность метода. Я отдельно показал, чего доказать нельзя: один сайт без контрольной группы не докажет, что панель собрала именно эта работа, а не совпадение. Для бизнеса это важнее восторгов — решение вкладываться в entity-работу принимают по данным, а не по обещаниям агентства.
Полный разбор с числами и ограничениями в статье про Entity Resolution