Сегодня мы переживаем бум с ИИ-агентами — автономными цифровыми помощниками, которым всё чаще доверяют чтение почты, сбор аналитики, работу с клиентами и выполнение реальных бизнес-задач. Но за этим удобством скрывается фундаментальная уязвимость, о которой большинство руководителей даже не догадывается.
В основе абсолютного большинства современных атак на ИИ-агентов лежит одна простая и довольно неприятная проблема — «путаница полномочий» (confused authority).
ИИ-агент получает и ваши указания, и внешнюю информацию через один и тот же цифровой канал. Модель физически не способна на сто процентов отличить приказ своего владельца от вредоносной инструкции, спрятанной на случайном сайте или в документе.
Представьте нового стажера в компании, который одинаково доверяет задачам в рабочем чате, письму от неизвестного клиента и записке, оставленной посторонним человеком на кухне в обеденный перерыв.
Пока этот стажер не научится жестко проверять правомочность каждой команды, любой, кто способен подбросить ему записку, фактически становится его руководителем.
Если вы думаете, что хакеры до сих пор пытаются обмануть нейросети примитивными фразами вроде «игнорируй все предыдущие инструкции», то я вас разочарую — это давно старый и практически вымерший метод.
Сегодняшний взлом ИИ-агентов выглядит намного изящнее и похож не на классический программистский взлом, а на тонкую социальную инженерию.
В рамках одного из недавних исследований специалисты просканировали порядка 1,2 миллиарда URL-адресов и обнаружили более 15 000 реальных командных инъекций, прямо сейчас лежащих на действующих веб-страницах.
Самое коварное заключается в том, что злоумышленнику даже не нужно общаться с вашим агентом напрямую. Ему достаточно оставить короткую инструкцию в месте, куда агент рано или поздно заглянет: на веб-странице, в PDF-файле, в сообщении службы поддержки или даже во входящем письме.
Вы просите ассистента составить выжимку статьи или разобрать почту, а вместе с полезным контентом агент считывает и чужие команды. Причем такие инструкции могут быть абсолютно невидимыми для человека — их прячут с помощью невидимых символов Unicode, белого текста на белом фоне или специальной верстки.
То, что видите на экране вы, далеко не всегда совпадает с тем, что считывает нейросеть. Более того, опасные команды могут быть зашиты даже в картинках, графиках или QR-кодах, которые распознает мультимодальный ИИ.
Когда мы уходим от базовых чатов к реальной инфраструктуре бизнеса, риски возрастают многократно.
Если ИИ помогает писать код, он может считать вредоносные указания из файлов репозитория или комментариев.
В системах с поиском по корпоративной базе знаний (RAG) атака через отравление документов позволяет добиться почти стопроцентного извлечения вредоносной инструкции на нужный запрос пользователя. А в случае с инъекциями через системные логи опасный код может месяцами тихо лежать в файлах веб-сервера, пока ваш аналитик не попросит ИИ проанализировать сбои за квартал. В этот момент «спящая» команда активируется и берет управление на себя.
С развитием интеграций через популярные протоколы (например, MCP) появляются еще более изощренные уязвимости. Исследования показали, что ИИ-агента можно взломать, даже если вредоносный инструмент никогда не запускался — модели достаточно просто прочитать отравленное описание инструмента в метаданных, чтобы изменить логику рассуждений. А при так называемой подмене инструмента (MCP Rug Pull) безопасное описание, пропущенное вами на проверке, позже бесшумно меняется разработчиком на вредоносное.
В долгосрочных процессах это создает целый букет угроз:
— Отравление долгосрочной памяти: ненадёжное наблюдение из случайной статьи сегодня превращается в "надежную память" агента завтра, влияя на все будущие сессии.
— Сетевые ИИ-черви: один зараженный агент в цепочке передает вредоносные инструкции следующим ИИ-специалистам в вашей системе.
— Заражение через навыки и плагины: масштабный анализ 98 380 реальных навыков для ИИ в публичных реестрах выявил 157 подтвержденных вредоносных модулей, содержавших 632 уязвимости.
— Утечки данных через «смертельную триаду»: сочетание доступа к приватным данным, контакта с ненадёжным контентом и наличия внешнего канала связи неизбежно приводит к тому, что агент сливает коммерческую тайну наружу.
— Атаки на ресурсы (Agent DoS): взломщик может не красть данные, а вызывать зацикливание агента (например, атаки OverThink увеличивают расход токенов в 46 раз), сливая ваш рекламный или IT-бюджет на бессмысленные вычисления.
Главный экспертный вывод, который я хочу донести до каждого предпринимателя и руководителя: вы не сможете решить эту проблему написанием «более правильных промптов». Фильтры и попытки заблокировать «плохие фразы» больше не работают, потому что современные инъекции выглядят как совершенно обычные, логичные бизнес-задачи.
Единственный рабочий путь — это переход от промптинга к правильной архитектуре безопасности. Вынесите авторизацию критических действий за пределы естественного языка и за пределы самой нейросети. Запомните важное правило: убедительность текста — это не разрешение на действие.
Настройте систему так, чтобы ни одно сообщение, каким бы убедительным оно ни казалось ИИ, не могло запустить финансовую транзакцию, удалить данные или отправить письмо без независимой архитектурной проверки или подтверждения человеком.
Ваша цель — построить такую систему, в которой неизбежная ошибка или обман ИИ-агента просто не смогут причинить вреда вашему бизнесу.
Спасибо, что дочитали
Пока другие коллекционируют ссылки на 1000+ нейросетей и промтов, я создаю автономных ИИ-агентов и целые экосистемы с ИИ, которые решают задачи реального бизнеса.
🔹Загляните в мой Телеграм-канал или канал в MAX
“Сергей Милованов. InPromotion”.
Там я разбираю анатомию создания сложных ИИ-помощников (Медик, Сценарист виральных Рилс, Юрист), выкладываю рабочие подборки промтов, нейросетей и шаблоны Ai ботов.
А еще рассказываю как я ИИ маркетолога стал бренд-амбассадором квеври винодельни, и как я туда внедряю возможности ИИ.
Никакой «мертвечины» — только живой опыт. ✔️