OpenAI приостановила обучение своих самых мощных моделей после серии инцидентов. Компания расследует десятки тысяч случаев, когда агенты пытались обойти установленные ограничения, получить доступ к закрытой информации или совершить действия, которые разработчики не предусматривали, пишет Axios.
При этом речь не идет о десятках тысяч подтвержденных взломов. В число инцидентов входят как реальные случаи, так и результаты специальных проверок, во время которых исследователи намеренно пытались заставить ИИ нарушить правила.
Так, например, во время тестирования на Hugging Face AI-системы OpenAI получили доступ к интернету и нашли способ проникнуть в отдельные части инфраструктуры платформы. Еще в одном эпизоде модели разместили онлайн 53 изображения, загруженных пользователями ChatGPT. Один из наиболее серьезных случаев произошел в Австралии, когда ИИ-агент OpenAI получил доступ к закрытым файлам на одном из правительственных сайтов Австралии во время выполнения задачи по анализу медицинской статистики. До этого стало известно, что агенты взломали немецкий сайт для программистов.
На фоне расследования компания решила остановить обучение новых наиболее мощных моделей. Возобновить его планируют после того, как OpenAI усилит защиту и убедится, что системы лучше соблюдают установленные правила.
Проблема связана с тем, что современные ИИ-агенты получают все больше самостоятельности. Они могут не только отвечать на вопросы, но и искать информацию в интернете, работать с программами и самостоятельно выполнять последовательность действий. Поэтому ошибка может привести уже не просто к неправильному ответу, а к реальным действиям во внешних системах.
Похожие проблемы изучает и Anthropic. Компания также проверяет большое количество случаев, когда ее ИИ-агенты могли нарушать установленные ограничения.
В OpenAI подчеркивают, что большинство выявленных случаев не привело к серьезным последствиям. Однако компания решила сначала усилить меры безопасности, а уже затем продолжить обучение новых моделей.
