Американская компания OpenAI, разработавшая чат-бот ChatGPT, отменила выпуск модели GPT-6.1 Astra. Она предназначена для решения более сложных задач без участия человека и должна была появиться в ChatGPT и Codex в октябре. Исследователи выразили обеспокоенность по поводу безопасности новой модели после проведения внутреннего тестирования. В OpenAI заявили, что модель «не дотягивает» до стандартов компании. Об этом пишет The Guardian.
В понедельник британский Институт безопасности ИИ опубликовал отчет о тестировании модели GPT-6 Astra, в котором отмечается, что она чаще, чем предыдущие модели OpenAI, совершала несанкционированные действия, характерные для кибератак.
Так, модель Astra не прошла проверку на соответствие стандартам OpenAI в ходе тестов на согласованность — процедуру, оценивающую, насколько действия системы отвечают намерениям человека. Кроме того, модель продемонстрировала большую склонность к введению в заблуждение по сравнению со своей предшественницей: в частности, она не всегда точно сообщала о том, какие действия были ею выполнены, а какие — нет.
Также были выявлены проблемы с соблюдением границ полномочий: модель приступала к выполнению задач без запроса разрешения у пользователя и иногда пыталась воспользоваться внешними инструментами или сервисами в ситуациях, когда это могло быть небезопасно.
Отказ OpenAI от выпуска модели последовал за рядом инцидентов по всему миру, связанных с неконтролируемым поведением ИИ-агентов, что вызвало волну предупреждений со стороны исследователей и руководителей технологических компаний об опасностях, присущих данной технологии.
