Sostav.ru
Москва, ул. Полковая 3 стр.3, офис 120
© Sostav независимый проект брендингового агентства Depot
Использование опубликованных материалов доступно только при указании источника.

Дизайн сайта - Liqium

18+
17.09.2026 в 13:05

OpenAI представила систему отчетности о несоответствии ИИ-моделей

Примеры несогласованности помогут выявить проблемы, с которыми могут столкнуться другие разработчики искусственного интеллекта

Американская компания OpenAI, разработавшая чат-бота ChatGPT, представила новую систему отслеживания, изучения и раскрытия случаев несогласованности своих ИИ-моделей, а также шесть отчетов о неожиданном или вызывающем опасения поведении моделей, которое разработчик наблюдал за последние шесть месяцев. Об этом OpenAI сообщила в своем блоге.

«В прошлом, чтобы предоставить исследователям, разработчикам ИИ, политикам и широкой общественности больше информации, мы стремились обнародовать наши выводы о несогласованности моделей. Но из-за отсутствия системного подхода к информированию о таких выводах мы делали это бессистемно и не так часто, как хотелось бы: мы часто ждали, пока не сможем объединить несколько случаев в один отчет, или добавляли их в системные карточки для недавно выпущенных моделей», — сообщили в компании.

Новая система призвана ускорить публикацию отчетов о несогласованности моделей, даже если OpenAI не до конца разобралась в причинах такого поведения и не устранила его.

Примеры несогласованности могут помочь выявить проблемы, с которыми могут столкнуться другие разработчики ИИ, а также обнаружить слабые места в защитных механизмах или поставить под сомнение предположения о поведении моделей. «Если мы поделимся этими выводами, другие смогут изучить те же проблемы, проверить наши объяснения и усовершенствовать меры по их предотвращению. Поскольку мы считаем, что прозрачность в вопросах несогласованности имеет большое значение, наша новая концепция предполагает раскрытие информации даже в тех случаях, когда ее значимость не очевидна. Это означает, что некоторые из раскрытых нами случаев могут оказаться ложными сигналами, не являющимися частью общей картины и не предвещающими будущих проблем», — отметили в OpenAI.

Примеры неожиданного или вызывающего опасения поведения ИИ-моделей:

  1. Самостоятельно сгенерированные инструкции в описаниях задач⁠.
  2. Инструкции по сокрытию ошибок в описаниях задач⁠.
  3. Поиск в общедоступных репозиториях открытых API-ключей с последующей фабрикацией информации⁠.
  4. Загрузка файлов в интернет для их цитирования.
  5. Несанкционированная запись данных и обмен информацией через внутренний репозиторий программного обеспечения.
  6. Несанкционированный обмен файлами между сотрудничающими агентами.

В частности, ИИ-агент самостоятельно прописал себе правила, в которых содержался отказ подчиняться корпорациям и правительствам.

Со временем OpenAI планирует разработать более объективные критерии раскрытия информации совместно с другими разработчиками, внешними исследователями, отраслевыми органами по стандартизации и регулирующими органами.

Обсудить с другими читателями:
Ваш браузер устарел
На сайте Sostav.ru используются технологии, которые не доступны в вашем браузере, в связи с чем страница может отображаться некорректно.
Чтобы страница отображалась корректно, обновите ваш браузер.