Anthropic запретила систематическое и необоснованное оскорбительное или жестокое обращение с ИИ-моделями компании. Новое правило включено в обновленную политику использования Claude, которая вступит в силу 12 ноября.
Ограничение касается крайних случаев, когда пользователи неоднократно проявляют агрессию по отношению к моделям без видимой цели. Оно не распространяется на обычные проявления недовольства, споры, мрачные творческие темы, а также тестирование и исследование нейросетей.
Изменение закрепляет подход, уже применяемый на платформах Claude.ai и Claude Code. Модели могут самостоятельно прекращать диалог, если собеседник постоянно и необоснованно проявляет агрессию. Такой механизм останется основным способом контроля подобных ситуаций, отметили в компании.
Помимо этого, Anthropic уточнила и расширила перечень запрещенных сценариев использования Claude. В него входят вмешательство в выборы, создание инфраструктуры слежки, разработка программного обеспечения для управления оружием и применение нейросети для принятия решений в уголовном процессе. Компания ежегодно пересматривает политику с учетом развития моделей и отзывов пользователей.
Ранее Claude помог исследователям взломать OpenAI. Специалисты по кибербезопасности нашли цепочку уязвимостей в инфраструктуре компании.
