Сервис уверенно показал девяносто шесть процентов «машины» на моей собственной статье, которую я вымучивал руками ещё до того, как все эти ассистенты вообще появились. С этого казуса и начнём разговор о том, что означают эти проценты и по каким признакам живой редактор действительно отличает текст нейросети.
Началось всё с обычного офисного спора. Коллега притащил текст от подрядчика, ткнул в вердикт детектора и заявил, что платить не будем, потому что «это писал робот». Я предложил эксперимент. Давай, говорю, сначала проверим этим же сервисом что-нибудь стопроцентно человеческое. Взял свою старую статью тех времён, когда слова «промпт» ещё никто не выговаривал, и скормил детектору. Девяносто шесть процентов машины. Коллега притих.
А дальше вышло совсем смешно. Кусок, который честно сгенерировала модель, я слегка причесал руками и отправил на ту же проверку. Двадцать процентов. То есть детектор промахнулся дважды подряд и оба раза в разные стороны, причём на текстах, про которые я точно знал, кто их написал. После такого доверять его процентам стало трудно.
Что вообще меряет эта цифра
Механика тут проще, чем кажется, и разочаровывает ровно поэтому. Детектор не умеет заглянуть в прошлое текста и узнать, чья рука его набрала. У текста нет отпечатков пальцев, узнавать там нечего. Всё, что детектор реально делает, это оценивает предсказуемость. Насколько каждое следующее слово ожидаемо после предыдущих и насколько ровно эта гладкость размазана по странице. Машина обычно пишет гладко и монотонно. Человек обычно пишет рвано, с перепадами и неожиданными поворотами.
И вот в этом «обычно» вся собака и зарыта. Аккуратный человеческий текст, по которому прошёлся хороший редактор, выходит гладким и предсказуемым, потому что редактор именно к этому и стремился, он для того и сидел. В итоге под подозрение первыми попадают технические инструкции, документы по ГОСТу и научные статьи, просто потому что они шаблонные по своей природе. Написал слишком чисто, получил клеймо робота, спасибо за старание.
Особенно не повезло тем, кто пишет на неродном языке. Исследования показывают до шестнадцати процентов ложных срабатываний на эссе англоязычных студентов и до шестидесяти одного процента на текстах тех, для кого английский неродной. Шестьдесят один процент это уже не досадная погрешность, это машина, которая систематически записывает человека в роботы за простой словарный запас и правильные, вызубренные конструкции. По сути детектор наказывает за прилежание.
С русским отдельная история, и она невесёлая. Точность на нём заметно ниже, чем на английском, потому что почти все детекторы учились на английских текстах, а до кириллицы руки дошли позже и в час по чайной ложке. Отечественные проверялки делают ту же работу теми же методами, так что и болячки у них наследуются те же самые.
И контрольный выстрел. Даже там, где детектор сносно ловит нетронутую генерацию, стоит пройтись по тексту руками совсем чуть-чуть, и точность обрушивается на двадцать с лишним пунктов. Получается изящный парадокс. Инструмент уверенно опознаёт ровно тот случай, который никого не тревожит, сырую машинную простыню, и пасует ровно на том, ради чего его вообще заводили, на аккуратно отредактированной генерации. Вывод я для себя сделал такой. Процент детектора это в лучшем случае повод присмотреться к тексту повнимательнее. Как основание кого-то обвинить, не заплатить или устроить разбор, он не годится совершенно, и регулярные скандалы с ложными обвинениями студентов в университетах это исправно доказывают.
На что на самом деле смотрит редактор
Признаки, по которым генерацию узнаю лично я, к процентам не имеют ни малейшего отношения. Это скорее насмотренность, чем математика.
Вернее всего выдаёт ритм. Абзацы под одну гребёнку, предложения под одну гребёнку, ровный пульс без единого сбоя на четыре тысячи знаков подряд. Живой человек так не пишет физически, его то несёт на длинную мысль, то он роняет короткую фразу и идёт дальше. Ровное дыхание это первый звоночек.
Второй признак это отсутствие всякой конкретики. Ни одного имени, ни даты, ни суммы, ни названия, ни единого случая, который на самом деле стряслось бы с автором. Всё гладко, всё правдоподобно и всё непроверяемо, как гороскоп.
Третий это симметричные обороты, которые прут косяком. Тройчатки однородных членов в каждом абзаце, конструкции в духе «не то, а это», зеркальные противопоставления одно за другим. По отдельности приёмы как приёмы, ничего плохого, но когда они идут плотной шеренгой, текст начинает звенеть, как рекламный слоган.
Четвёртый признак мне лично обиден, потому что я сам этим грешу с юности. Тире и двоеточий больше, чем нужно живому человеку. Модель эти знаки обожает, ими удобно приклеивать пояснение к основной мысли, и в русском тексте их плотность выходит подозрительно выше нормы. Так что этот текст я, между прочим, чистил от них специально.
Пятый это отсутствие своего лица и всякого риска. Текст никого не задел, ни с кем не поспорил и завершился обтекаемым «нейросети открывают перед нами новые горизонты». Человек, которому и правда есть что сказать, почти всегда где-нибудь да огрызнётся, вставит шпильку или своё несогласие. Живому тексту не всё равно.
Шестой и самый тонкий это стерильность. Ни одной оговорки, ни одного отступления вбок, ни единой корявой фразы, которую хочется вычеркнуть. А человеческий текст почти всегда чуть неопрятен, и вот эта самая неопрятность и есть его подпись, его доказательство жизни.
Что со всем этим делать автору, который нейросетью пользуется, но выглядеть роботом не хочет. Бороться с детектором дело гиблое, а вот подмешать в текст то, чего у машины отродясь не бывает, вполне реально. Свой живой случай с датой и цифрой. Сомнение, высказанное вслух. Спор с общепринятым мнением. Абзац, который нарочно выбивается из ритма. Ровно то, ради чего текст вообще читают, а не сканируют.
Проверялок этих развелось видимо-невидимо, и обитают они в тех же каталогах, где ищут всё подряд, от There's an AI for That до galleryai.ru. Относиться к ним стоит примерно как к градуснику в комнате, где вы и без него прекрасно чувствуете, что холодно. Полезная штука, но решать за вас не должна.
А занимает меня в этой истории совсем другое. Мы дожили до момента, когда живому человеку приходится доказывать, что он живой, и доказывать это машине, которая ошибается чаще него самого. Кому уже прилетало обвинение по вердикту детектора и чем в итоге кончилось? Расскажите в комментариях, я такие истории собираю всерьёз, потому что подозреваю, что мы тут ещё нахлебаемся.