Шестнадцать сервисов из восемнадцати натёрли морковь «на крупной тёрке». Слова «тёрка» в задании не было, там стояло сухое «подготовить овощи». Восемнадцать движков от разных компаний независимо выдали одну кулинарную формулу.
Это побочный результат: я проверял, чей текст меньше похож на машинный.
Как считал. Восемнадцать сервисов, два задания: справка о гидронивелире и рецепт борща. Новый чат под каждый запрос, один ответ, без повторных прогонов. Каждый из 36 текстов я прогнал через свой детектор: двенадцать взвешенных категорий признаков, от триколонов и интенсификаторов до плотности цифр и разброса длин предложений, плюс отдельная оценка LLM-судьи. Балл от 0 до 100: чем ниже, тем меньше машинных маркеров. Все 36 текстов заведомо написаны машиной: шкала меряет стиль, а не происхождение.
Рейтинг. Человечнее всех Meta AI, 31 балл. Дальше GigaChat (36.8) и Claude (42.2). Больше всего машинных маркеров у Mistral (74), LongCat (73.2) и Duck.ai (71.2). Между первым и последним местом 43 балла. Meta AI выиграла не слогом: она ответила на вопросы задания по существу, назвала диапазон диаметров, порядок цен, ожидаемую погрешность. Mistral на том же месте поставил таблицу, где во всех ячейках «Высокая» и «Низкая».
Детектору нельзя верить без брифа. Первый расчёт я выбросил целиком. Детектор штрафовал сервисы за рубрикацию, которую я сам задал в ТЗ, и за отсутствие цифр, которое там же и запретил выдумывать. После поправки на задание Hugging Face съехал с 67 баллов до 49.2, из группы самых машинных в середину рейтинга. Ошибка в 17.8 пункта на одном сервисе. Вывод для тех, кто принимает тексты от подрядчиков: гоняете статью через детектор, держите рядом бриф. Иначе накажете автора за структуру, которую сами же заказали.
Один сервис пишет двумя голосами. У Z.ai справка набрала 62 балла, рецепт 41. Двадцать один пункт разницы у одного движка. В справке он выдал 3.99 интенсификатора на 500 слов («предельно проста», «в разы дешевле»), в рецепте 0.79. Спрашивать, какая нейросеть пишет лучше, не уточнив жанр, бессмысленно.
Теперь неудобное. Эту статью набирала нейросеть под мою правку. Два публичных детектора, которыми пользуются редакторы и заказчики, дали 3% и 0% вероятности ИИ. То есть не заметили ничего.
Полный разбор 18 сервисов, методика, пять признаков генерации и открытые данные (36 текстов и таблицы расчётов, можете пересчитать и поспорить): https://sk-seo.ru/blog/kakaya-neyroset-pishet-chelovechnee.html