Не сри там, где ешь: как нейросети портят поле, с которого сами кормятся

2026-09-13 16:14:27 Время чтения 5 мин 29

Спойлер сразу: нейросети медленно отравляют ту самую информационную среду, на которой учатся. Мы это знаем — и всё равно продолжим ими пользоваться. Не потому что не видим проблему, а потому что для каждого по отдельности отказ от ИИ невыгоден, даже если для всех вместе это плохо.

Замкнутый круг

Логика простая. Нейросети обучаются на текстах из интернета. Но в тот же интернет теперь массово попадают тексты, написанные самими нейросетями — статьи, комментарии, посты, ответы на форумах. Получается контур с обратной связью: модель ест то, что произвела модель поколением раньше.

Проблему формально описали ещё в 2023-м исследователи Оксфорда и Кембриджа, а в 2024-м она вышла в Nature под названием model collapse — деградация моделей при рекуррентном обучении на синтетических данных. Драматичного «модель вдруг начала писать бред» обычно не происходит. Происходит всё плавнее: падает разнообразие, стираются редкие и нетипичные варианты, текст становится более гладким и более пустым — читается нормально, но информации на предложение в нём меньше.

И это не гипотеза на будущее. Google в 2026 году несколько раз обновлял поисковый алгоритм именно под это явление — с прицелом на массовый низкокачественный ИИ-контент («AI slop»). После мартовского и июльского апдейтов контент-фермы и партнёрские сайты, которые тоннами генерировали статьи без редактуры, потеряли от 40 до 90% трафика. Это и есть первая волна пострадавших: не крупные разработчики моделей, а именно те, кто зарабатывал на масштабировании дешёвого ИИ-текста.

Так что, пользоваться будем?

Да, конечно будем. Это классическая ловушка коллективного действия: отказаться в одиночку не значит остановить процесс, значит просто отстать от тех, кто не отказался. Конкурентное преимущество побеждает соображения об общем благе почти всегда.

Раз мы всё равно плывём по этому течению, разумнее хотя бы не распылять внимание по десятку вкладок, подписок и лимитов — держать основные модели под рукой в одном месте. У меня для этого — Syntx.

🔗 syntx.ai — там основные нейросети собраны в одном интерфейсе, без переключений между вкладками и отдельных подписок.

Что делают с этим разработчики

У крупных лабораторий два основных ответа.

  1. Деньги за настоящие данные. Скрейпинг стал закрываться (Cloudflare с 2025 года блокирует ИИ-краулеров по умолчанию), а трафик с сайтов на ИИ-выдачу упал — вместе это подтолкнуло индустрию к лицензионным сделкам. С двух публичных сделок в 2023-м рынок вырос до около тридцати в 2026-м: OpenAI, Google и другие платят изданиям и площадкам напрямую за доступ к «чистым» текстам — то есть покупают то, что раньше просто забирали бесплатно.
  2. Маркировка. SynthID от Google DeepMind в 2026-м стала фактическим стандартом для изображений: её лицензировал даже OpenAI для картинок из ChatGPT и API. С текстом хуже — надёжного массового вотермаркинга для текстовых генераций пока нет ни у кого, кроме экспериментальной версии у Google, и это самое слабое звено во всей системе: изображение можно пометить, текст — почти нет.

То есть у больших игроков появляется прослойка защиты: платные данные + частичная маркировка. У всех остальных — у мелких стартапов, которые обучаются на открытом вебе, и у контент-ферм, которые этот веб засоряют, — такой прослойки нет. Именно они первыми получают на себе эффект деградации: и как потребители дешёвого синтетического инструмента, и как источник некачественных данных для следующего цикла.