В 2023 году казалось, что проблема обучающих данных для языковых моделей решена навсегда.
Действительно, зачем платить разметчикам и годами собирать закрытые базы, если можно взять мощную флагманскую модель, нагенерировать миллионы синтетических диалогов и обучить на них следующую версию? Индустрия радостно открыла вентиль, а веб моментально заполнился сотнями миллионов сгенерированных статей, синтетическим кодом и автоответами на форумах.
К 2026 году этот триумф обернулся тяжелейшим похмельем, которое исследователи окрестили синдромом автофагии.
Выяснилось, что интернет, отравленный собственными текстами нейросетей, больше не пригоден для обучения моделей следующего поколения. Попытка накормить новую модель текстами, написанными ее предшественницами, приводит к катастрофическому схлопыванию качества - эффекту Model Collapse.
Разбираем, почему рекурсивное обучение отрезает модели память о реальном мире, и как лаборатории пытаются спасти обучение жесткой верификацией в компиляторах.
В июле 2024 года группа исследователей из Оксфорда, Кембриджа и Торонто опубликовала в журнале Nature фундаментальную статью о рекурсивном обучении.
Корень проблемы лежит в статистике языка.
Живая человеческая речь и реальный код подчиняются закону длинного хвоста. В них есть массивный пласт редких событий - специфические инженерные термины, нестандартные архитектурные трюки, диалекты языков программирования и экзотические ошибки, которые встречаются один раз на миллион документов. Именно в этом длинном хвосте зашита настоящая гибкость мышления и эрудиция.
Когда генеративная модель создает текст, она использует статистическое сжатие. При генерации события из длинного хвоста с микроскопической вероятностью почти никогда не попадают в итоговый ответ. Модель усредняет реальность и выдает только то, что лежит в центре колокола вероятностей.
Когда модель второго поколения начинает учиться на синтетических текстах первой модели, дисперсия обучающей выборки уменьшается. Хвосты распределения просто отсекаются. Редкие факты забываются, а нестандартный синтаксис исчезает. С каждым новым шагом рекурсии плотность вероятности стягивается к центру, пока модель не превратится в статистический генератор однообразных штампов.
Исследователи провели показательный эксперимент: взяли базовую модель, сгенерировали датасет, обучили на нем вторую модель, повторили цикл генерации и дошли до пятого поколения.
Вот как выглядела эволюция ответа на сложный вопрос о сетевом сбое:
К пятому поколению модель начисто забыла устройство физического мира, оставив лишь пустую грамматическую оболочку.
Осознание этого тупика вызвало тектонический сдвиг на рынке данных.
Открытый интернет образца 2024-2026 годов признан токсичным. Собственно, в нем слишком высока доля скрытого нейросетевого мусора. Если залить свежий срез веба в предобучение, базовая модель родится с искаженным восприятием реальности.
Главной ценностью индустрии стали чистые источники, созданные строго до массового релиза ChatGPT в конце 2022 года. Лаборатории скупают оцифрованные фонды университетских библиотек, архивы бумажных журналов XX века, закрытые корпоративные репозитории за 2010-2021 годы и стенограммы радиопереговоров. Цена доступа к проверенным историческим архивам выросла в десятки раз.
Означает ли это, что синтетические данные окончательно закрыты? Нет.
Умерла слепая текстовая синтетика, когда одна модель пишет эссе, а вторая слепо его заучивает.
В 2026 году стандартом стало обучение с подкреплением в верифицируемых средах. Модели разрешено учиться на синтетике только при условии, что результат проверяется независимым программным арбитром.
В программировании модель может сгенерировать миллион вариантов функций, но в обучающий датасет попадут только те строки, которые успешно скомпилировались в песочнице и прошли сотню юнит-тестов на граничные условия. В математике шаги доказательств прогоняются через строгие интерактивные среды вроде Lean 4. В базах данных сгенерированный SQL выполняется на тестовом кластере, и сверяется фактический результат выборки.
Компилятору и тестам плевать на усредненные вероятности. Они пропускают дальше только то, что работает физически.
Эра бесконечного скрейпинга открытого веба закончилась.
Языковые модели больше не могут питаться собственным отражением в зеркале интернета. Как мне кажется, будущее будет принадлежать либо закрытым архивам человеческих текстов прошлого века, либо жестким математическим средам, где каждая синтетическая строчка проходит проверку компилятором.