Почему рекордные инвестиции в искусственный интеллект пока не превратились в рост производительности и что об этом думает исследователь нейросетей и мозга.
Искусственный интеллект уже стал одной из главных статей расходов мировой технологической индустрии, но обещанный скачок производительности пока остается скорее ожиданием, чем фактом. Михаил Бурцев смотрит на этот разрыв с двух сторон: как математик, исследующий машинный интеллект, и как нейрофизик, хорошо понимающий, насколько сегодняшние модели не похожи на живой мозг.
Из этого разговора получается не очередной прогноз о скором AGI, а трезвый разбор того, что именно умеют LLM: где текстовая машина уже помогает науке и бизнесу, а где мы принимаем убедительный ответ за понимание мира.
Расшифровка подготовлена с помощью Speech2Text. Источник аудио.
Надя Грошева: Всем привет! Это «Экономика будущего». Меня зовут Надя Грошева, я медиадиректор Movchan’s Group.
Только в 2025 году в компании, связанные с искусственным интеллектом, было вложено $202 млрд венчурного капитала. Это половина всех венчурных денег на планете. Крупнейшие технологические компании мира планируют потратить на инфраструктуру ИИ еще $700 млрд в этом году. При этом главный экономист Goldman Sachs недавно признал: вклад этих инвестиций в реальный экономический рост в 2025 году составил практически ноль.
80% компаний, внедривших искусственный интеллект, не зафиксировали никакого измеримого эффекта на производительность. Наш сегодняшний гость — один из немногих людей, кто смотрит на искусственный интеллект сразу с двух сторон: изнутри, как математик, исследующий его основы, и снаружи, как человек, который провел годы в институтах, изучавших живой мозг. Михаил Бурцев, математик, нейрофизик, создатель DeepPavlov, стипендиат London Institute for Mathematical Sciences. Михаил, добрый день!
Михаил Бурцев: Добрый день. Спасибо за приглашение.
Надя Грошева: Михаил, давайте начнем с основ. Искусственный интеллект — он действительно интеллект? Как работают LLM, которые большинство из нас сейчас используют?
Михаил Бурцев: Мне кажется, что точное определение интеллекта мы сегодня не найдем: ученые в этом расходятся. Но мы можем порассуждать и понять, как действительно работает современный искусственный интеллект.
Если расшифровать LLM, это Large Language Models, большие языковые модели. Но прежде чем говорить о больших языковых моделях, нужно понять, что такое языковая модель. Самая простая математическая языковая модель: мы открываем книгу, случайно тыкаем пальцем в страницу и спрашиваем, какое слово там увидим. Зная частоты слов, мы можем посчитать вероятность. Это самая примитивная языковая модель.
Более сложная языковая модель появляется, если мы берем слово, например «мама», и спрашиваем, какое следующее слово будет в тексте. Мы можем посчитать вероятности попарных взаимодействий между словами во всех текстах, которые у нас есть. А теперь представьте модель, которая может предсказать следующее слово, прочитав страницу или 20 страниц. Такое предсказание будет гораздо более адекватным: одно дело — случайное слово, другое — «мама мыла раму», где «мыла» вероятнее как следующее слово.
Чем больше слов в начале мы добавляем, тем лучше можем предсказывать, что будет дальше. Языковая модель начинает вести себя так, что мы, пользователи, воспринимаем это как осмысленную деятельность и будто общаемся с интеллектом. Но на самом деле это предсказание следующего слова, сделанное при помощи гораздо более сложных алгоритмов, чем простой подсчет вероятностей: при помощи нейросетей.
Нейросеть — это алгоритм, который позволяет на многих текстах выучить статистические зависимости и предсказывать следующие слова. Здесь есть более глубокая параллель: чтобы адаптироваться к среде и вести себя интеллектуально, живые организмы должны предсказывать следующие состояния среды и получать обратную связь. В некотором смысле механизм предсказания является основой любого интеллекта.
Вопрос в том, насколько модель, которая выучилась предсказывать только текст, будет воспроизводить интеллектуальные способности. Это открытый вопрос. Предсказание следующего слова часто называют «стохастическим попугаем»: модель просто выучила, как попугай, предсказывать следующее слово. Но, может быть, именно в этом и кроется загадка интеллекта.
Надя Грошева: Получается, что простейшая модель, которая работает по такому принципу, давно всем знакома: T9, когда нажимаешь слово «добрый», а он автоматически подсказывает «вечер». Но между T9 и ChatGPT или Claude — пропасть. Можно спросить гораздо больше. За счет чего получается эта разница: это более современный алгоритм?
Михаил Бурцев: Есть два фактора. Первый — совершенство самого алгоритма: он содержит во много раз больше параметров, которые описывают связи между различными частями текста. Второй — объем данных, на которых эти связи выучены. Сегодня такие алгоритмы учатся на всех текстах, которые человечество сгенерировало, чтобы предсказывать следующие слова.
Языковую модель можно представить как губку, которая впитала все возможные продолжения всех текстов, которые видела. Но критический элемент, ставший очевидным после появления ChatGPT в конце ноября 2022 года, в другом. Если модель просто знает продолжения текстов и вы ее что-то спрашиваете, в обучающей выборке есть много похожих продолжений, которые она может сгенерировать. Она может переключаться между вариантами, и это приводит к галлюцинациям или к бесполезным ответам.
Поэтому был придуман способ дообучить языковую модель так, чтобы она выдавала не любой ответ, а ответ, обладающий полезностью для человека. Именно это стало технологическим прорывом и привело к массовому принятию языковых моделей. Они существовали и до этого много лет, но не давали такого качества.
Я сам был очень поражен, когда увидел, как работает ChatGPT: до этого я работал с подобными моделями, строил диалоговые системы, которые общаются с пользователями, и не ожидал такого качества генерации. Прорыв OpenAI в том, что они добились хорошего следования узкой задаче: помочь пользователю решить проблему, объяснить что-то или предложить план действий.
Надя Грошева: У меня тоже было сильное личное впечатление: когда я впервые пользовалась ChatGPT в конце 2022 года, я не была связана с языковыми моделями и была в шоке, что такое вообще возможно. Как человеку, который работает с текстами, мне казалось невероятным, что есть кто-то, кому можно поручить написание текстов, создание сайтов или генерацию видео, и это не живые люди, а им просто выдаешь задачи, и они решают.
Но при этом ChatGPT, например, плохо считает и решает пространственные задачи. Что именно есть в этой модели и чего в ней нет?
Михаил Бурцев: Когда мы общаемся с моделью, нам психологически удобно представлять, что собеседник обладает здравым смыслом и такой же моделью окружающего мира, как и мы. Благодаря этому человеческая коммуникация возможна: мы не описываем все в мельчайших деталях, а говорим только о том, чем ситуация отличается от типичной, подразумевая, что человек понимает остальное.
Все знание модели об окружающем мире получено из текстов. Она никогда не видела предмет, падающий на Землю, и не экспериментировала с ним. Она знает только тексты, которые прочитала. Поэтому у нее есть слепые пятна.
С расчетами ей сложно, потому что модель вероятностная. Грубо говоря, есть десятки тысяч возможных вариантов следующего слова, и нужно выбрать один. Иногда она путается в рассуждениях и не может себя проверять. Человек может написать вычисления, перечитать их, усомниться и исправить. Современным моделям чаще всего сложно исправлять собственный уже сгенерированный текст, если специально не заставлять их это делать.
Но эта проблема решается. Если речь о математическом расчете, мы можем подключить к LLM внешнюю систему, которая перепроверит вычисления. Тогда можно найти ошибку, дать модели обратную связь и попросить альтернативное решение.
Надя Грошева: Почему одна нейросеть отличается от другой? Видно, что ответы Claude отличаются от ответов ChatGPT: они более конкретные, по-другому находят информацию. На чем это основано?
Михаил Бурцев: Можно представить языковую модель как двигатель. Сегодня этот двигатель спрятан внутри большой машины или системы. Сами модели по характеристикам могут быть похожи у OpenAI и у Anthropic, у ChatGPT и Claude. Но двигатели можно по-разному настраивать: важно, что используется в посттренинге, когда модель направляют в определенную сторону рассуждения.
Обычно собирается небольшая подвыборка данных с типовыми взаимодействиями. Если одно типовое взаимодействие будет написано на фене, а другое — как в институте Академии наук, то после посттренинга, даже при одинаковой начальной модели, поведение будет разным. Так появляются разные «персональности» и разная подача информации.
Вторая вещь — интеграция внешних знаний и поиска. Она позволяет добавить в модель новую информацию, которую модель напрямую не запомнила. Часть часто встречающихся фактов она запоминает при обучении, а редкие или новые факты — нет. Поэтому в контекст, куда мы пишем вопрос, можно подать текст из поиска, и модель будет рассуждать уже на его основе.
То, как устроен поиск, у ChatGPT и Anthropic может отличаться: разные провайдеры, отбор результатов, форматирование данных в контексте. Поэтому ответы получаются разными.
Надя Грошева: Недавно у меня был пример: я попросила ChatGPT проанализировать сценарий, где упоминалось, что Мадуро был вывезен в США. Он написал, что это выдумка, потому что Мадуро — президент Венесуэлы, и предложил исправить сценарий. Видимо, данные обновляются неравномерно.
В одном из интервью вы называли ChatGPT слепоглухонемым, потому что он не взаимодействует с миром. Можете подробнее пояснить, как это происходит?
Михаил Бурцев: Все, что видит ChatGPT, — это фактически текст. Конечно, есть варианты моделей, которым можно подавать картинки, и модели, которые генерируют изображения. Это может быть сделано разными способами: та же модель генерирует не слова, а некоторые образы, которые потом транслируются в картинку, или отдельная модель по текстовому контексту генерирует картинку для чата. В этом смысле модель что-то «видит». Но слепоглухонемая она потому, что у нее нет прямого взаимодействия с миром.
Ее единственная форточка во внешний мир — человек, пользователь, с которым она разговаривает, и язык. Сейчас есть отдельное направление: исследователи говорят, что у нас есть large language model, а теперь нужно строить large world model. Под world model подразумевается идея сделать модели зрячими, слышащими и способными что-то делать в окружающем мире, чтобы они приобретали недостающие знания.
Промежуточный шаг — обучать модели на видео. У нас есть много роликов на YouTube и вообще записей, которые показывают, как что-то происходит в мире: яблоки падают на Землю, люди летают с парашютом, автомобили двигаются, двери открываются и закрываются. Модель может выучить динамику окружающей среды: мы даем ей возможность следить за миром, когда она учится предсказывать следующий кадр.
Модель генерации видео работает почти так же, как языковая модель, только предсказывает не следующее слово, а следующий кадр. Но в видео есть сложность: много склеек, смен планов и повествования. Если модель видит один кадр, а затем совсем другую сцену, ей тяжело предсказать такой переход. Ей нужны первые несколько кадров, чтобы за что-то зацепиться и продолжать генерировать.
При этом уже есть модели, где видео можно управлять: например, вы идете по пространству, нажимаете стрелки вправо-влево, меняете направление взгляда, и модель генерирует видео в зависимости от изменения точки зрения и скорости.
Надя Грошева: С генерацией видео за последние пару лет тоже произошел огромный прогресс. Но если говорить о связи моделей с миром: у нас появляются не просто LLM, а агенты. Они действуют уже не внутри чата, а внутри компьютера, могут общаться с людьми, звонить и так далее. Это принципиально что-то меняет?
Михаил Бурцев: С точки зрения способности модели это пока ничего принципиально не меняет, потому что модели не учатся на этих взаимодействиях, а только реализуют их. Мы как разработчики создаем систему, где есть много управляющих LLM. Агент — это обертка вокруг LLM, в которую записан сценарий взаимодействия этой LLM с окружающим миром.
Когда мы создаем много агентов, мы фактически берем одну и ту же LLM, но заставляем ее по-разному смотреть на одну и ту же ситуацию и делать разные вещи. Реальное взаимодействие есть, но пока эти данные не собираются для последующего обучения модели и не включены в предобучение. Поэтому прямой обратной связи у модели нет.
Конечно, влияние растет: модель живет в киберпространстве, может прочитать сайт, написать код, получить или отправить данные, разговаривать с другими агентами. Отсюда и разные эксперименты, и шутки о том, как агенты договариваются нанять людей или взаимодействуют друг с другом.
Агенты действительно все больше внедряются в жизнь. Но здесь нужно быть аккуратными и понимать, как ограничивать эти системы, чтобы они не сделали того, чего мы не хотим.
Надя Грошева: Да, уже много историй о том, как кто-то, например, из Meta добавил на компьютер агента, который начал рассылать письма и делать другие действия.
Михаил Бурцев: Если выдать ему свою банковскую карту, он может купить что-нибудь, чего захочет или сочтет нужным. Поэтому не стоит давать такой доступ напрямую. Или нужно выдавать какое-то ограниченное средство.
Надя Грошева: Хочется верить, что военные не начнут внезапно использовать такие системы и выдавать им права, которые не дали бы новичкам. Если продолжать разбираться в нейросетях и в том, как они устроены: что такое трансформеры?
Михаил Бурцев: Трансформеры — это один из вариантов нейросетей, если говорить грубо. Это нейросеть, которую разработали специально для лучшей обработки последовательностей. Языковая модель работает с последовательностью элементов — слов — и должна предсказать следующее слово. При этом объем слов, по которому нужно предсказывать, бывает разный.
Была задача придумать систему, которая могла бы работать с разной длиной входной последовательности. Сначала для машинного перевода использовались рекуррентные нейронные сети; их активно применяли, например, в Google Translate. Где-то в 2016 году, а затем в 2017 году в Google предложили архитектуру, которая попыталась упростить рекуррентную нейросеть с точки зрения расчетов, чтобы ее удобнее было считать параллельно. Она получила название Transformer.
Главное нововведение — механизм внимания. Чтобы понять, что ей предсказывать, модель может разными способами посмотреть на уже имеющийся текст, вытащить разные аспекты этого текста и использовать их для предсказания следующего слова.
Надя Грошева: Не очень понятно. Это все-таки набор моделей, которые действуют по-разному, а не только предсказывают следующее слово?
Михаил Бурцев: Нет, это одна и та же модель. Представьте, что, чтобы предсказать слово, вы проходите много этапов — как слои нейронной сети. На первом этапе вы думаете: «Я вижу такие-то слова, может быть, следующим будет вот это». Потом снова смотрите на ситуацию: «Я подумал, что слово будет “мама”. А теперь проверю: подходят ли другие слова под “мама”? Может быть, все-таки “папа”?»
У вас есть 30 или 50 таких шагов, прежде чем вы окончательно выберете слово. Нейросеть в таком механизме что-то «вспоминает» про один вариант, потом проверяет контекст: есть ли в тексте нужные признаки. Эти итеративные рассуждения приводят к тому, что в конце концов выбирается слово, лучше всего подходящее под заданный контекст.
Механизм внимания — это как раз ситуация, когда нейросеть что-то «вспомнила», а потом просматривает разные аспекты контекста: для одного варианта она смотрит одни аспекты, для другого — другие.
Надя Грошева: А насколько это похоже на работу реального мозга?
Михаил Бурцев: Вообще не похоже, честно говоря. Или очень слабо похоже. Нейронными сетями это называется потому, что сеть состоит из маленьких элементов, каждый из которых называется нейроном, и его математическая модель была вдохновлена моделями настоящих нейронов. Но затем все ушло настолько в сторону, что структура нейросети в целом уже никак не напоминает то, что есть у живых организмов.
Надя Грошева: Ваши исследования в Лондоне — это математические основы более умного искусственного интеллекта, включая ИИ, который помогает математикам. Что значит научить искусственный интеллект математике и чем это отличается от того, что умеют GPT?
Михаил Бурцев: На самом деле GPT и Claude тоже хорошо разбираются в математике. Компании используют математику, потому что в обывательском смысле она кажется самой умной деятельностью, которую можно представить в виде текста: сложные формулы, рассуждения, закорючки, нужно долго учиться.
Чтобы хорошо понимать область математики, нужно потратить много времени: запись очень сжатая, нужно выстроить большую систему знаний об абстрактных объектах, почувствовать, как они работают. Поэтому компании пытаются маркетировать модели как более умные за счет того, что они лучше решают математические задачи или могут доказать теорему.
Для этого придумывают способы заставить модели рассуждать на языке математики. Помогает то, что это языковые модели, а математика — очень языковая деятельность. Если вы ничего не записываете, заниматься математикой в голове тяжело. Нужно записывать вычисления и проверять их. Эти вычисления следуют четким правилам.
Модели нужно выработать интуицию и представление о том, какие цепочки символов и последовательности действий вообще существуют в математике. Здесь модели успешны, особенно в плане кругозора: в отличие от большинства математиков, они видели почти всю доступную математику. Если после основного обучения еще дообучить модель на математических материалах, она начнет лучше предсказывать следующие действия и рассуждения внутри математических формализмов.
Математика хороша для интеграции с большими языковыми моделями еще и потому, что она верифицируема. Рассуждения можно проверить на компьютере. В естественном языке утверждения смешивают факты о мире и логику, поэтому их сложнее формализовать. А в математике многое содержится в самом тексте.
Сейчас ведутся исследования по переводу текстового математического языка в более формальное математическое описание, похожее на компьютерную программу, которую можно запустить и проверить, нет ли в выкладках ошибок. Но важна и интуиция: проверка показывает, есть ли ошибки, а чтобы найти доказательство или контрпример, нужно сначала предложить решение. Перебрать все способы рассуждать невозможно.
Надя Грошева: Насколько мы сейчас приближаемся к моменту, когда искусственный интеллект сможет делать открытия? Сейчас он может искать или писать текст на основе уже загруженной информации. Возможно ли, что когда-нибудь он будет находить новые материалы, формулы новых материалов или делать физические открытия?
Михаил Бурцев: Сейчас над этим идет активная работа, и мы видим постепенное внедрение искусственного интеллекта в научный процесс. Первое, что уже используют многие ученые, — языковые модели для редактирования текстов. Есть статья, и очень много времени уходит на то, чтобы отполировать текст. Я могу быстро написать основные утверждения, но потратить несколько часов на превращение пяти предложений в абзац, который легко прочитает человек. Модель помогает сохранить ту же информацию, но сделать ее удобной для читателя.
Второй вариант — использовать модели для написания кода. Я могу сказать: «Вот мои данные, хочу построить такой-то график», и LLM построит график. Раньше я должен был сам писать код или делать вычисления, теперь могу сделать это быстрее. Фактически я использую LLM как более мощный калькулятор. Конечно, за ней нужно перепроверять, потому что она может ошибиться.
Третий сценарий — когда мы начинаем новый проект или зашли в тупик и хотим понять, что еще связано с нашим вопросом. У модели широкий кругозор: она может выдать идею из соседней области, которая имеет отношение к моей. Я пойду по ссылкам, найду статью, прочитаю, разберусь, и это поможет преодолеть барьер в исследовании. Это использование модели для поиска литературы и обзора.
Можно с ней дискутировать: «Вот у меня получился такой результат, что ты думаешь?» Она может предложить интерпретации, но это уже сложнее. Если у вас есть описание экспериментов или математических результатов, модель чаще просто опишет то, что видит. Ей трудно сделать выводы, которых заранее не было, если вы явно не сформулируете гипотезу и не попросите проверить, подтвердилась она или нет.
Уровень интерпретации результатов для моделей пока тяжелый. Хорошо сформулированные математические задачи — например, олимпиадные — они могут решать очень хорошо, потому что задача компактная: можно искать и проверять. А формулировка новых гипотез или новых методов — уровень, к которому мы еще не приблизились. Современные модели с трудом генерируют новые концепты или абстракции. Если дать наводку, модель быстро обрастит ее связями с тем, что знает, но придумать новую идею ей тяжело.
С другой стороны, если мы можем обучить похожую модель для молекул или белков, появляются другие возможности. Знаменитый пример — AlphaFold, модель, которая по описанию белка предсказывает его трехмерную структуру. Белки — молекулы, из которых состоят живые организмы; это важно для разработки новых лекарств.
Если спросить, может ли такая модель придумать новый белок, который будет выполнять важную функцию, я думаю, что в таком смысле новизны модели уже сегодня могут это делать. Можно задать таргет — молекулу, с которой должен связываться белок, — и модель, перебирая и генерируя последовательности, может найти ту, которая будет связываться. Это пока не сверхэффективный метод, потому что приходится перебирать очень много вариантов, но такие решения научных задач уже возможны.
Я надеюсь, что этого будет больше. Это усилитель интеллекта ученого.
Надя Грошева: С одной стороны, усилитель, а с другой — тот, кто помогает освободить время.
Михаил Бурцев: Да. Мы ускоряем процесс познания окружающей среды и конструирования артефактов, завязанных на это знание. Это позволяет быстрее транслировать знания в технологии и использовать их в экономике: упрощать процессы, лечить людей, получать новые материалы.
Мы сейчас находимся в переходном периоде. Если смотреть шире, всю эволюцию на Земле можно рассматривать как последовательность приобретения интеллектуальных способностей. Способность выживать в среде зависит от того, насколько хорошо ты можешь ее предсказать. Если не можешь что-то предсказать, не можешь к этому приспособиться. Можно много предсказывать и ничего не делать — тогда тоже не выживешь, но предсказание является обязательным условием.
В процессе эволюции росли когнитивные способности. У одноклеточных организмов не было нервной системы, они приспосабливались и предсказывали только через изменение экспрессии генов — через то, как с ДНК считываются и генерируются новые белки. Потом появились многоклеточные организмы и нервная система: механизм обработки информации из среды и координации клеток организма для адаптации. Это был новый многоклеточный механизм предсказания будущего.
Потом у человека появился язык — принципиально новый механизм предсказания будущего: мы можем записывать, оставлять записи, делать расчеты. Потом появился компьютер, и он позволил создать искусственный интеллект. Сейчас ИИ — это примерно как возникновение языка у человека: уникальный период эволюции природы, когда появляется дополнительная возможность гораздо более мощного предсказания.
Мы можем лучше предсказывать, что ожидает нас в будущем, и за счет этого предусматривать последствия: не делать то, что делать не стоит, и делать то, что нужно.
Надя Грошева: Как это может повлиять на самих людей? Раньше был поисковик, и можно было найти информацию, а сейчас часть задач можно отдать искусственному интеллекту. Если в ближайшие два года будет прорыв, похожий на предыдущие два года, мы сможем делегировать большой массив задач. Как это повлияет на мозг людей, если им не нужно будет решать эти задачи?
Михаил Бурцев: Можно привести несколько примеров. Человечество изобрело двигатель внутреннего сгорания, появился автомобиль, люди стали ездить на автомобилях и общественном транспорте, меньше ходить. Но люди стали заниматься спортом и бегать. Казалось бы, логика подсказывает, что мышцы ног должны атрофироваться, все должны сидеть в мягком кресле, есть и смотреть телевизор. Я утрирую, конечно, но этого не происходит.
В школе давно есть калькулятор, но это не значит, что у всех атрофировались мозги. До сих пор есть математики, которые хорошо работают, хотя им не нужно считать большие числа в столбик. Мне кажется, здесь будет то же самое.
Другой пример — менеджеры. Человек сначала занимался конкретной задачей, например управлял станком. Потом понял производственный процесс на уровне цеха и стал заведующим цехом. Потом стал директором завода и уже делегирует управление станком другому человеку, а сам думает о том, как работает все производство. Потерял ли он навык управления станком? Возможно, пока он дорос до директора, станки трижды поменялись и он уже не сможет вернуться к старому станку. Но есть другие люди, которые этим занимаются.
Я не вижу здесь чего-то драматического. Люди расслоятся: кому-то будет интересно заниматься более верхнеуровневыми вещами, кому-то — мелкоуровневыми, и они продолжат это делать. Как люди бегают, хотя их никто не заставляет.
Надя Грошева: Вернемся к развитию искусственного интеллекта. Есть популярная дискуссия о суперинтеллекте и о том, можно ли с помощью LLM прийти к AGI. Правильно ли это называется «суперискусственный интеллект»? Как вы это видите: можно ли прийти туда через LLM и какой прорыв нужен, чтобы появился суперинтеллект?
Михаил Бурцев: Стоит немного порассуждать о терминах. До последнего времени был просто искусственный интеллект: деятельность машины, которая реализует функцию человека, которую мы называем интеллектуальной. Человек играет в шахматы — это интеллектуальная деятельность. Если программа играет в шахматы, мы можем назвать ее искусственным интеллектом.
Затем появилось другое определение — AGI, Artificial General Intelligence. Речь уже не о воспроизведении отдельных функций человека, а об универсальном, общем искусственном интеллекте, который может реализовывать много разных функций и обучаться им.
Если уточнять дальше, можно говорить о human-level artificial intelligence: алгоритме, который может делать любую интеллектуальную работу и обучаться не хуже человека, то есть на уровне человека. А superintelligence — интеллект лучше человеческого. Как он будет выглядеть, трудно представить: мы знаем человеческий интеллект, а супер-интеллект можем представить только с трудом.
Могут ли LLM прийти к суперинтеллекту? Трудно сказать. Многие раньше сомневались, что предсказание следующего слова вообще может привести к чему-то интеллектуальному. Илья Суцкевер много лет занимался GPT и говорил о необходимости универсальной модели, а потом что-то действительно заработало: функция предсказания следующего слова, которая кажется нам простой, для пользователей выглядит как очень интеллектуальная деятельность.
Поэтому я бы не зарекался, что LLM-подход не приведет к чему-то более высокому с точки зрения способности рассуждать, чем у человека. С другой стороны, сейчас активно развиваются world models: мы моделируем не только языковую функцию, но и другие функции, связанные с восприятием окружающего мира. Когда мы будем соединять их друг с другом, может получиться мультимодальная модель, которая хорошо ориентируется во всех этих модальностях и может в них предсказывать. Возможно, это будет следующим шагом. Пока такую модель не создали, мы не можем говорить о возникновении суперинтеллекта.
Надя Грошева: Михаил, вы хорошо представляете, как устроены нейросети. Какие риски вы видите в их создании?
Михаил Бурцев: Основные риски, на мой взгляд, сегодня связаны с тем, что мы пока не до конца понимаем границу доверия технологии. Возможны эксперименты, при которых системы встроят в какие-то критические процессы. Это очень маловероятно, но такое может случиться.
Почему маловероятно? У нас уже есть люди, и люди тоже не очень хорошо предсказуемы. Мы не знаем, как думает другой человек и что ему придет в голову. Но при этом есть рамки: человек приходит на работу и делает то, что должен делать. Никто не гарантирует, что он вдруг не перестанет это делать, не нажмет не ту кнопку или не направит самолет куда-нибудь не туда.
Если LLM будет обладать предсказуемостью хотя бы на уровне человека, то системы, с которыми взаимодействует человек, уже имеют некоторую степень устойчивости к отклонениям человеческого поведения. Если модель находится в тех же рамках, мы более-менее защищены: она не сможет сделать того, что запрещено делать человеку.
Очевидно, если мы даем модели доступ к важной информации или важным действиям, она должна проходить такую же проверку, как человек. Не всем подряд дают управлять заводом или самолетом: люди должны учиться, быть сертифицированы. Простая практика — применять то же самое к моделям: сертифицировать, тестировать на большом числе ситуаций и только после этого доверять управление чем-то. Так можно снижать риски.
Много говорили, например, что GPT-2 будет писать fake news и интернет заполнится ими. Но, на мой взгляд, это изначально было похоже на маркетинг и хайп. Люди и так могут писать что угодно; это не значит, что этому будут доверять. Сейчас в соцсетях много фейковых видео с политиками, но люди понимают, что BBC и TikTok — разные источники. Мне кажется, это не главная проблема.
Более сложный сценарий — гипотеза, что искусственный интеллект станет очень умным, сможет использовать инфраструктуру человека в своих целях и захватит контроль. Этот сценарий можно рассмотреть, но он кажется мне очень маловероятным. Во-первых, у искусственного интеллекта сегодня нет собственных целей и субъектности. Он продолжатель чего-либо или генерирует цели из того, что мы в него записали, а мы стараемся эти цели ограничить.
Даже если предположить, что он такие цели себе сгаллюцинировал, любые действия в окружающем мире требуют времени и энергии. Нужно потратить электроэнергию на расчеты, на перенос данных, на взлом систем. Если дата-центр вдруг стал тратить на 10% больше энергии, владелец это увидит. На каждом этапе есть обратная связь, позволяющая заметить, что что-то идет не так.
Поэтому сценарии, где искусственный интеллект неожиданно делает что-то глобальное, маловероятны: это требует большой энергии и длительного времени. Захватить мир за одну секунду невозможно — нужно скоординировать очень много элементов.
Надя Грошева: Подводя итог и говоря про будущее: в каких областях вы ожидаете главный прорыв в ближайшие 10 лет? Где может быть прорыв благодаря искусственному интеллекту?
Михаил Бурцев: Если говорить о прикладных вещах, современные LLM дадут волну повышения эффективности процессов: ускорение ведения бизнеса, упрощение вычислений, документации и многого другого. В экономике важным будет внедрение того, что уже есть, в существующие бизнесы. Это займет время.
Другой важный вопрос — энергетика. Чем больше у нас энергии и чем она дешевле, тем лучше: мы можем сделать больше, быстрее и за меньшие деньги, меньше зависим от ископаемых, которые неравномерно распределены по планете. Я думаю, исследования в искусственном интеллекте позволят создавать новые материалы и новые способы извлечения энергии, которые будут дешевле, а также помогут легче хранить и генерировать энергию. Это может сильно усилить рост экономики.
Вторая важная область — медицина и здравоохранение. Население стареет. Есть очень молодые люди, которым не хватает еды и санитарных условий, им нужно помочь выживать. Есть пожилые люди, которым нужен уход и лечение возрастных заболеваний. Это большой драйвер инноваций, которые помогут людям жить лучше и дольше.
Есть еще метауровень. Экономика — это структурированная деятельность по кооперации людей друг с другом. Когда появились деньги, они сильно упростили процессы кооперации: не нужно было выстраивать длинные цепочки бартера. Теперь представьте искусственный интеллект, который может гораздо лучше искать людей, с которыми стоит кооперироваться.
Если каждый человек сможет найти свое место в глобальной системе кооперации, эффективность экономической деятельности может существенно повыситься. Я не знаю, сопоставимо ли это с изобретением денег, но это очень важный фактор, который изменит то, как развивается экономика.
Надя Грошева: Надеюсь, так и будет. Михаил, спасибо вам огромное и удачи в делах!
Михаил Бурцев: Спасибо вам большое за приглашение и всем слушателям за внимание. Надеюсь, всем было интересно.
Надя Грошева: Да, было супер интересно. Спасибо большое.