ИИ постепенно становится не только инструментом для людей, но и крупнейшим потребителем других ИИ-моделей. По данным OpenRouter, к 10 августа агентские системы потребляли около 7,3 трлн токенов за семь дней против 1,4 трлн у пользователей. То есть на долю агентов приходилось примерно в 5,2 раза больше токенов, чем на прямые обращения людей.
Перелом произошёл ещё 6 февраля: тогда объём агентского трафика впервые превысил человеческий. За следующие шесть месяцев потребление агентов выросло примерно в 14 раз — с 510 млрд до 7,3 трлн токенов. Человеческий трафик за тот же период увеличился примерно в 2,8 раза.
Причина в самой механике работы агентов. Человек обычно отправляет один запрос, получает ответ и принимает решение о следующем шаге. Агент же самостоятельно разбивает задачу на этапы, обращается к базам данных и внешним сервисам, пишет код, проверяет результат, исправляет ошибки и повторяет операцию. Один запрос пользователя поэтому может превращаться в десятки или сотни обращений к моделям.
При этом рост числа токенов не означает пропорционального роста счетов. Почти 70% агентского трафика на OpenRouter приходится на кешированные промпты: система повторно использует уже обработанный контекст, а не оплачивает его как новый. Поэтому фактическая стоимость растёт медленнее общего объёма токенов.
Но даже с учётом кеширования экономика становится критичной. Чем длиннее цепочка действий агента, тем больше операций приходится оплачивать. Поэтому разработчики всё чаще комбинируют модели: дорогие системы оставляют для сложного рассуждения, а простые действия передают дешёвым моделям.
Это уже отражается на структуре спроса. OpenRouter отслеживает использование сотен моделей, а через платформу ежедневно проходит более 10 трлн токенов. В августе Stripe объявила о покупке OpenRouter; сумма сделки, по данным Reuters, превысила $8 млрд. Сам OpenRouter на тот момент обслуживал более 10 млн разработчиков и компаний.
На этом фоне цена одного миллиона токенов становится всё более важным конкурентным преимуществом. Например, DeepSeek V4-Flash стоит $0,14 за миллион входных и $0,28 за миллион выходных токенов, тогда как у GPT-5.6 Sol эти показатели составляют $4 и $20. Для агента, который делает тысячи обращений в сутки, такая разница быстро превращается в существенную сумму.
В результате рынок ИИ может перейти от модели «лучшая нейросеть для каждого запроса» к модели «правильная нейросеть для каждого шага». Агенту необязательно использовать самую мощную модель для поиска информации, форматирования файла или проверки простого результата. Если задача выполняется миллионы раз, даже несколько центов экономии на тысяче операций становятся значимой частью инфраструктурных расходов.
Это меняет и саму конкуренцию между разработчиками моделей. Раньше главным показателем считались качество ответа и результаты бенчмарков. Для агентского ИИ к ним добавляются цена токена, скорость генерации, эффективность кеширования и стоимость всей цепочки действий. В итоге победить может не самая умная модель, а та, которая позволяет выполнить задачу дешевле.