McKinsey нашла способ остановить прожорливых пользователей ИИ

2026-09-17 10:02:35 Время чтения 4 мин 95

McKinsey столкнулась с неожиданным последствием массового внедрения ИИ: некоторые сотрудники начали расходовать настолько много токенов, что компании пришлось отдельно следить за их потреблением. Запрещать нейросети руководство не стало. Вместо этого сотрудникам решили просто показать, сколько вычислительных ресурсов они используют и как получить тот же результат дешевле.

К маю 2026 года McKinsey обрабатывала около 5 трлн ИИ-токенов в месяц. При этом потребление оказалось распределено крайне неравномерно: примерно 10% пользователей обеспечивали около 65% всего объёма. Среди самых активных пользователей оказались консультанты и разработчики.

Летом компания запустила систему персональных уведомлений. Если сотрудник заметно превышает обычный уровень потребления, ему приходит письмо с рекомендациями по более экономному использованию ИИ. Руководитель британского подразделения QuantumBlack Дебасиш Патнайк сравнил это с мобильным интернетом: человеку показывают расход трафика и объясняют, как выполнить ту же задачу с меньшими затратами.

Идея оказалась важной именно потому, что сотрудники часто выбирают самую мощную модель автоматически. McKinsey обнаружила, что для многих задач дорогие системы избыточны. Простую операцию можно поручить более дешёвой модели, а наиболее мощную оставить для этапов, где действительно требуется сложное рассуждение. Такой подход компания называет интеллектуальной маршрутизацией моделей.

Одних уведомлений недостаточно. Внутри McKinsey работает собственный ИИ-шлюз, который помогает оптимизировать запросы перед отправкой внешним моделям. Компания также использует ограничения при аномальных скачках потребления и кеширование, чтобы повторно не выполнять одинаковую работу.

Проблема при этом уже стала общей для корпоративного рынка. По данным исследования McKinsey среди 120 организаций, 93% опрошенных компаний сообщили, что превышают запланированные бюджеты на ИИ. При этом 62% уже перешли от экспериментов к реальному внедрению ИИ, а большинство ожидает роста расходов ещё как минимум на 25% в течение следующих 12 месяцев.

Причина в изменении самой модели оплаты. Компании всё чаще платят не фиксированную сумму за место сотрудника, а непосредственно за использование моделей. Поэтому один особо активный пользователь способен создать непропорционально большую часть расходов всей организации.

McKinsey считает, что грамотное управление так называемой AI tokenomics может сократить расходы на 20-30%. При этом компания предлагает смотреть не только на стоимость токенов, а на соотношение затрат и результата: сколько стоила работа ИИ, сколько времени она сэкономила и пришлось ли человеку исправлять результат.

Особенно актуальным это станет с распространением ИИ-агентов. В отличие от обычного чат-бота агент может самостоятельно выполнять десятки операций, обращаться к инструментам, проверять ответы и повторять действия. McKinsey отмечает, что агентские задачи способны потреблять примерно в 1000 раз больше токенов, чем обычное одношаговое рассуждение или чат с моделью.

Поэтому корпоративный ИИ постепенно превращается из вопроса «какую модель подключить сотрудникам» в вопрос управления вычислительным бюджетом. McKinsey фактически тестирует модель, при которой сотруднику не запрещают пользоваться ИИ, а дают понять цену каждого действия.