Разработчик работал через API-ключ и платил за каждый токен напрямую. В пиковый день он отправил 8930 сообщений в девяти параллельных сессиях, а за 8 месяцев такой работы набежал счёт в 15 000 долларов — цифры приводит независимый разбор его случая. По той же оценке, сопоставимая по объёму нагрузка на подписке Max стоила бы около 800 долларов в месяц. История интересна не столько разницей в цене, сколько тем, насколько по-разному в Claude Code считаются лимиты — и как легко потратить в разы больше нужного, просто не зная механику.
В Claude Code одновременно работают две системы лимитов, и путать их — источник большинства неожиданностей со счётом.
Первая завязана на тарифы Pro и Max: расход считается в скользящем пятичасовом окне, отсчёт которого начинается с первого сообщения сессии. Отправил сообщение в 14:00 — окно закроется в 19:00, вне зависимости от того, писал ли человек что-то после. Поверх пятичасового окна лежит недельный лимит, фиксированный потолок на семь дней, в который упираются чаще всего при ежедневной интенсивной работе. Лимит общий для claude.ai, Claude Code и Claude Desktop: если утром человек активно переписывался с Claude в браузере, к вечеру в Claude Code запаса останется меньше.
Вторая система включается, когда Claude Code настроен на прямой API-ключ вместо подписки. Здесь никаких скользящих окон нет — вместо них жёсткие ограничения на запросы в минуту и токены в минуту, а платить приходится за каждый токен по факту, без единого потолка сверху. Разработчик из примера выше работал именно в этом режиме, поэтому автоматического стоп-крана у него не было — только растущий счёт.
По оценкам независимых разборов (официальная документация точных цифр по сообщениям не даёт), для пятичасового окна ориентир такой: Pro — около 45 сообщений, Max 5x — около 225, Max 20x — около 900. Цифры плавают в зависимости от модели, длины контекста в диалоге и текущей нагрузки на сервис — Opus расходует квоту заметно быстрее Sonnet, поэтому это скорее порядок величины, чем гарантия.
Собственный ориентир Anthropic касается не сообщений, а денег и рассчитан на корпоративные развёртывания: средний расход около 13 долларов на разработчика в день, 150-250 долларов в месяц, и у 90% пользователей расход не превышает 30 долларов в активный день. Разброс между этим средним и историей на 15 000 долларов за 8 месяцев API-работы — не аномалия конкретного человека, а то, что обычно происходит при непрерывной параллельной работе через API без встроенного потолка.
Официальная документация Claude Code перечисляет, откуда берётся неожиданный рост в долгой сессии, и почти все причины связаны с тем, что при каждом запросе Claude Code пересылает модели весь диалог целиком, включая сообщения, которые к этому запросу прямого отношения не имеют.
Главная причина — длинный контекст: даже короткий уточняющий вопрос в сессии, которая была открыта весь день, тянет за собой всю историю разговора. Кеш здесь снижает цену, но не бесплатно — час на подписке и всего пять минут при работе через API или облачного провайдера, и если пауза между сообщениями дольше этого времени жизни кеша, следующий запрос читает контекст заново по полной цене. Похожий эффект дают фоновые механизмы: запланированные задачи и сообщения из других сессий пользователя срабатывают, даже когда сессия формально простаивает, и каждый раз отправляют полный контекст заново. Своя цена есть и у самой команды /compact: сжатие истории требует прочитать её целиком, поэтому это тоже дорогой запрос, только разовый, в отличие от постоянно повторяющегося расхода на каждое новое сообщение. Мы уже разбирали, как точность агента проседает к третьему часу долгой сессии — корень проблемы тот же: чем дольше живёт диалог без /clear, тем дороже и хуже становится каждый следующий запрос.
Агентные команды из нескольких параллельных инстансов Claude Code добавляют отдельный множитель: когда задача разбита между несколькими агентами в режиме планирования, суммарный расход токенов может вырасти примерно в 7 раз против одиночной сессии — каждый агент держит собственное контекстное окно и загружает CLAUDE.md, MCP-серверы и скиллы независимо от остальных.
Первая и самая быстрая привычка — разделять несвязанные задачи командой /clear вместо того, чтобы тянуть один диалог часами: команда полностью обнуляет счётчик токенов для новой сессии, в отличие от /compact, который лишь сжимает уже накопленную историю. Вторая экономит на выборе исполнителя: Sonnet справляется с большинством рабочих сценариев дешевле Opus, а рутинные проверки и подготовительные шаги можно вообще делегировать более дешёвым моделям через субагентов — про выбор между скиллами, MCP и другими примитивами Claude Code мы отдельно писали раньше.
Третья группа привычек касается того, что попадает в контекст без явной необходимости. Каждый подключённый MCP-сервер держит в контексте список своих инструментов даже без дела, поэтому отключение неиспользуемых через команду /mcp освобождает место без потери функциональности. Похожая логика работает и с CLAUDE.md: файл загружается целиком в начале каждой сессии, и если в нём лежат подробные пошаговые инструкции для отдельных сценариев вроде код-ревью или миграций баз данных, эти токены присутствуют в контексте даже тогда, когда человек занят совсем другой задачей. Перенос такой специфики в отдельные скиллы, которые подгружаются только по вызову, держит базовый контекст меньше на постоянной основе.
Отдельно стоит planning mode перед сложной задачей: Claude сначала предлагает план и ждёт подтверждения вместо того, чтобы сразу переписывать код, который потом придётся откатывать и переделывать — это избавляет от повторной оплаты одной и той же работы, когда первое направление оказалось ошибочным.
Можно ли продолжить работу, если лимит подписки исчерпан посреди задачи? Да, если на аккаунте включены usage credits — они позволяют работать сверх лимита плана и доступны через команду /usage-credits после входа через подписку claude.ai. Без включённых credits придётся ждать сброса окна — время сброса Claude Code показывает прямо в сообщении об ограничении.
Переключение на другую модель командой /model освобождает лимит? Нет, лимит подписки общий для всех моделей внутри одного скользящего окна. Переключение с Opus на Sonnet не сбрасывает счётчик, оно лишь замедляет его расход в дальнейшем — Sonnet стоит дешевле по токенам за то же самое действие.
Как понять, что именно съедает лимит в конкретной сессии? Команда /usage показывает разбивку по последним 24 часам или неделе: сколько приходится на скиллы, субагентов, плагины и отдельные MCP-серверы, и отдельно отмечает, если какой-то паттерн — например, длинный контекст или частые промахи кеша — занимает от 10% недавнего расхода.
Разработчик, потративший 15 000 долларов через API за 8 месяцев, и его собственная оценка сопоставимой нагрузки на подписке в 800 долларов ежемесячно — иллюстрация одной и той же механики. Claude Code считает расход по полному контексту при каждом запросе, и лимиты подписки прячут эту механику за скользящим окном ровно до тех пор, пока не понадобится реальная параллельная нагрузка. Команда /usage показывает эту механику в реальном времени, и разобраться в ней дешевле, чем получить счёт постфактум. Такие практические настройки Claude Code предприниматели разбирают на встречах клуба — присоединяйся к AI Practiq, если подобные детали для тебя тоже всплывают только после факта.