Дорогая модель не должна читать файлы — как маршрутизация задач меняет стоимость Claude Code

2026-09-12 21:05:17 Время чтения 13 мин 25
Папки с документами на обложке статьи о том, как маршрутизация задач меняет стоимость Claude Code

Дорогая модель не должна читать файлы — как маршрутизация задач меняет стоимость Claude Code

Стоимость Claude Code складывается из токенов, и механическая работа занимает в этом счёте больше места, чем кажется. Инструмент открывает файлы и тащит их содержимое в контекст до конца сессии, а оплачивается всё по цене той модели, которая сессию ведёт. Приём, который меняет эту арифметику, выглядит буднично — чтение файлов и однотипную писанину забирает модель в несколько раз дешевле, а дорогая работает уже с готовой выжимкой.

В начале сентября 2026 года продакт-менеджер Spotify Dimitri Mazmanov выложил в инженерном блоге компании замер такого разделения — разбор о том, как делегирование чтения файлов срезало токены на массовых чтениях. Средняя экономия на чтении в его тестах вышла около 90%, и относится она только к чтению.

Почему счёт растёт быстрее, чем объём работы

Anthropic в своём руководстве по управлению расходом в Claude Code первыми среди причин роста счёта называет длинный контекст и промахи мимо кэша. В каждый ход уходит содержимое файлов, вызовы инструментов и многошаговое рассуждение целиком.

Вопрос «где в этом проекте формируется цена заказа» требует одного абзаца ответа, но чтобы этот абзац написать, модель откроет все файлы, где эта цена может формироваться, и оплачены будут они целиком.

Прочитанное дальше остаётся в контексте до конца сессии и переезжает в каждый следующий запрос, так что один раз открытый большой файл оплачивается многократно. Про то, что происходит с контекстом Claude Code к третьему часу работы, мы писали отдельно, там речь шла о качестве ответов; на счёт та же механика действует так же исправно.

Anthropic там же советует смотреть разбивку вместо догадок. Команда /usage помечает поведение, на которое приходится 10% и больше недавнего расхода, а кроме контекста и кэша в списке причин стоят запланированные задачи, сообщения между сессиями, сверки по целям, агентные напарники и сжатие истории.

Что сделали в Spotify и откуда взялись 90%

Внутри Spotify работает своя платформа Portal. В ней настраивается режим, то есть маленький агент, которому задают собственную модель и собственный круг задач.

Первый режим, bulk-reader, включается там, где Claude иначе прочитал бы несколько больших файлов ради одного ответа. Второй, code-writer, берёт на себя предсказуемую писанину — тесты, каркасы конфигов, заготовки типов, всё, где результат выводится из уже существующих образцов. В обоих примерах рабочая модель Gemini 2.5 Flash, и оба режима автор выложил публично.

Замер сравнивал токены, которые Claude потратил бы, читая файлы напрямую, с токенами, которые уходят на чтение сводки от bulk-reader. Проверка шла на Java-монорепозитории по четырём сценариям, но 90% — это среднее только по массовому чтению. Экономию на генерации кода автор в токенах не измерял, отдельной цифры по ней нет.

Перенести эти 90% на свой счёт нельзя. На операциях массового чтения разница между дорогой и дешёвой моделью действительно измеряется разами, но проверяли её на большом монорепозитории, где однотипного кода много.

Схема разделения задач Claude Code: чтение файлов у дешёвой модели, отладка и архитектура у дорогой

Какая работа уходит вниз, а какая остаётся наверху

Маршрутизация вниз у автора замера явным образом исключает отладку, архитектурные решения и код, где цена ошибки высока.

В его тестах рабочая модель нашла поверхностные закономерности, но пропустила тонкий баг потокобезопасности, а Claude увидел этот баг за секунды, как только получил нужный контекст. Такую ошибку не видно по результату, потому что наверх приходит аккуратная связная сводка, в которой просто нет главного.

Сводки рабочей модели не содержат надёжных номеров строк, а при редактировании кода они нужны, так что перед правкой Claude всё равно откроет нужный кусок сам, и экономия на этом шаге кончается.

Без потерь вниз уходит однообразная работа:

  1. ответить на один вопрос по содержимому многих файлов;
  2. собрать инвентаризацию, где что лежит, какие есть обработчики, чем отличаются две папки;
  3. сгенерировать однотипный текст по готовому образцу — тесты, конфиги, заготовки;
  4. пересказать длинный лог или выгрузку, из которых нужны две строки.

Наверху остаётся то, где нужно принять решение.

Из чего складывается стоимость Claude Code по тарифам

Миллион входящих токенов у Opus 5 стоит 5 долларов, у Sonnet 5 — 2 доллара, у Haiku 4.5 — 1 доллар; на исходящих токенах разрыв шире, 25, 10 и 5 долларов соответственно. Цены сняты с прайс-листа Anthropic на модели 9 сентября 2026 года. На этом разрыве приём и держится.

Там же Anthropic отмечает, что цена Sonnet 5 в 2 и 10 долларов, объявленная при запуске как вводная, стала постоянной, а запланированный рост до 3 и 15 долларов отменён. Чтение из кэша считается по одной десятой от входящей цены, а пакетная обработка через Batch API стоит вдвое дешевле, так что у расхода есть рычаги и помимо выбора модели.

Claude Code входит в тариф Pro, который стоит 20 долларов в месяц при помесячной оплате и 200 долларов, если платить сразу за год, и в Max, начинающийся со 100 долларов. У подписчика токены оплачены заранее, а расходуется лимит, так что экономия принимает другую форму, и сессия, в которой чтение отдано дешёвой модели, упирается в потолок позже.

Агентные команды в режиме планирования расходуют примерно в семь раз больше токенов, чем обычная сессия, потому что каждый участник держит своё контекстное окно и работает отдельным экземпляром. Деньги экономит разделение работы по цене модели, а число параллельных агентов на счёт не влияет.

Как собрать то же самое без внутренней платформы

Тот же приём собирается штатными субагентами Claude Code, и своя платформа для него не нужна. Субагент описывается отдельным файлом, а модель ему задают полем model в заголовке этого файла.

По документации Anthropic о субагентах, туда пишется sonnet, opus, haiku, fable, полный идентификатор модели или inherit, если нужно унаследовать текущую. Работает субагент в собственном контекстном окне, историю диалога он не видит и наверх отдаёт только результат, а весь многословный вывод остаётся у него.

Для простых задач Anthropic прямо рекомендует ставить субагенту haiku, а объёмные операции уводить вниз, чтобы наверх поднималась одна сводка.

На своём проекте это раскладывается на четыре шага:

  1. Посмотреть, на что уходит сессия. Если половина ходов — это открывание файлов ради ориентировки, приём даст эффект.
  2. Завести субагента-разведчика на дешёвой модели с одной задачей: найти и коротко ответить.
  3. Оставить за дорогой моделью решения — план, архитектуру, разбор ошибки, правку кода.
  4. Сравнить расход до и после на одном и том же вопросе, вместо того чтобы поверить на слово.

Рядом с субагентами в том же руководстве стоят хуки, которые перехватывают вывод до того, как он попадёт в контекст. Вместо лога на десять тысяч строк модель получает только строки с ERROR, и десятки тысяч токенов сжимаются до сотен.

Где приём не окупается

  1. Мелкие чтения. У Spotify делегированный вызов обычно занимает от 10 до 30 секунд, а на 30 секундах Portal обрывает вызов. Открыть небольшой файл напрямую быстрее, чем дождаться ответа.
  2. Переделка. Если дешёвая модель не справилась и работу пришлось повторить наверху, оплачены оба вызова, а время потеряно на обоих.
  3. Маленький проект. Замер Spotify сделан на большом шаблонном монорепозитории. Чем меньше и разнороднее проект, тем меньше в нём работы, которую есть смысл отдавать вниз.

Сводка от дешёвой модели приходит наверх одинаково уверенной и когда в исходнике всё найдено, и когда там осталось незамеченное. В счёте этот риск не отражается никак.

Частые вопросы

Сколько стоит Claude Code в месяц? Pro стоит 20 долларов в месяц при помесячной оплате и 200 долларов, если платить сразу за год; Max начинается со 100 долларов в месяц. При работе через API счёт считается по токенам, и по данным Anthropic о корпоративных внедрениях средний расход выходит около 13 долларов на разработчика в активный день и 150–250 долларов в месяц, а у 90% пользователей дневная сумма остаётся ниже 30 долларов.

Правда ли, что маршрутизация срезает расход на 90%? Нет. 90% — это средняя экономия на операциях массового чтения файлов в личных тестах продакт-менеджера Spotify на Java-монорепозитории. Общий счёт так не падает, и на другом проекте цифра будет другой.

Какую модель ставить рабочей? В примерах Spotify рабочая модель Gemini 2.5 Flash, хотя поле модели принимает любую, настроенную в их системе. Внутри Claude Code штатный дешёвый вариант Haiku, у которого миллион входящих токенов обходится в доллар против пяти у Opus 5.

Что нельзя отдавать дешёвой модели? Отладку, архитектурные решения и код, где цена ошибки высока. Автор замера исключил их явно, после того как рабочая модель пропустила в его тестах тонкий баг потокобезопасности.

Нужна ли для этого своя платформа? Нет. Субагенты Claude Code позволяют задать модель отдельно каждому агенту полем model в его описании, и каждый субагент работает в своём контекстном окне.

Почему сессия дорожает к концу? Прочитанные файлы остаются в контексте и едут в каждый следующий запрос. Длинный контекст и промахи мимо кэша Anthropic называет среди первых причин, по которым расход в длинной сессии растёт сам по себе.

Экономят ли токены параллельные агенты? Сами по себе нет. Агентные команды в режиме планирования расходуют примерно в семь раз больше токенов, чем обычная сессия, потому что каждый участник держит своё контекстное окно.

Что с этим делать на своём проекте

Стоит посмотреть на свою текущую сессию и посчитать, сколько в ней поиска и переписывания по образцу. Эта работа стоит в разы дешевле у модели попроще, и ужать её можно, не трогая качество решений.

Данные в статье актуальны на 9 сентября 2026 года. Цены и тарифы Anthropic меняются, перед расчётом стоит свериться с прайс-листом.

Про такие настройки Claude Code — от выбора модели до поведения лимитов — мы пишем в канале клуба AI Practiq, читать его можно без заявки.

Категории: Кейсы