БлогУслугиКарьера
Обсудить проект
БлогУслугиКарьераОбсудить проект
Автоматизация

Claude Code съедает лимит: 7 способов тратить меньше токенов

Claude Code повторно читает историю, файлы и результаты инструментов. Показываем, где сгорает контекст и как сократить расход токенов без потери качества.

Редакция Feature
Редакция Feature·
18 авг
·
9 мин
·
Claude Code съедает лимит: 7 способов тратить меньше токенов

В понедельник разработчик открывает Claude Code с короткой просьбой: «Проверь, почему падает авторизация». Через час в сессии уже лежат схема базы, два лога по тысяче строк, конфигурация CI, результаты тестов и три отвергнутые гипотезы. Затем приходит невинное: «А теперь поправь текст ошибки». Но модель снова получает почти весь накопленный багаж.

Вот почему лимит иногда исчезает быстрее, чем движется задача. Токены в Claude Code расходуются далеко не на одни ваши сообщения и ответы на экране. Платит или ограничивает вас весь контекст, который система должна передать модели, чтобы та не потеряла нить разговора.

Проблема не в том, что Клод якобы прожорлив. Проблема начинается, когда рабочую память используют как архив. Разберём путь одного запроса, найдём невидимые статьи расхода и выстроим режим, в котором экономия не превращает сильный инструмент в беспомощный автокомплит.

Один короткий вопрос может нести за собой сотни страниц

Токен — это не слово и не символ, а фрагмент текста, который понимает модель. Точная разбивка зависит от модели и языка, поэтому считать русские слова «один к одному» нельзя. Для пользователя Claude Code полезнее другая схема: что именно попадает в очередной запрос.

По документации Anthropic о контекстном окне, до первого сообщения уже загружаются системные инструкции, корневой CLAUDE.md, память проекта, названия MCP-инструментов и описания навыков. Затем к ним добавляются:

  • ваши сообщения и ответы Claude;
  • содержимое прочитанных файлов;
  • вывод команд, тестов и инструментов;
  • изображения и документы;
  • инструкции, которые подключились для конкретного пути;
  • новый запрос пользователя.

На следующем ходе эта история не остаётся «где-то в памяти модели». Claude Code формирует новый API-запрос и снова передаёт контекст. Anthropic прямо описывает этот процесс в материале о prompt caching: модель не помнит предыдущий вызов, поэтому клиент повторяет системный промпт, проектный контекст, историю и результаты инструментов.

Отсюда четыре счётчика, которые часто смешивают:

Вид токенов Что это На что влияет
Входные Инструкции, история, файлы, результаты команд Размер контекста, лимиты и стоимость
Выходные Ответ, код и служебные блоки модели Стоимость и длительность генерации
Cache write Новая часть контекста, записанная в кэш Дороже чтения, но готовит следующие ходы
Cache read Уже обработанный неизменный префикс Читается заметно дешевле обычного входа

Кэш — не индульгенция для бесконечной переписки. Он снижает стоимость повторного префикса; в API-метриках Anthropic чтение кэша оценивается примерно в 10% стандартной цены входных токенов. Однако окно контекста всё равно занято, а любое существенное изменение префикса заставляет его строиться заново.

Почему токены сгорают быстрее, чем движется задача

Вернёмся к авторизации. Сначала Claude читает auth.ts — разумно. Потом по широкой просьбе «посмотри проект» открывает роуты, middleware, типы, конфигурацию и тесты. Команда выводит 800 строк лога. Неудачная гипотеза приводит к ещё одному чтению файлов. К пятому сообщению полезная задача занимает меньшую часть контекста, чем следы расследования.

Самые дорогие привычки выглядят безобидно:

  1. Широкая постановка. «Улучши кодовую базу» вынуждает модель сначала понять, что именно считать улучшением.
  2. Полные логи. Один stack trace полезен; десять тысяч строк повторяющихся предупреждений — балласт.
  3. Смешение задач. После исправления авторизации в той же сессии обсуждают SEO, Docker и текст кнопки.
  4. Раздутый CLAUDE.md. Каждая инструкция из корневого файла участвует в каждом запросе, даже если относится к редкому сценарию.
  5. Ненужные интеграции. MCP работает экономнее прежних решений благодаря отложенной загрузке схем, но подключённые инструменты всё равно создают служебный фон.

Мы уже разбирали, как AI-агенты превращают модель в исполнителя с инструментами. У этой силы есть цена: агентная работа производит больше промежуточных данных, чем обычный чат. Значит, управлять нужно не длиной ответа, а маршрутом задачи.

7 приёмов, которые сокращают расход без потери качества

1. Начинайте с границ, а не с экскурсии по репозиторию

Сравните два запроса:

Посмотри проект и исправь авторизацию.
При POST /api/login валидный пользователь получает 401.
Проверь src/auth/session.ts и связанный тест.
Не меняй схему БД. Готово, когда тест login-valid-user проходит.

Во втором запросе уже есть симптом, область поиска, запрет и критерий готовности. Claude читает меньше файлов, раньше проверяет гипотезу и реже переписывает решение. Это экономия не на качестве рассуждения, а на блуждании.

2. Делите рабочий день по задачам командой /clear

После исправления авторизации контекст полезен для рефакторинга того же модуля. Для настройки sitemap он вреден. Перед переключением назовите сессию через /rename, а затем выполните /clear. Вернуться к старой работе можно через /resume.

Anthropic называет очистку между несвязанными задачами одной из самых эффективных мер в руководстве по расходам Claude Code. Причина проста: старый контекст оплачивается или учитывается на каждом следующем ходе, даже когда больше не помогает.

3. Используйте /compact внутри задачи, а не вместо дисциплины

/compact заменяет длинную историю структурированным резюме. Команде можно указать, что сохранить:

/compact Сохрани найденную причину 401, изменённые файлы,
результаты тестов и нерешённый вопрос о refresh token

Это хороший ход перед второй фазой одной работы: причина найдена, впереди починка. Но бессмысленно сжимать смесь из пяти несвязанных задач — резюме всё равно унаследует шум. Кроме того, сама компактизация стоит отдельного запроса. Лучше запускать её на естественной границе, пока кэш ещё тёплый, а не после недельной паузы в старой сессии.

AI-инструменты расходуют бюджет без контроля?

Настроим процессы и метрики

Обсудить автоматизацию

4. Смотрите на /context до того, как появится предупреждение

Команда /context показывает, чем занято окно: системными инструкциями, памятью, инструментами и сообщениями. /usage помогает следить за текущим расходом; его можно вывести и в status line.

Мы относим эти команды к той же инженерной гигиене, что и мониторинг веб-приложения до аварии. Если проверять контекст только после сообщения о лимите, вы уже действуете в режиме инцидента. Достаточно смотреть на расклад перед крупным чтением логов, переходом к новой фазе и запуском нескольких агентов.

5. Отдавайте шумную разведку подагенту

Поиск по документации, разбор большого лога и инвентаризация сотен файлов производят много текста, который нужен один раз. Подагент выполняет такую работу в отдельном окне и возвращает в основную сессию итог. Официальное руководство по subagents рекомендует их именно для побочных задач, способных затопить основной разговор результатами поиска или чтения файлов.

Формулировка должна быть узкой:

Поручи Explore-агенту найти все места, где создаётся access token.
Верни только пути, краткую роль каждого места и вероятную точку ошибки.
Ничего не меняй.

Не путайте подагента с бесплатным параллелизмом. У него собственный контекст и собственные запросы. Вы выигрываете, когда отделяете шум от главной сессии; проигрываете, когда запускаете пять агентов «на всякий случай».

6. Сократите постоянный фон: CLAUDE.md, skills и MCP

Корневой CLAUDE.md должен содержать только правила, которые нужны почти всегда: команды проверки, архитектурные запреты, формат проекта. Длинные инструкции для одного каталога лучше вынести в path-scoped rules, а редкие процедуры — в skills, загружаемые по требованию.

С MCP действует тот же редакторский принцип: в выпуск попадает только то, что работает на тему номера. Проверьте /mcp, отключите неиспользуемые серверы и предпочитайте обычный CLI там, где он даёт тот же результат. Это особенно заметно в корпоративных конфигурациях с десятками сервисов — та же логика выбора по задаче работает при сравнении n8n и Make, а вовсе не в одних AI-инструментах.

Если вы проектируете такую среду для команды, автоматизация процессов должна описывать не одни лишь доступы к моделям, но и правила загрузки контекста. Иначе каждый новый коннектор одновременно расширяет возможности и повышает фоновый расход.

7. Не переключайте модель и effort без причины

У каждой модели и каждого уровня effort свой кэш. Переключение посреди длинной работы заставляет Claude Code заново обработать контекст. Поэтому модель лучше выбирать в начале этапа: более доступную — для поиска, типовых правок и тестов; более сильную — для архитектуры, сложной миграции или неоднозначного расследования.

Это не призыв всегда выбирать самый дешёвый вариант. Дешёвая модель, которая дважды идёт по ложному пути, легко обгонит дорогую по общему расходу. Экономия появляется, когда сложность модели соответствует цене ошибки.

Экспертное мнение: контекст — рабочая память, а не протокол совещания

Позиция редакции Feature IT: главный ресурс агентной разработки — не число вызовов и не длина промпта, а доля полезного контекста. Хорошая сессия содержит решения, ограничения и доказательства. Плохая хранит все черновики, логи и разговоры только потому, что их жалко выбросить.

Из этого следует практическое правило. Сохраняйте то, что меняет следующее решение:

  • цель и критерий готовности;
  • найденную причину ошибки;
  • выбранный архитектурный ход и отвергнутые альтернативы одной строкой;
  • изменённые файлы;
  • точный результат проверки;
  • открытые риски.

Сырые логи, повторные листинги каталогов и длинные ответы документации должны покидать основную сессию после того, как из них извлечён вывод. По той же причине в хорошей технической статье остаётся аргумент, а не стенограмма интервью.

Обсудим ваш проект?

Оставьте контакты — перезвоним и обсудим задачу

Режимы и лимиты: чем платит каждая настройка

Отдельный вопрос, который в чатах формулируют примерно так: «а как настроить, насколько сильно можно тратить токенов в Клоде» — то есть где вообще крутится эта ручка и как понять, что вы близко к потолку.

Модель

Самый крупный рычаг. В Claude Code модель переключается командой /model, и разница между семействами измеряется разами, а не процентами.

Опус — самая способная и самая дорогая; ему отдают то, где цена ошибки высока: архитектурные решения, тонкую отладку, рефакторинг с побочными эффектами. Соннет заметно дешевле и закрывает основную массу правок. Хайку самый лёгкий и хорош там, где задача механическая: переименовать, разложить, проверить формат.

Правило простое: выбирайте по цене ошибки, а не по привычке всегда брать лучшее.

Глубина рассуждения

Второй рычаг — сколько модель думает перед ответом. Чем глубже режим, тем больше внутренних рассуждений, а значит, токенов и времени.

Здесь работает та же логика. Разобрать гонку в асинхронном коде стоит глубокого режима. Переписать три функции по понятному образцу — нет.

Быстрый режим

Команда /fast включает ускоренную выдачу. Получаете вы при этом тот же Опус, а не модель поменьше. Качество не падает, растёт скорость вывода, и платите вы за скорость. Полезно, когда вы ждёте ответ и время дороже токенов; бессмысленно, когда задача фоновая.

Как понять, что упрётесь в лимит

Три сигнала, по возрастанию тревожности.

/context показывает, чем занято окно. Запускать его стоит не когда всё замедлилось, а перед дорогой фазой работы. Если больше половины окна занято логами и файлами, которые уже сыграли свою роль, до потолка ближе, чем кажется.

Ответы стали медленнее при той же задаче. Обычно это значит, что на каждый запрос уезжает всё более длинная история.

Появились предупреждения о приближении к границе окна. На этом этапе выбор уже сузился: либо /compact с указанием, что сохранить, либо /clear и новая сессия с кратким изложением результата.

Практический вывод: сессия, начатая в понедельник и дожившая до четверга, дорога не тем, что вы много работали, а тем, что в ней осталось всё, что вы успели прочитать по дороге.

Рабочий режим, который выдерживает длинную задачу

Соберём советы обратно в один день разработчика.

Утром он создаёт отдельную сессию для ошибки 401 и задаёт границы. Клод читает два релевантных файла, воспроизводит сбой и фиксирует причину. Перед починкой разработчик запускает /context: большую долю занимают тестовые логи. Он поручает подагенту проверить другие места выпуска токенов, получает пять строк вывода и делает /compact с указанием сохранить причину, файлы и тесты.

После исправления проходят целевые тесты. Сессия получает имя auth-401-fix. Для задачи по sitemap разработчик использует /clear, а не тянет за собой половину backend. Модель остаётся прежней до конца этапа, поэтому кэш не перестраивается на каждом повороте.

Короткий регламент команды выглядит так:

  1. Одна сессия — одна связная задача или один эпик.
  2. В первом сообщении есть область, ограничения и проверяемый результат.
  3. Большие логи сначала фильтруются, затем читаются.
  4. /context запускается перед дорогой фазой, /usage виден постоянно.
  5. /compact применяется на границе фаз, /clear — на границе задач.
  6. Исследования уходят подагенту, если основной сессии нужен только вывод.
  7. Модель и effort выбираются заранее и меняются лишь при смене характера работы.

Где экономия начинает вредить

Не стоит очищать контекст посреди сложной отладки, если в истории находятся тонкие ограничения и результаты экспериментов. Не нужно резать CLAUDE.md до пяти строк, если команда после этого регулярно нарушает архитектурные правила. И точно не следует отказываться от тестов ради короткого вывода: повторное исправление почти всегда дороже проверки.

Осторожнее и с агентными командами. Anthropic предупреждает, что несколько участников поддерживают независимые окна контекста, поэтому расход растёт примерно пропорционально числу активных агентов. Параллелизм оправдан, когда ветви работы действительно независимы и экономят календарное время, а не когда хочется увидеть больше движущихся строк в терминале.

Кэш тоже требует здравого смысла. Стабильная длинная сессия может быть экономичнее постоянных переключений модели, effort и системных настроек. Но кэшировать мусор дешевле, чем читать его заново, — всё ещё значит платить за мусор.

Токены заканчиваются не от работы, а от отсутствия монтажа

Claude Code силён тем, что удерживает длинную техническую линию: читает код, вызывает инструменты, проверяет результат и продолжает, помня прошлые решения. Обрезать эту линию до каждого отдельного вопроса — значит потерять главное преимущество агента.

Нужен не минимальный контекст, а смонтированный контекст:

  • оставляйте решения, удаляйте сырьё;
  • продолжайте связанную работу, очищайте несвязанную;
  • измеряйте окно до переполнения;
  • отделяйте шумную разведку от самой починки;
  • выбирайте модель по цене ошибки, а не по привычке.

Если Claude Code и другие AI-инструменты уже вошли в процессы команды, но их стоимость и качество трудно объяснить цифрами, мы в Feature IT проектируем управляемую автоматизацию: с границами, метриками и проверяемым результатом, а не с коллекцией разрозненных подписок.

Читайте также

  • Как заменить Zapier и Make российскими инструментами
  • Python-автоматизация: 15 скриптов для ежедневной работы
  • Server Components и Client Components: где проходит граница

Обсудим ваш проект?

Оставьте контакты — перезвоним и обсудим задачу

Содержание
  • Один короткий вопрос может нести за собой сотни страниц
  • Почему токены сгорают быстрее, чем движется задача
  • 7 приёмов, которые сокращают расход без потери качества
  • Экспертное мнение: контекст — рабочая память, а не протокол совещания
  • Режимы и лимиты: чем платит каждая настройка
  • Рабочий режим, который выдерживает длинную задачу
  • Где экономия начинает вредить
  • Токены заканчиваются не от работы, а от отсутствия монтажа
Поделиться:

Похожие статьи

Свои вебхуки: как отдавать события партнёрам и не потерять их
Автоматизация

Свои вебхуки: как отдавать события партнёрам и не потерять их

13 мин
OAuth 2.0 для интеграций: как подключить сайт к чужому сервису
Автоматизация

OAuth 2.0 для интеграций: как подключить сайт к чужому сервису

14 мин
Настройка API на сайте: 7 ошибок, которые вылезают только в проде
Автоматизация

Настройка API на сайте: 7 ошибок, которые вылезают только в проде

13 мин
Feature IT

Feature IT — платформа по обучению программированию и разработке цифровых продуктов. Мы создаём современные веб-решения для бизнеса и обучаем этому других!

Политика конфиденциальностиПользовательское соглашение

О компании

  • Блог
  • Карьера

Услуги разработки

  • Разработка сайтов под ключ
  • Веб-приложения на React/Next.js
  • Telegram-боты для бизнеса
  • Mini Apps (Telegram, VK)
  • SEO-оптимизированные сайты
  • Автоматизация бизнес-процессов
  • Поддержка и развитие IT-продуктов

Обучение

  • Курс Python с нуля
  • Алгоритмы и структуры данных
  • Паттерны проектирования
  • Подготовка к собеседованиям в IT
  • Практика на реальных проектах

Инструменты

  • Генератор UTM-меток
  • Счётчик символов