Расход токенов 🥵 Что съедает лимит сильнее всего?

Я думал, что токены уходят на ответы модели. На самом деле почти все уходит в другое место

Вчера провел глубокий анализ и выделил пять главных факторов, от самого сильного к самому слабому:

1. Длинная переписка в одном окне
Модель не помнит разговор между шагами. На каждом твоем сообщении и на каждом своем действии она заново перечитывает всю переписку с самого начала. Чем длиннее окно, тем дороже каждый следующий шаг. Сжатие переписки по умолчанию включается только тогда, когда окно почти переполнено. До этого сотни шагов идут на огромном окне

👉 Сжимай переписку раньше (/compact) или начинай новую беседу, когда закончил этап
💡 Я сократил рабочее окно в настройках с 1 млн. до 500к токенов

2. Суб-агенты
Когда Claude/Codex запускает помощников для исследований, проверок и исполнения задач, у каждого свое окно, и каждое тоже расходует токены. Несколько помощников сразу могут съесть больше, чем основной разговор

👉 Запускай суб-агентов только для действительно важных задач
💡 После выхода Opus 5.5 эта проблема вообще ушла и модель реально вызывает суб-агентов только там, где нужно

3. Перерывы дольше часа
Anthropic/OpenAI держит твою переписку в быстрой памяти около часа. После долгой паузы все окно загружается заново целиком, и чем оно больше, тем дороже это обходится

👉 Перед ночью или долгим перерывом сожми переписку через команду (/compact)
💡 Для меня это вообще было открытием 😳 Теперь не оставляю процессы висеть без ответа более 1 часа вообще

4. Стартовый вес беседы
Еще до первого слова беседа уже что-то весит: твои правила, список навыков, подключенные дополнения, память. Все это едет с каждым шагом

👉 Отключи дополнения, которыми не пользуешься, и держи файл правил коротким
💡 Провел ревизию всего, что загружается в контекст, и вычистил 25% мусора - Claude.md/Agents.md, Memory.md, MCP и так далее

Мой пример. Я разобрал свой расход за месяц:

• 97% всех токенов ушло на перечитывание старой переписки, а сами ответы модели заняли меньше 1% 🤯
• окно разрасталось почти до миллиона токенов, и каждый шаг в среднем перечитывал около 520 тысяч
• помощники за неделю съели больше половины расхода, 57%
• новая беседа еще до первого слова весила около 80 тысяч токенов

Главный вывод: платишь не за ответы, а за то, сколько раз модель перечитывает все, что было до них 😉