Как контекстное окно съедает бюджет агентов: измеряем токены правильно

Пока разработчики спорят, какая модель лучше для агентов, главное ограничение уже не в качестве ответов, а в контекстном окне. Инженер из российского сообщества провёл измерение реального расхода токенов в MCP-агентах и обнаружил: схемы инструментов занимают всего 2% контекста, а их ответы — остальные 98%. Один многословный ответ инструмента способен перекрыть весь бюджет схем и продолжать это делать на каждом вызове.
Почему контекстное окно стало узким местом
Контекстное окно — это объём данных, который модель может обработать за один запрос. Измеряется в токенах: один токен равен примерно 0,75 слова в английском и 0,5 слова в русском. Туда попадают инструкции, история диалога, схемы инструментов и всё, что эти инструменты возвращают. Чем больше задач берёт на себя агент, тем чаще он упирается именно в этот лимит.
В 2023 году GPT-3 работал с окном в 4 тысячи токенов. Сейчас Claude поддерживает 200 тысяч, а Gemini заявляет о миллионе. Но рост лимитов не решил проблему: агенты стали выполнять более длинные задачи, и расход токенов вырос пропорционально. Особенно это заметно в корпоративных сценариях, где агент должен работать с десятками инструментов и сохранять контекст на протяжении всей сессии.
Где реально уходят токены в агентных системах
Традиционно считалось, что основной расход — это схемы инструментов. Ленивая загрузка и функция search_tools предлагались как основное решение: загружать описания инструментов только по мере необходимости. Но измерения показали другое:
- Схемы инструментов — статичные JSON-описания параметров и возможностей. Занимают 2% контекста и загружаются один раз.
- Ответы инструментов — динамические данные, которые возвращаются при каждом вызове. Занимают 98% и остаются в контексте до конца сессии.
Один снимок веб-страницы, листинг каталога или результат SQL-запроса на несколько десятков строк за один ход перекрывает весь бюджет схем. И продолжает это делать при каждом новом вызове. Экономия на схемах не трогает ту часть, что растёт всю сессию.
Что делать: три практических шага
Оптимизация агентов превращается в отдельную инженерную дисциплину. Вот что можно сделать прямо сейчас:
- Измерьте реальный расход. Большинство API предоставляют счётчики токенов в ответах. Зафиксируйте, сколько токенов уходит на схемы, сколько — на ответы инструментов, сколько — на историю диалога. Без измерений оптимизация превращается в гадание.
- Сократите ответы инструментов. Если инструмент возвращает HTML-страницу целиком, замените его на версию, которая извлекает только текст. Если листинг каталога содержит метаданные, оставьте только имена файлов. Каждый килобайт ответа — это токены, которые будут лежать в контексте до конца сессии.
- Управляйте историей. Не всё из истории диалога нужно держать в контексте постоянно. Определите, что можно суммаризировать, что выгрузить, а что оставить. Это особенно критично для длинных сессий с десятками вызовов инструментов.
Почему это важно для российских разработчиков
Релиз Claude Opus 4.8 28 мая 2026 года показал новый уровень агентных систем: модель планирует задачи и запускает сотни параллельных субагентов в одной сессии, охватывая миграции кодовых баз в сотни тысяч строк. Контекстное окно — 1 миллион токенов, но даже этого может не хватить, если каждый инструмент возвращает многословные ответы.
Для российских компаний, переходящих с иностранного ПО в рамках импортозамещения, использование агентов для рефакторинга и миграции legacy-кода особенно актуально. Но без контроля расхода токенов стоимость таких задач может вырасти в разы. Токен-оптимизация становится таким же важным навыком, как выбор модели и качество промпта.
Попробуйте Claude Opus 4.8 и другие модели для агентных задач в GEMERA AI — доступ через Telegram-бота и веб-кабинет, без блокировок и с поддержкой на русском языке.