Токены съедают деньги, а контекст теряется: как устроена память нейросети

Вы пишете длинный запрос, модель отвечает невпопад. Вы загружаете документ на 50 страниц — нейросеть цитирует только начало и конец. Вы запускаете агента на задачу — счёт за токены взлетает до сотен долларов. Всё это не баги и не капризы модели. Это прямое следствие трёх технологий, на которых стоит любая большая языковая модель: токенизация, контекстное окно и механизм внимания. Понимание этих процессов превращает работу с ИИ из лотереи в управляемый инструмент.
Токены — не слова, а счётчик денег
Токен — это не слово и не символ. Это фрагмент текста, на который токенизатор делит любой ввод перед передачей в модель. Одно слово может стать одним токеном или распасться на три-четыре куска. Например, слово непременно токенизатор GPT режет на неп и ременно, а борщ — на бор и щ. Для модели токены не несут смысла — это просто числовые идентификаторы, по которым она ищет статистические закономерности в обучающих данных.
Провайдеры ИИ выставляют счета именно за токены: отдельно за входные (ваш промпт плюс контекст), отдельно за выходные (ответ модели), а флагманские рассуждающие модели вроде GPT-5.5 тратят ещё и промежуточные токены на внутренние цепочки мышления. Если агент читает сотни документов с одним и тем же подробным промптом, каждая итерация съедает тысячи токенов — и бюджет тает на глазах.
Практический вывод: чем короче и точнее промпт, тем дешевле работа модели. Но есть нюанс — короткий промпт не значит неинформативный. Контекст нужен, просто его надо подавать правильно.
Контекстное окно — не бездонный карман
Контекстное окно — это объём токенов, который модель может удержать в памяти за один запрос. У GPT-5.5 это миллион токенов, у Claude Opus 4 — до двух миллионов. Звучит внушительно, но на практике работает с оговорками.
Исследования показывают эффект lost in the middle: модель отлично использует начало и конец контекста, но важные детали из середины документа часто теряет. Если вы загрузили инструкцию на 40 страниц и спросили про пункт из раздела номер 23, есть риск, что нейросеть процитирует введение или заключение, а нужный абзац пропустит.
Решение — не полагаться на сырую загрузку длинных текстов. Вместо этого используйте RAG-пайплайны: система сначала ищет релевантные фрагменты по вашему вопросу, затем передаёт только их в контекст модели. Так нейросеть получает концентрированную выжимку вместо хаотичной кучи данных. Ещё один приём — явные сводки и конспекты: если диалог растянулся на десятки реплик, промежуточное резюме помогает модели не забыть ключевые договорённости.
Агенты вызывают функции — и это меняет правила промптинга
Классические модели отвечают текстом. Агенты — делают: редактируют код, запускают команды, читают файлы, иногда удаляют то, что трогать не следовало. Под капотом работает механизм Tool Calling — модель получает список доступных функций и сама решает, когда и как их вызвать.
Промпты для агентов пишутся иначе. Вместо пошаговых инструкций нужен контекст-пакет: роль агента, примеры правильного поведения, ограничения, критерии успеха и метаданные (какие файлы открыты, текущее состояние проекта). Жёсткие микроинструкции теперь мешают — они ломают встроенные цепочки рассуждений модели и заставляют её следовать неоптимальному шаблону.
OpenAI в июне 2026 года прямо призвала разработчиков отказаться от старых промптов: GPT-5.5 с внутренним Reasoning сама выстраивает логику решения, а детальные рамки только сбивают её с толку. Индустрия переходит от промпт-инжиниринга к контекст-инжинирингу — управлению тем, что модель знает на старте, а не тем, как она должна думать.
Что это меняет
Понимание токенов, контекста и агентов снимает мистику с работы нейросетей. Вы перестаёте гадать, почему модель ответила не так, и начинаете управлять процессом: оптимизируете промпты под бюджет токенов, структурируете длинные документы через RAG, настраиваете агентов через контекст-пакеты вместо микроменеджмента.
Эти технологии доступны уже сейчас — и работают во всех флагманских моделях. В GEMERA AI вы можете попробовать GPT-5.5, Claude Opus 4 и Gemini 3 Pro в одном интерфейсе: сравните, как разные архитектуры обрабатывают один и тот же контекст, проверьте расход токенов на реальных задачах и найдите баланс между качеством ответа и стоимостью запроса.