Почему 128K токенов контекста — это маркетинг, а не реальная память

Вы загружаете в Claude документ на 50 страниц, задаёте вопрос по главе из середины — и модель отвечает невпопад. Вы уверены, что всё влезло в контекстное окно. Вы правы. Но это не значит, что модель это видит.
Свежее исследование Context Rot Evaluation доказало: огромные контекстные окна работают не так, как обещает маркетинг. Модели блестяще рассуждают о начале или конце документа, но их логика рассыпается, если суть задачи находится в середине. Разбираем, почему 128K токенов контекста — это не рабочий стол, а склад, где половина вещей лежит в тёмном углу.
Что такое контекстное окно на самом деле
Контекстное окно — это не память. Это объём данных, который модель обрабатывает за один запрос. Системный промпт, история диалога, ваш вопрос, ответ модели — всё вместе.
Модель не помнит прошлые разговоры. Она просто читает всё, что вы ей передаёте, каждый раз заново. Увеличиваете историю диалога — растут токены — растёт цена. И растёт вероятность, что модель запутается.
Размер контекстного окна измеряется не в словах и не в символах — в токенах. Токен — это примерно четыре символа в английском тексте, чуть больше в русском. Одно обычное слово — один-два токена. Редкое слово или имя собственное — может быть три и больше.
Русский текст содержит в полтора-два раза больше токенов, чем аналогичный английский. То есть реально дороже — и быстрее заполняет контекст.
Слепая зона в середине документа
Даже когда весь диалог технически влезает в контекстное окно — модель обрабатывает его неравномерно. Информация из начала и конца запроса воспроизводится значительно лучше, чем из середины. Середина размывается.
Исследование Context Rot Evaluation показало: если задача спрятана в глубине документа, модель начинает циклически возвращаться к старым решениям и повторно предлагать гипотезы, которые не помогли. Она знает, как решить задачу, но включает логику только тогда, когда вопрос находится в зоне комфорта — в финальных строках.
Почему так происходит — вопрос к механизму внимания. Модель вычисляет, насколько каждый токен важен для текущего предсказания. Токены из начала и конца получают больше внимания — возможно, потому что начало задаёт общий контекст задачи, а конец — самый свежий запрос. Середина оказывается в слепой зоне.
Это подтверждает ироничный факт: модель видит текст, но не использует его равномерно. Огромные контекстные окна — это наполовину маркетинговая фикция, пока архитектуры не станут позиционно-стабильными.
Что делать прямо сейчас
Практические выводы из исследований:
- Важные инструкции — в начало или конец промпта. Не в середину большого документа. Лучше всего модель помнит начало и конец запроса.
- Дублируйте критичное. Если задача решается по длинному документу, продублируйте ключевой промпт в самом конце.
- Тестируйте слепую зону. При оценке модели всегда проверяйте выполнение задачи, спрятанной в глубине документа.
- Короткие сессии вместо длинных. Во время длинных диалогов внутри контекста постепенно накапливаются старые инструкции, логи и промежуточные решения. Из-за этого модель теряет фокус.
Альтернативный подход — RAG, retrieval augmented generation. Вместо того чтобы пихать всё в контекст — хранить информацию во внешней базе и подтягивать только нужное прямо перед запросом. Модель получает маленький, но точный кусок контекста вместо огромного и размытого. Именно так работают корпоративные системы, которые умеют работать с тысячами документов.
Контекстное окно — это рабочий стол, а не склад
Всё, что лежит на столе — модель видит и анализирует. Всё, что упало со стола — не существует. При этом краям стола модель уделяет больше внимания, чем середине.
Производители моделей ведут агрессивную гонку контекстных окон: 128K токенов стали минимально необходимым стандартом, а некоторые модели заявляют и о поддержке миллионов. Но пока архитектуры не научатся равномерно распределять внимание по всему контексту — большие окна остаются маркетинговой метрикой, а не рабочим инструментом.
Хотите проверить, как работает контекстное окно на практике? В GEMERA AI доступны GPT, Claude и Gemini — модели с разными размерами контекста и разными стратегиями работы с ним. Попробуйте загрузить длинный документ и задать вопрос по середине. Результат может вас удивить.