Почему 128K токенов контекста — это маркетинг, а не реальная память

Почему 128K токенов контекста — это маркетинг, а не реальная память

Вы загружаете в Claude документ на 50 страниц, задаёте вопрос по главе из середины — и модель отвечает невпопад. Вы уверены, что всё влезло в контекстное окно. Вы правы. Но это не значит, что модель это видит.

Свежее исследование Context Rot Evaluation доказало: огромные контекстные окна работают не так, как обещает маркетинг. Модели блестяще рассуждают о начале или конце документа, но их логика рассыпается, если суть задачи находится в середине. Разбираем, почему 128K токенов контекста — это не рабочий стол, а склад, где половина вещей лежит в тёмном углу.

Что такое контекстное окно на самом деле

Контекстное окно — это не память. Это объём данных, который модель обрабатывает за один запрос. Системный промпт, история диалога, ваш вопрос, ответ модели — всё вместе.

Модель не помнит прошлые разговоры. Она просто читает всё, что вы ей передаёте, каждый раз заново. Увеличиваете историю диалога — растут токены — растёт цена. И растёт вероятность, что модель запутается.

Размер контекстного окна измеряется не в словах и не в символах — в токенах. Токен — это примерно четыре символа в английском тексте, чуть больше в русском. Одно обычное слово — один-два токена. Редкое слово или имя собственное — может быть три и больше.

Русский текст содержит в полтора-два раза больше токенов, чем аналогичный английский. То есть реально дороже — и быстрее заполняет контекст.

Слепая зона в середине документа

Даже когда весь диалог технически влезает в контекстное окно — модель обрабатывает его неравномерно. Информация из начала и конца запроса воспроизводится значительно лучше, чем из середины. Середина размывается.

Исследование Context Rot Evaluation показало: если задача спрятана в глубине документа, модель начинает циклически возвращаться к старым решениям и повторно предлагать гипотезы, которые не помогли. Она знает, как решить задачу, но включает логику только тогда, когда вопрос находится в зоне комфорта — в финальных строках.

Почему так происходит — вопрос к механизму внимания. Модель вычисляет, насколько каждый токен важен для текущего предсказания. Токены из начала и конца получают больше внимания — возможно, потому что начало задаёт общий контекст задачи, а конец — самый свежий запрос. Середина оказывается в слепой зоне.

Это подтверждает ироничный факт: модель видит текст, но не использует его равномерно. Огромные контекстные окна — это наполовину маркетинговая фикция, пока архитектуры не станут позиционно-стабильными.

Что делать прямо сейчас

Практические выводы из исследований:

  • Важные инструкции — в начало или конец промпта. Не в середину большого документа. Лучше всего модель помнит начало и конец запроса.
  • Дублируйте критичное. Если задача решается по длинному документу, продублируйте ключевой промпт в самом конце.
  • Тестируйте слепую зону. При оценке модели всегда проверяйте выполнение задачи, спрятанной в глубине документа.
  • Короткие сессии вместо длинных. Во время длинных диалогов внутри контекста постепенно накапливаются старые инструкции, логи и промежуточные решения. Из-за этого модель теряет фокус.

Альтернативный подход — RAG, retrieval augmented generation. Вместо того чтобы пихать всё в контекст — хранить информацию во внешней базе и подтягивать только нужное прямо перед запросом. Модель получает маленький, но точный кусок контекста вместо огромного и размытого. Именно так работают корпоративные системы, которые умеют работать с тысячами документов.

Контекстное окно — это рабочий стол, а не склад

Всё, что лежит на столе — модель видит и анализирует. Всё, что упало со стола — не существует. При этом краям стола модель уделяет больше внимания, чем середине.

Производители моделей ведут агрессивную гонку контекстных окон: 128K токенов стали минимально необходимым стандартом, а некоторые модели заявляют и о поддержке миллионов. Но пока архитектуры не научатся равномерно распределять внимание по всему контексту — большие окна остаются маркетинговой метрикой, а не рабочим инструментом.

Хотите проверить, как работает контекстное окно на практике? В GEMERA AI доступны GPT, Claude и Gemini — модели с разными размерами контекста и разными стратегиями работы с ним. Попробуйте загрузить длинный документ и задать вопрос по середине. Результат может вас удивить.