Стоит ли радоваться миллиону токенов в новой Claude Haiku 5.5?

Стоит ли радоваться миллиону токенов в новой Claude Haiku 5.5?

7 октября Anthropic выпустила Claude Haiku 5.5 — самую дешёвую модель в истории компании, с контекстным окном на миллион токенов и ценой, упавшей почти в десять раз. Заголовки вышли бодрые: «дешевле», «быстрее», «умнее». Но если разобрать цифры по частям, картина получается куда менее глянцевой — и это хороший повод спокойно поговорить о том, что токены, контекстное окно и агенты на самом деле означают технически, а не в рекламных карточках.

Токен — не слово, и правила могут поменяться без предупреждения

Токен — это кусок текста, на который модель режет ввод перед обработкой, и количество символов на один токен зависит от языка и конкретной модели. В английском один токен — это примерно три-четыре символа, в русском — заметно меньше, а значит русскоязычные тексты обычно занимают больше токенов при том же смысле.

С Haiku 5.5 есть отдельная ловушка: модель перешла на новый токенизатор, и один и тот же текст теперь разбивается на большее число токенов, чем раньше. Независимые тесты показывают, что тот же самый текст считается. Именно поэтому заявленное снижение цены в 90% на практике превращается в экономию около 75% — сама Anthropic это признаёт. Маркетинговая цифра на обложке и реальный счёт в конце месяца — разные вещи, и так будет почти всегда, когда сравниваются цены разных поколений моделей.

Контекстное окно: заявленный миллион и миллион, который реально работает

Контекстное окно — это весь объём текста, который модель держит «в поле зрения» одновременно: запрос, история диалога, загруженные документы. У Haiku 5.5 оно действительно составляет миллион токенов, а максимальный ответ — 128 тысяч. Звучит как «можно загрузить целую библиотеку и ничего не забудется». На практике — нет.

Исследовательская команда Chroma прогнала через длинные контексты 18 ведущих моделей и получила единый результат: каждая из них теряет точность по мере роста входного текста, причём снижение нелинейно и зависит от того, где в тексте находится нужная информация. Хуже всего модели ведут себя, когда нужный факт лежит в середине длинного документа: точность падает более чем на 30 процентных пунктов по сравнению с тем, когда та же информация стоит в начале или в конце.

Это не абстрактная лаборатория. Летом пользователи Codex от OpenAI заметили, что их длинные сессии рефакторинга внезапно начали сыпать ошибками переполнения контекста — хотя модель заявляла окно в 1,05 млн токенов. Разбирательство показало, что реальный лимит внутри продукта незаметно урезали почти на треть. Вендор назвал это «исправлением», а не урезанием — формулировка показательная сама по себе.

Зачем вообще дешёвой модели огромное окно

Здравый смысл в большом окне у Haiku 5.5 всё же есть — просто не тот, что рисуют заголовки. Модель задумана как дешёвый субагент под более умной Opus или Sonnet: крупная модель строит план и формулирует задачу, а Haiku читает документы, сжимает контекст, классифицирует тикеты и возвращает краткий ответ.

Но и тут есть подвох, который стоит знать до того, как строить агентную цепочку: передача задачи субагенту и обратно сама по себе стоит денег, причём часто больше, чем сама работа. В одном из разборов такой схемы хендофф между оркестратором и субагентом обходился почти в пять раз дороже самой задачи. То есть архитектура «умная модель раздаёт команды дешёвым помощникам» не бесплатна по умолчанию — она требует аккуратного проектирования, а не просто подписки на модель с большим окном.

Что с этим делать на практике

Миллион токенов в карточке модели — это верхняя граница, а не гарантия качества. Прежде чем строить на новой модели рабочий процесс, стоит проверить три вещи:

  • Сколько токенов реально тратит на вашу задачу новый токенизатор — сравнение цен по старым расчётам может обмануть;
  • Насколько стабильно модель находит нужную информацию, если она не лежит в начале или конце длинного текста;
  • Во сколько обходится передача задачи между агентами, если вы строите цепочку, а не используете модель напрямую.

Здоровый скептицизм здесь — не брюзжание, а рабочий инструмент: цифры в анонсах стоит проверять на своих задачах, а не принимать на веру.

Если хочется без лишних настроек сравнить, как разные модели — от Claude до GPT и Gemini — ведут себя на реальных длинных документах и рабочих задачах, в GEMERA AI можно попробовать их все в одном чате или через Telegram-бота, без танцев с API-ключами и тарифными порогами.