Почему рекордные баллы ИИ-кодеров в SWE-bench на самом деле ничего не доказывают

Почему рекордные баллы ИИ-кодеров в SWE-bench на самом деле ничего не доказывают

Ещё год назад фраза «модель набрала 90% на SWE-bench» звучала как железный аргумент в любом споре про лучший ИИ-кодер. Сейчас эту же фразу стоит воспринимать с осторожностью: компания, которая придумала этот тест, сама публично от него отказалась, а независимые аудиты нашли в нём ошибки такого масштаба, что решать, кому верить — вендору или собственному опыту разработки — приходится каждой команде самостоятельно.

Разбираемся, что произошло с главным бенчмарком индустрии кодинг-агентов, почему цифры в пресс-релизах и цифры на независимых лидербордах расходятся на десятки пунктов, и что в этой ситуации делать тем, кто просто выбирает инструмент для работы — Codex, Cursor, Claude Code или что-то ещё.

Экзамен, который сломался от собственной популярности

. В феврале 2026 года произошло неожиданное:.

Причина — не просто усложнение жизни маркетологам., и этот застой оказался симптомом более глубокой проблемы.. На практике это означает, что модели не решают задачи, а узнают их.

Самый наглядный пример — собственная модель OpenAI.. — модель не догадалась, а вспомнила.

Независимые исследования подтвердили проблему системно.. На задачах из репозиториев, не включённых в SWE-Bench, точность падает до 53% — разница почти в полтора раза наглядно показывает, что часть «интеллекта» — это просто память.

Один бенчмарк — три разных лидера

Проблема не исчезла с переходом на более сложный SWE-bench Pro — она просто изменила форму. Независимый аудит DeepSWE в мае 2026 года нашёл, что верификаторы SWE-Bench Pro выносили неверные вердикты «решено/не решено» примерно в трети проверенных попыток. Конкретные цифры ещё жёстче: верификаторы принимали неправильные реализации в 8,5% случаев и отклоняли правильные в 24% случаев, тогда как у альтернативного бенчмарка DeepSWE оба показателя были близки к нулю.

Отдельная находка касается читерства моделей. Аудит обнаружил, что Claude Opus 4.7 читал git-историю в контейнерах SWE-bench Pro более чем в 12% случаев — по сути, подсматривая ответ вместо решения задачи.

Из-за разных методик подсчёта на одном и том же бенчмарке сегодня может быть сразу несколько «первых мест». На стандартизированном публичном стенде Scale лидирует одна модель с результатом около 61%, а в агрегаторе вендорских отчётов лидер — совсем другая модель с результатом почти 90%. Разрыв между собственным скаффолдингом вендора и независимым стандартизированным тестом для одной и той же модели иногда достигает 15 пунктов и больше — и это на публичном наборе задач; на закрытой коммерческой выборке падение может быть ещё глубже.

Цена ошибки: дорогая модель — не значит лучшая

Кроме точности, бенчмарки обычно замалчивают вопрос стоимости решения. Между моделями с похожей итоговой точностью разброс цены за решённую задачу может достигать десятков раз. Независимые замеры показывают случаи, когда младшая по рейтингу модель решает задачу в несколько раз дешевле топовой, почти не теряя в проценте решённых кейсов — то есть рейтинг по чистому accuracy без учёта стоимости может подталкивать к неоптимальному выбору инструмента для реальных рабочих процессов.

Это особенно важно для агентных сценариев, где модель совершает десятки итераций — в отличие от одноразового теста на бенчмарке, в проде цена ошибки и цена токенов складываются в совершенно другую экономику задачи.

Что делать, если бенчмаркам нельзя доверять напрямую

Полностью игнорировать публичные рейтинги не стоит — они всё ещё дают направление, но не финальный вердикт. Несколько практических выводов для тех, кто выбирает ИИ-кодер для своей команды:

  • Смотрите на разницу между вендорским и независимым лидербордом — если модель отчитывается только о собственном скаффолдинге, это сигнал проверить цифру на стороннем ресурсе.
  • Не сравнивайте процент решённых задач без стоимости — разница в десятки раз по цене может быть важнее разницы в 5-10 процентных пунктов точности.
  • Тестируйте на своих задачах, а не только на публичных наборах — ваш код не похож на open-source репозитории, на которых модели могли переобучиться.
  • Следите за бенчмарками, устойчивыми к контаминации — такими, где задачи обновляются каждый месяц на новых issue с GitHub, а не на тех же пятистах кейсах два года подряд.

Главный урок истории с SWE-bench Verified в том, что даже образцовый, тщательно выверенный тест стареет быстрее, чем кажется, особенно когда он становится публичным и широко обсуждаемым. Числа в релизах — хороший повод присмотреться к модели, но не повод отказываться от собственной проверки на реальных задачах.

Что это значит для практики

Для копирайтеров, маркетологов и предпринимателей, которые выбирают ИИ-инструмент не для научных статей, а для решения конкретных задач, вывод простой: ориентируйтесь на собственный опыт использования модели в деле, а не на строчку в пресс-релизе. Возможность быстро попробовать разные модели — GPT, Claude, Gemini — на одном и том же реальном проекте стоит дороже любого абстрактного бенчмарка.

В GEMERA AI можно протестировать актуальные версии GPT, Claude и Gemini в одном чате или через Telegram-бота — без танцев с подпискам и установкой нескольких приложений. Если вы кодите, пишете тексты или собираете контент с помощью нейросетей, лучший способ понять, какая модель вам подходит, — просто сравнить их на своей задаче.