GPT-5.3 Codex обогнал Claude Opus 4.6 в агентном кодинге: разбор Terminal-Bench 2.0

Гонка ИИ-ассистентов для кодинга вышла на новый виток. 5 февраля 2026 года OpenAI выпустила GPT-5.3 Codex, который отобрал у Claude Opus 4.6 лидерство на Terminal-Bench 2.0 — самом требовательном бенчмарке для агентного программирования. Но история оказалась сложнее, чем просто смена лидера.
Что показывают бенчмарки
Главная заявка OpenAI — лидерство в агентном кодинге, и цифры это подтверждают. GPT-5.3 Codex набрал 77.3% на Terminal-Bench 2.0, показав скачок с 64.0% у предыдущей версии. Этот тест измеряет способность модели работать в терминале: выполнять команды, отлаживать код, управлять деплоем — именно то, что делают разработчики ежедневно.
На SWE-Bench Pro, где моделям нужно решать реальные issue с GitHub, Codex достиг 56.8%. На внутреннем Expert-SWE от OpenAI, который тестирует длинные инженерные задачи со средним временем выполнения около 20 часов, модель показала 73.1% против 68.5% у GPT-5.4.
Но картина неоднозначная. На OSWorld Verified — тесте на общие компьютерные задачи — Claude Opus 4.6 опережает Codex на 8 процентных пунктов: 72.7% против 64.7%. На SWE-Bench Verified Opus тоже впереди с результатом 80.8%.
Скорость против глубины
В реальной работе разница ощутимее, чем в бенчмарках. OpenAI заявляет, что Codex завершает агентные задачи примерно в два раза быстрее Opus. Для быстрого прототипирования это критично.
В практических тестах UI-компонент Codex собрал за 3 минуты 53 секунды, Opus — за 3 минуты ровно. Разница невелика. Но на задачах анализа данных разрыв увеличивается: Codex справился за 1 минуту 35 секунд, Opus потребовал около 8 минут.
Модель на 25% быстрее предыдущей версии при меньшем расходе токенов. OpenAI сообщает о сокращении выходных токенов примерно на 40% при сопоставимой работе — реальный прирост эффективности, который компенсирует более высокую цену.
Пост-бенчмарковая эра
Разница между топовыми моделями на стандартных тестах настолько мала, что она мало что говорит о реальном пользовательском опыте. Аналитики всё чаще говорят о пост-бенчмарковой эре.
Выбор между Codex и Opus — это выбор стиля работы:
- Codex выигрывает в скорости, терминальных операциях, быстрой итерации и деплое. Экономит минуты на каждом цикле разработки.
- Opus лидирует в работе с большим контекстом (до 1 млн токенов), более предсказуемом поведении и широте задач. Надёжнее при удержании контекста десятков файлов.
Интересный кейс: модель обучала саму себя
OpenAI заявила, что GPT-5.3 Codex участвовала в собственной разработке — отлаживала тренировочный код и управляла инфраструктурой деплоя. Команда Codex использовала ранние версии для мониторинга и отладки процесса обучения, отслеживания закономерностей, анализа качества взаимодействия.
Команда инженеров применяла Codex для оптимизации тестового стенда, выявления багов рендеринга контекста и определения первопричины низкой частоты попаданий в кэш. Модель динамически масштабировала GPU-кластеры для адаптации к всплескам трафика.
Если модель достаточно хороша, чтобы помогать в собственном создании — это говорит о качестве больше любого бенчмарка.
Доступность и ограничения
Codex 5.3 доступен через приложение Codex, CLI, расширения для IDE и веб-интерфейс ChatGPT для платных подписчиков. Главное ограничение — API-доступ пока закрыт, что блокирует корпоративную интеграцию. OpenAI обещает скоро, но конкретных сроков нет.
Claude Opus 4.6 доступен через API Anthropic, Claude Code и множество интеграций уже сейчас. Здесь преимущество Anthropic очевидно — модель можно встроить в любой рабочий процесс.
Цена вопроса
Стандартный API GPT-5.5 стоит 5 долларов за миллион входных токенов и 30 долларов за миллион выходных — ровно вдвое дороже GPT-5.4. GPT-5.5 Pro ещё дороже: 30 и 180 долларов соответственно.
OpenAI аргументирует это сокращением токенов на выходе. По стороннему анализу от Office Chair, чистый рост затрат оценивается примерно в 20% с учётом сокращения выходных токенов на 40%. Это имеет смысл для агентного кодинга, но для генерации длинных текстов или задач с большим контекстом рост затрат может быть заметнее.
Что говорят разработчики
Дэн Шиппер, основатель Every, описал GPT-5.3 Codex как первую модель с серьёзной концептуальной ясностью. После запуска приложения он провёл дни в отладке проблемы, пока один из лучших инженеров не переписал часть системы. Чтобы протестировать модель, он откатил состояние: может ли Codex посмотреть на сломанное состояние и создать такой же рефакторинг? GPT-5.4 не смог. GPT-5.3 Codex смог.
Пьетро Скирано, CEO MagicPath, отметил качественный скачок, когда модель смержила ветку с сотнями изменений во фронтенде в основную ветвь, которая тоже сильно изменилась, разрешив работу за один проход примерно за 20 минут.
Старшие инженеры, тестировавшие модель, сказали, что GPT-5.3 Codex заметно сильнее GPT-5.4 и Claude Opus 4.6 в рассуждениях и автономности, заранее отлавливая проблемы и предсказывая потребности в тестировании без явных промптов.
Выводы
GPT-5.3 Codex действительно лидирует в агентном кодинге — там, где модели нужно работать в терминале, отлаживать себя и быстро выполнять задачи. Но Claude Opus 4.6 остаётся сильнее в общих задачах, работе с контекстом и OSWorld.
Для индустрии важнее другое: разрыв между лучшими моделями сжимается до минимума. Фронтир в кодинге теперь определяется не тем, кто набрал на 2% больше на бенчмарке, а тем, кто лучше встроен в рабочий процесс разработчика. И здесь битва только начинается.
Попробуйте GPT-5.3 Codex, Claude Opus 4.6 и другие модели для кодинга в GEMERA AI — доступ через Telegram-бота и веб-кабинет, без VPN и сложных настроек. Сравните сами, какая модель лучше подходит для ваших задач.