6 цифр, которые решают спор Claude Opus 5 и GPT-5.6 Sol

Две недели — именно столько прошло между релизами GPT-5.6 Sol и Claude Opus 5. Обычно такие обновления выходят с разницей в месяцы, а тут лаборатории почти столкнулись лбами. Для пользователя это редкая возможность сравнить два по-настоящему свежих флагмана в одной весовой категории, а не гадать, кто «устарел» на полгода.
Что произошло
OpenAI выпустила GPT-5.6 в трёх вариантах — Luna, Terra и Sol, где Sol флагманский.
Ответ Anthropic пришёл почти сразу. Новая модель заменила Opus 4.8 и стала актуальным флагманом линейки Opus.
Кто сильнее на бенчмарках
Главный вопрос — не «какая модель лучше вообще», а «в чём конкретно разница». Цифры дают довольно ясную картину.
- Кодинг.
- Абстрактное мышление.
- Работа с интернетом. Тут паритет:
- Терминальные задачи. Здесь у Sol есть козырь:
Если суммировать общий счёт, картина складывается не в пользу равенства:
Почему это важно, а не просто циферки
За сухими процентами стоит практическая логика выбора модели под задачу. Anthropic явно вложилась в агентные сценарии и глубокое рассуждение — то есть в задачи, где модель должна долго и самостоятельно доводить процесс до конца: рефакторинг большого репозитория, многошаговый анализ данных, работа с незнакомыми интерфейсами. OpenAI, судя по результатам, оптимизировала Sol под скорость и терминальные операции — короткие команды, DevOps-рутину, быстрые ответы там, где задержка критична.
Отдельная интрига — цена. При этом Opus 5 не просто дешевле, но и обгоняет конкурента по большинству метрик — сочетание, которое обычно не встречается на рынке одновременно.
Что это меняет на практике
Для тех, кто выбирает модель под конкретный рабочий процесс, вывод простой: универсального победителя нет, но появились чёткие ниши.
- Для глубокого кодинга и агентных задач — репозитории, многошаговый рефакторинг, автономная работа над проектом — сейчас впереди Claude Opus 5.
- Для терминальных и DevOps-сценариев, где важна скорость отклика, GPT-5.6 Sol остаётся сильным и заметно быстрее за счёт инфраструктурных оптимизаций.
- Для веб-исследований и поиска информации разница почти не ощущается — обе модели показывают близкий результат.
Стоит помнить и про обычную оговорку: Разработчики честно советуют проверять модели на своих задачах, а не только на табличках.
Заключение
Гонка между Anthropic и OpenAI вошла в фазу, когда разница между релизами измеряется неделями, а не месяцами. Для пользователя это хорошая новость: конкуренция толкает обе модели вперёд одновременно в разных направлениях — глубину рассуждений и скорость исполнения. Тем, кто пишет код, анализирует документы или строит агентные сценарии, стоит хотя бы раз прогнать свою задачу через обе модели и сравнить результат вживую, а не по чужим таблицам.
В GEMERA AI можно попробовать и Claude, и GPT в одном чате — без переключения между сайтами и лишних подписок. Загляните в бота или веб-кабинет, задайте одну и ту же задачу разным моделям и посмотрите, какая из них закроет именно вашу рутину быстрее.