Gemini 3.1 Ultra обогнал Opus 4.6 и GPT-5.3 на ключевых бенчмарках: разбор релиза

Google вернулся в гонку фронтирных моделей: 12 апреля 2026 года компания выпустила Gemini 3.1 Ultra — модель, которая впервые за долгое время обошла конкурентов на ключевых бенчмарках. Релиз произошёл на фоне громких анонсов Anthropic Mythos и OpenAI GPT-5.4, но именно Gemini 3.1 показал результаты, которые заставили индустрию обратить внимание.
Что изменилось в архитектуре
Линейка Gemini 3.1 включает три модели: Pro для сложных задач, Flash-Lite для бюджетных сценариев и Flash Live для аудио. Флагманский Pro поддерживает контекстное окно в 1 млн токенов, а Ultra-версия расширяет его до 2 млн — крупнейшее среди фронтирных моделей на момент релиза.
Ключевое отличие — нативная мультимодальность. Текст, изображения, видео и аудио обрабатываются единой архитектурой без отдельных энкодеров. Это позволяет модели анализировать видео-презентацию, одновременно читая слайды, слушая спикера и интерпретируя графики. Встроенный инструмент sandboxed code execution даёт возможность писать и запускать код для решения задач прямо в процессе рассуждения.
Результаты бенчмарков
На ARC-AGI-2 — тесте абстрактного мышления — Gemini 3.1 Pro набрал 77.1%, более чем вдвое превысив результат предыдущего Gemini 3 Pro (31.1%) и опередив Opus 4.6 на 8 пунктов. На LiveCodeBench Pro, соревновательном бенчмарке программирования с задачами от Codeforces и ICPC, модель достигла Elo 2887 — уровень сильного человеческого участника.
Сравнение с конкурентами по данным AI-Stat:
- ARC-AGI-2: Gemini 3.1 Pro — 77.1%, Opus 4.6 — 68.8%
- GPQA Diamond: Gemini 3.1 Pro — 94.3%, Opus 4.6 — 91.3%
- Terminal-Bench 2.0: Gemini 3.1 Pro — 68.5%, Opus 4.6 — 65.4%, GPT-5.3-Codex — 64.7%
- BrowseComp: Gemini 3.1 Pro — 85.9%, Opus 4.6 — 84.0%
- SWE-Bench Verified: Gemini 3.1 Pro — 80.6%, Opus 4.6 — 80.8%
На SWE-Bench Verified — единственном бенчмарке, где Opus 4.6 ещё удерживает лидерство — разница составляет 0.2 процентного пункта. Фактически паритет.
Платформа Antigravity
Вместе с моделью Google запустил Antigravity — агентскую платформу для разработки, прямой конкурент Claude Code и Codex. Antigravity интегрирована в Google AI Studio и позволяет превращать промпты в production-ready приложения с базами данных, мультиплеерным режимом и подключением к внешним сервисам.
Экосистема включает Developer Knowledge API — MCP-сервер с доступом к документации Firebase, Android, Cloud и Maps (40 млн документов). Это даёт Gemini преимущество при разработке под Google-стек, которое ни Anthropic, ни OpenAI пока не могут предложить.
Позиция на рынке
Google долго оставался в тени Anthropic и OpenAI в гонке фронтирных моделей. Gemini 2.5 Pro был хорош, но не доминировал. Gemini 3.1 меняет расклад: модель лидирует на 8 из 14 ключевых бенчмарков в собственной таблице сравнений, опережая и Opus 4.6, и GPT-5.3-Codex.
Модель доступна через AI Studio, Vertex AI, API и приложение Gemini. Для разработчиков особенно интересен бесплатный тир AI Studio — возможность тестировать фронтирную модель без затрат.
Утечки в LinkedIn и Reddit упоминали кодовые названия Snow Bunny, Fierce Falcon и Ghost Falcon — вероятно, будущие модели линейки 3.5. Если Google сохранит темп улучшений, к середине 2026 года расстановка сил в AI может измениться радикально.
Попробовать Gemini 3.1 Pro и другие передовые модели можно в GEMERA AI — доступ через Telegram-бота и веб-кабинет, без VPN и зарубежных карт.