GPT-5.5 и самооптимизирующийся инференс: как ИИ-ассистенты учатся ускорять себя

GPT-5.5 и самооптимизирующийся инференс: как ИИ-ассистенты учатся ускорять себя

В конце апреля 2026 года OpenAI представила GPT-5.5 — модель, которая впервые не просто помогала разработчикам писать код, но и оптимизировала собственную инфраструктуру. Компания заявила, что Codex — их агент для программирования — использовал GPT-5.5 для анализа недель продакшн-трафика и написал алгоритм балансировки запросов между GPU-ядрами. Результат: скорость генерации токенов выросла более чем на 20 процентов.

Это продолжение тренда, который компания обозначила ещё с GPT-5.3-Codex в феврале. Тогда ранние версии модели помогали команде отлаживать собственное обучение и анализировать результаты оценки. С GPT-5.5 шаг стал крупнее: теперь модель не только диагностирует проблемы, но и пишет production-код для критически важных компонентов системы.

Что изменилось в производительности

GPT-5.5 демонстрирует серьёзный скачок на бенчмарках для агентного программирования. На Terminal-Bench 2.0 — тесте, который оценивает работу в командной строке, отладку и развёртывание — модель набрала 82.7 процента. Для сравнения: Claude Opus 4.7 от Anthropic показал 69.4 процента, а Gemini 3.1 Pro от Google — 68.5 процента.

На SWE-Bench Pro, где модели решают реальные issue с GitHub, GPT-5.5 набрала 58.6 процента. Anthropic сообщила результат 64.3 процента для Opus 4.7, но сама признала возможное запоминание части задач из датасета.

Особенно заметен прогресс на длинном контексте. На Graphwalks BFS с окном в миллион токенов GPT-5.5 выдаёт F1-метрику 45.4 процента против 9.4 у GPT-5.4. Это важно для работы с большими кодовыми базами — раньше приходилось разбивать проект на части, теперь можно загрузить целиком.

Как модель оптимизировала себя

Раньше запросы на GPU делились на фиксированное число кусков, что было неоптимально для реальных паттернов нагрузки. GPT-5.5 через Codex проанализировала логи трафика за несколько недель, выявила узкие места и написала динамическую схему распределения. Код прошёл ревью инженеров OpenAI и был внедрён в продакшн.

Побочный эффект этой работы — задержки не выросли. Обычно более мощные модели обслуживаются медленнее, но по задержке на токен GPT-5.5 в продакшне совпадает с GPT-5.4 при заметно более высоком уровне интеллекта. На тех же задачах в Codex новая модель использует меньше токенов, чем предшественница — компания заявляет о сокращении на 40 процентов.

Цены и доступность

GPT-5.5 в API будет стоить 5 долларов за миллион входных токенов и 30 долларов за миллион выходных. Это дороже GPT-5.4 (2.50 и 15 долларов соответственно), но OpenAI утверждает, что за счёт токеновой эффективности итоговые счета в Codex для большинства сценариев выйдут меньше.

Есть также версия GPT-5.5 Pro — 30 и 180 долларов за миллион токенов. Она использует параллельные вычисления во время выполнения, что повышает точность на сложных задачах. На FrontierMath Tier 4 — математическом тесте, разработанном действующими математиками — стандартная модель набрала 35.4 процента, Pro-версия — 39.6.

В ChatGPT и Codex модель доступна для подписчиков Plus, Pro, Business и Enterprise. API-доступ обещают в ближайшее время, но точной даты пока нет.

Что это значит для разработчиков

Для индивидуальных разработчиков и небольших команд GPT-5.5 в Codex — это возможность работать с более длинным контекстом и получать более точные результаты за меньшее число итераций. Модель лучше понимает архитектуру проекта, когда видит весь код сразу, а не фрагментами.

Для компаний интереснее другое: если модель может оптимизировать собственный инференс, значит, она может делать то же самое с вашей инфраструктурой. OpenAI пока не предлагает это как отдельный продукт, но прецедент создан. Вопрос времени, когда появятся специализированные агенты для оптимизации баз данных, сетевых стеков или CI/CD-пайплайнов.

Параллельно OpenAI усилила меры безопасности. GPT-5.5 получила уровень High по кибербезопасности и биологии/химии в Preparedness Framework — внутренней шкале компании для оценки опасных возможностей модели. Это означает, что модель может находить уязвимости в коде, но OpenAI применяет дополнительные фильтры и мониторинг, чтобы предотвратить злоупотребления.

Конкуренция не стоит на месте

Anthropic в апреле выпустила превью Claude Mythos с акцентом на кибербезопасность. Google активно развивает Gemini 3.1 Ultra, которая обошла конкурентов на ARC-AGI-2 и LiveCodeBench Pro. В области ИИ-кодинга лидерство переходит из рук в руки каждые несколько недель.

Для пользователей это хорошо: конкуренция ускоряет прогресс и сдерживает цены. Для рынка в целом это сигнал, что ИИ-ассистенты перешли от фазы экспериментов к фазе production-инструментов, которые реально влияют на производительность команд.

Попробуйте в GEMERA AI

Хотите сравнить возможности топовых моделей для кодинга? В GEMERA AI доступны GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Ultra через единый интерфейс. Работает без VPN, оплата российскими картами. Переключайтесь между моделями прямо в чате и выбирайте ту, что лучше справляется с вашей задачей.