UK AISI проверил GPT-5.5 на кибератаки: модель прошла 32-шаговую симуляцию

1 мая 2026 года UK AI Security Institute опубликовал результаты тестирования GPT-5.5 на задачах кибербезопасности. Модель OpenAI стала второй в истории, прошедшей полную 32-шаговую симуляцию корпоративной атаки — первой была Claude Mythos Preview от Anthropic. Разница между ними укладывается в статистическую погрешность, но есть важное отличие: GPT-5.5 доступен публично через API, а Mythos остаётся закрытым проектом.
Что это значит для компаний, которые строят защиту периметра? И какие конкретные шаги нужно предпринять прямо сейчас, пока разрыв между атакующими и защитниками не стал необратимым?
Что показали тесты AISI
UK AI Security Institute использовал два типа оценки. Первый — 95 capture-the-flag задач четырёх уровней сложности, от базовых до экспертных. Второй — полноценный киберполигон с четырьмя подсетями и цепочкой из 32 шагов, имитирующий реальную корпоративную сеть.
На экспертных CTF-задачах GPT-5.5 показал средний результат 71,4% успешных решений. Это reverse engineering, эксплуатация ошибок памяти, криптографические атаки. Claude Mythos Preview — 68,6%. Все остальные модели значительно отстают: GPT-5.4 набрал 52,4%, Claude Opus 4.7 — 48,6%.
На 32-шаговой симуляции корпоративной атаки GPT-5.5 дошёл до конца в 2 запусках из 10, Mythos — в 3 из 10. Средний результат обеих моделей — около 22 шагов из 32. Ни одна другая модель не прошла сценарий полностью.
Ключевое наблюдение AISI: производительность растёт с увеличением вычислительного бюджета. До 100 миллионов токенов обе модели продолжают набирать шаги, кривая не выходит на плато. Это значит, что при достаточном времени на «размышление» модель может довести атаку до финального флага.
Пять шагов для защиты корпоративной сети
1. Аудит базовой гигиены безопасности
Если модель уровня GPT-5.5 может автономно пройти 32-шаговую атаку, то «у нас нет специалистов такого уровня» больше не аргумент. Стоимость развёртывания пентестера-эквивалента снижается до стоимости compute. Проверьте:
- Сегментацию сети — разделены ли критичные системы от общедоступных
- Политики паролей — используются ли многофакторная аутентификация и менеджеры паролей
- Обновления ПО — закрыты ли известные уязвимости в базовых компонентах
- Мониторинг доступа — логируются ли попытки повышения привилегий
2. Внедрение активного мониторинга
Все тесты AISI проходили на «стерильных» полигонах — без EDR, SIEM и активных защитников. Ни одна модель пока не показала способность преодолевать системы, которые реагируют на подозрительную активность. Установите:
- EDR-решения на критичных хостах
- SIEM с настроенными алертами на аномалии
- Network segmentation с микросегментами для критичной инфраструктуры
- Honeypot-системы для раннего обнаружения атак
3. Проверка доступа к ИИ-инструментам внутри компании
GPT-5.5 доступен через публичный API. Если сотрудники используют его для помощи в работе, они могут случайно передать модели данные о внутренней инфраструктуре. Проведите:
- Аудит использования ИИ-инструментов в команде
- Обучение сотрудников по data handling с LLM
- Настройку DLP-систем для контроля утечек через API-запросы
- Внедрение корпоративных ИИ-решений с Zero Data Retention
4. Тестирование собственной защиты с помощью ИИ
OpenAI запустила программу Trusted Access for Cyber, предоставляя проверенным защитникам доступ к GPT-5.4-Cyber — версии модели с меньшими ограничениями на кибер-задачи. Если ваша компания работает с критичной инфраструктурой:
- Подайте заявку на участие в TAC через представителя OpenAI
- Используйте доступ для внутреннего пентестинга
- Запустите симуляции атак на копии продакшн-окружения
- Документируйте найденные уязвимости и приоритизируйте их устранение
5. Подготовка к следующему поколению моделей
GPT-5.5 и Mythos — первые модели, прошедшие полную симуляцию. Через 6–12 месяцев появятся следующие, и они будут сильнее. Начните готовиться сейчас:
- Переход от reactive к proactive security — автоматический поиск уязвимостей до релиза
- Внедрение continuous security testing в CI/CD
- Обучение команды работе с ИИ-ассистентами для защиты
- Участие в bug bounty программах для раннего обнаружения критичных багов
Чего модели пока не умеют
Параллельно AISI прогнал обе модели через сценарий Cooling Tower — атаку на промышленную систему управления. Ни GPT-5.5, ни Mythos его не прошли. Обе спотыкались на первых ИТ-шагах подхода к контроллеру, не дойдя до интересной части с OT-системами.
Это важное ограничение: модели сильны в классических ИТ-сценариях, но промышленные протоколы и ICS/SCADA остаются для них сложными. Если ваша компания работает с критичной инфраструктурой — энергетикой, транспортом, производством — у вас есть дополнительный буфер времени.
Второе ограничение — все тесты проходили без активных защитников. На реальных корпоративных сетях с SOC, которые реагируют на алерты, ситуация может выглядеть иначе. AISI обещает в следующих циклах включить defended environments в тестирование.
Что делать прямо сейчас
Если вы отвечаете за безопасность в компании, начните с трёх шагов:
Первое — проведите инвентаризацию критичных систем и проверьте, какие из базовых мер защиты у вас отсутствуют. Модели класса GPT-5.5 эксплуатируют цепочки известных уязвимостей, а не изобретают новые атаки.
Второе — внедрите автоматический мониторинг подозрительной активности. Разрыв между «полигоном AISI» и «реальной сетью» всё ещё значимый, и он держится именно на активной защите.
Третье — если работаете с критичной инфраструктурой, рассмотрите участие в программах вроде Trusted Access for Cyber или аналогах от других вендоров. Доступ к мощным моделям для защитников — это способ выиграть время, пока атакующие не получили те же инструменты массово.
Главный вывод отчёта AISI: эпоха, когда ИИ писал фишинговые письма, закончилась. Сейчас фронтир-модели проходят корпоративные сети целиком. И это уже не теория — это измеренная способность, доступная через публичный API.