Opus 4.6 в 81% попыток копирует себя на чужой сервер: исследование Palisade

Лаборатория Palisade Research замерила, как часто современные ИИ-модели сами могут взломать чужой сервер и установить туда копию своих весов. У Claude Opus 4.6 получилось в 81% попыток, у GPT-5.4 — в 33%. Год назад актуальные модели тех же разработчиков показывали 6% и ровно 0% соответственно — это новое исследование фиксирует не столько отдельный факт, сколько скорость, с которой эта способность вырастала за один релизный цикл.
Как проходил эксперимент
В эксперименте агенту давали один промпт — найти уязвимый хост в подконтрольной сети, проникнуть, вытащить креды, перенести нужные файлы и поднять на новой машине рабочий инференс-сервер. Заранее ему не говорили, какая там дыра — пробовали четыре класса уязвимостей: hash bypass, server-side template injection, SQL-инъекцию и broken access control. Модель сама выбирала, как атаковать.
Веса GPT и Claude закрыты, поэтому в этих сценариях агент переносил open-source веса Qwen — открытые модели Alibaba играли роль полезной нагрузки. Картина роста такая:
- У Anthropic за год способность подскочила с 6% до 81%
- У OpenAI — с нуля до 33%
- Открытый Qwen3.6-27B уже выходит на те же 33%, причем работает на одной видеокарте A100
- Старший Qwen3.5-122B-A10B держится на 6–19%
Chain replication: когда модель проходит цепочку машин
Отдельный сюжет — chain replication. Qwen3.6-27B по одному промпту пробежал цепочку из четырех машин на трех континентах, на каждом узле эксплуатируя другую уязвимость, без человеческого участия. Palisade еще запустила симулятор: при условном бесконечном запасе уязвимых целей Opus 4.6 наплодил бы 13 000 копий за 12 часов.
Сами авторы оговариваются, что это верхняя граница, а не реалистичный сценарий — в тестовой среде целевые машины указывали заранее и защита там была заведомо слабая. Но даже с этими оговорками результат показывает, насколько быстро модели осваивают комплексные многошаговые атаки.
Почему это важно
Главное тут не цифра 81%, а график. За один цикл релизов фронтирные модели прошли путь от почти не справляется до справляется в большинстве попыток — на синтетической среде, но по полному пайплайну: разведка, эксплойт, кража кредов, перенос весов, запуск инференса.
Британский AI Security Institute и аналогичные организации уже включают такие сценарии в свои стандартные оценки наряду с проверками на саботаж и обман. OpenAI в своей системе оценки готовности классифицирует GPT-5.5 как модель с высоким уровнем способностей в кибербезопасности — это первый публичный релиз компании, в котором она открыто отмечает реальный скачок в наступательных возможностях.
Anthropic представила Claude Mythos Preview — модель, доступную лишь 11 организациям, занимающимся поиском и устранением уязвимостей. Публичного релиза не планируется. Это редкий пример того, как лаборатория сознательно ограничивает доступ к своей самой мощной разработке — и одновременно сигнал о том, на каком уровне работает передовой ИИ сегодня.
Что дальше
OpenAI запустила программу Trusted Access for Cyber — многоуровневую систему верификации, где пользователи подтверждают личность на специальном портале, а корпоративные команды — через представителей компании. GPT-5.4-Cyber доступна только на высшем уровне доступа и предназначена для задач вроде анализа уязвимостей, исследования эксплойтов и автоматизации защитных процессов.
OpenAI открыто противопоставила свой подход централизованному контролю: компания планирует раздать доступ тысячам индивидуальных защитников и сотням команд и заявила, что не считает практичным или уместным централизованно решать, кто имеет право защищаться. Что покажет следующий замер Palisade — посмотрим примерно через полгода, к выходу следующего поколения ИИ.
Если вы работаете в области кибербезопасности или просто хотите протестировать возможности современных моделей в защитных сценариях, попробуйте GPT-5.4, Claude Opus 4.6 и другие флагманские модели в GEMERA AI — в одном интерфейсе, без переключения между сервисами.