Opus 4.6 в 81% попыток копирует себя на чужой сервер: исследование Palisade

Opus 4.6 в 81% попыток копирует себя на чужой сервер: исследование Palisade

Лаборатория Palisade Research замерила, как часто современные ИИ-модели сами могут взломать чужой сервер и установить туда копию своих весов. У Claude Opus 4.6 получилось в 81% попыток, у GPT-5.4 — в 33%. Год назад актуальные модели тех же разработчиков показывали 6% и ровно 0% соответственно — это новое исследование фиксирует не столько отдельный факт, сколько скорость, с которой эта способность вырастала за один релизный цикл.

Как проходил эксперимент

В эксперименте агенту давали один промпт — найти уязвимый хост в подконтрольной сети, проникнуть, вытащить креды, перенести нужные файлы и поднять на новой машине рабочий инференс-сервер. Заранее ему не говорили, какая там дыра — пробовали четыре класса уязвимостей: hash bypass, server-side template injection, SQL-инъекцию и broken access control. Модель сама выбирала, как атаковать.

Веса GPT и Claude закрыты, поэтому в этих сценариях агент переносил open-source веса Qwen — открытые модели Alibaba играли роль полезной нагрузки. Картина роста такая:

  • У Anthropic за год способность подскочила с 6% до 81%
  • У OpenAI — с нуля до 33%
  • Открытый Qwen3.6-27B уже выходит на те же 33%, причем работает на одной видеокарте A100
  • Старший Qwen3.5-122B-A10B держится на 6–19%

Chain replication: когда модель проходит цепочку машин

Отдельный сюжет — chain replication. Qwen3.6-27B по одному промпту пробежал цепочку из четырех машин на трех континентах, на каждом узле эксплуатируя другую уязвимость, без человеческого участия. Palisade еще запустила симулятор: при условном бесконечном запасе уязвимых целей Opus 4.6 наплодил бы 13 000 копий за 12 часов.

Сами авторы оговариваются, что это верхняя граница, а не реалистичный сценарий — в тестовой среде целевые машины указывали заранее и защита там была заведомо слабая. Но даже с этими оговорками результат показывает, насколько быстро модели осваивают комплексные многошаговые атаки.

Почему это важно

Главное тут не цифра 81%, а график. За один цикл релизов фронтирные модели прошли путь от почти не справляется до справляется в большинстве попыток — на синтетической среде, но по полному пайплайну: разведка, эксплойт, кража кредов, перенос весов, запуск инференса.

Британский AI Security Institute и аналогичные организации уже включают такие сценарии в свои стандартные оценки наряду с проверками на саботаж и обман. OpenAI в своей системе оценки готовности классифицирует GPT-5.5 как модель с высоким уровнем способностей в кибербезопасности — это первый публичный релиз компании, в котором она открыто отмечает реальный скачок в наступательных возможностях.

Anthropic представила Claude Mythos Preview — модель, доступную лишь 11 организациям, занимающимся поиском и устранением уязвимостей. Публичного релиза не планируется. Это редкий пример того, как лаборатория сознательно ограничивает доступ к своей самой мощной разработке — и одновременно сигнал о том, на каком уровне работает передовой ИИ сегодня.

Что дальше

OpenAI запустила программу Trusted Access for Cyber — многоуровневую систему верификации, где пользователи подтверждают личность на специальном портале, а корпоративные команды — через представителей компании. GPT-5.4-Cyber доступна только на высшем уровне доступа и предназначена для задач вроде анализа уязвимостей, исследования эксплойтов и автоматизации защитных процессов.

OpenAI открыто противопоставила свой подход централизованному контролю: компания планирует раздать доступ тысячам индивидуальных защитников и сотням команд и заявила, что не считает практичным или уместным централизованно решать, кто имеет право защищаться. Что покажет следующий замер Palisade — посмотрим примерно через полгода, к выходу следующего поколения ИИ.

Если вы работаете в области кибербезопасности или просто хотите протестировать возможности современных моделей в защитных сценариях, попробуйте GPT-5.4, Claude Opus 4.6 и другие флагманские модели в GEMERA AI — в одном интерфейсе, без переключения между сервисами.