Alibaba выпустила Qwen 3.6-27B: как 27 миллиардов параметров обошли 397 миллиардов

Alibaba выпустила Qwen 3.6-27B: как 27 миллиардов параметров обошли 397 миллиардов

22 апреля 2026 года Alibaba выпустила Qwen 3.6-27B — плотную модель на 27 миллиардов параметров, которая обходит собственную MoE-версию Qwen 3.5-397B-A17B в задачах автономного кодирования. Модель запускается на одной RTX 4090 или Mac с 24 ГБ памяти, распространяется под лицензией Apache 2.0 без ограничений на коммерческое использование. Разбираем шесть вопросов, которые чаще всего задают про новую модель и её место на рынке.

Почему плотная модель на 27B обошла MoE на 397B — это же меньше в 14 раз?

Дело в архитектуре. MoE-модели активируют только часть параметров на каждый токен — Qwen 3.5-397B использует 17 миллиардов из 397. Плотная модель задействует все 27 миллиардов на каждом проходе. В задачах, где критична глубина рассуждения и связность контекста — автономное кодирование, отладка, многошаговые цепочки — плотная архитектура оказывается эффективнее. На бенчмарке SWE-bench Verified Qwen 3.6-27B набрала 77,2 процента против 76,2 у старшей модели. На Terminal-Bench 2.0 — 59,3 против 52,5. На SkillsBench разрыв ещё заметнее: 48,2 против 30,0.

Это не значит, что MoE плохая идея — просто для определённых задач плотная модель работает точнее. Особенно когда речь о длинных сессиях с агентом, где каждое решение опирается на предыдущие шаги.

Что такое Thinking Preservation и зачем оно нужно?

Классические reasoning-модели генерируют цепочку рассуждений, а потом выбрасывают её перед следующей репликой. Qwen 3.6-27B умеет сохранять следы рассуждений между ходами в агентной сессии. Включается параметром в шаблоне чата — и модель начинает использовать прошлые выводы как контекст для новых решений. Это снижает расход токенов на повторные объяснения, ускоряет итеративную разработку и делает решения стабильнее в длинных циклах работы.

Для корректной работы механизма разработчики рекомендуют держать минимум 128 тысяч токенов контекста. Нативное окно модели — 262 тысячи токенов, растягивается до миллиона через механизм YaRN.

Можно ли реально запустить модель на обычной видеокарте?

Да. Квантованная версия в формате Q4_K_M весит 16,8 гигабайт и работает на 18 гигабайтах общей памяти — сумма оперативки и видеопамяти. RTX 4090 с 24 гигабайтами VRAM справляется без проблем, Mac с 24 гигабайтами unified memory тоже. Unsloth выложила кванты в день релиза, llama.cpp и Unsloth Studio поддерживают модель из коробки. Ollama пока не работает из-за отдельных файлов для визуальной части — но это вопрос времени.

Для тех, кто не хочет возиться с локальным развёртыванием — модель доступна через бесплатный веб-интерфейс chat.qwen.ai, платный API DashScope у Alibaba Cloud и OpenRouter.

Как Qwen 3.6-27B выглядит на фоне Claude и GPT?

На SWE-bench Verified модель отстаёт от Claude Opus 4.6 на 3,6 процентного пункта — 77,2 против 80,8. На Terminal-Bench 2.0 результаты совпадают: 59,3 у обеих моделей. Это честные бенчмарки автономной работы в терминале с трёхчасовым таймаутом, 32 CPU и 48 гигабайтами RAM. Совпасть там с топовой проприетарной моделью при разнице в 14,8 раза по числу параметров — серьёзное достижение для открытой модели.

Важная оговорка: цифры получены на внутреннем agent-scaffold Alibaba. Независимые воспроизведения на момент публикации ограничены, первые тесты от сообщества подтверждают направление, но не точные проценты. GPQA Diamond проверяется извне и сходится с другими источниками — там модель набирает 87,8 балла.

Что нового в мультимодальных возможностях?

Визуальная версия модели — Qwen 3.6-35B-A3B, построенная по MoE-архитектуре — набирает 81,7 балла на MMMU против 79,6 у Claude Sonnet 4.5 и 86,4 балла на MathVista против 79,8. Это говорит о силе в задачах, требующих совмещения текстового и визуального анализа. Встроенный механизм поиска по изображениям позволяет модели находить визуальные референсы в реальном времени — если запрос содержит объект или персонажа, которого не было в обучающей выборке, модель ищет подходящий референс и генерирует точное изображение.

Текст, изображение и видео обрабатывает один энкодер, не бортовой адаптер. Контекст 262 тысячи токенов по умолчанию растягивается до миллиона — хватит, чтобы целиком скормить средний репозиторий.

Что это значит для рынка локальных моделей?

Последние полтора года индустрия убеждала: чтобы получить топовую модель, нужен MoE на сотни миллиардов параметров и кластер H100 под него. Qwen 3.6-27B ломает этот консенсус конкретным сравнением — плотная модель на потребительской видеокарте обходит MoE-флагман того же производителя на реальных бенчмарках. Для разработчиков это значит, что локальный coding-агент на собственном железе теперь не компромисс, а жизнеспособная альтернатива облачной подписке.

Для рынка чипов — ещё один аргумент, что не весь спрос на ИИ уйдёт в дата-центры. Часть смещается к десктопным GPU с 24–48 гигабайтами видеопамяти. Разрыв между открытыми весами и проприетарными фронтирами продолжает сжиматься — до Claude Opus 4.6 на SWE-bench всего 3,6 пункта.

В GEMERA AI доступны как западные модели — GPT, Claude, Gemini — так и открытые решения вроде Qwen. Попробуйте разные инструменты для кодирования и выберите тот, который лучше ложится на вашу задачу — без привязки к конкретной экосистеме.