Как за 10 минут понять, где Qwen и YandexGPT обходят GPT, а где нет

Как за 10 минут понять, где Qwen и YandexGPT обходят GPT, а где нет

Каждую неделю в комментариях к статьям про ИИ повторяется один и тот же спор: одни пишут, что YandexGPT и GigaChat — это "поделки для галочки", другие — что Qwen давно обошёл всё западное и спорить не о чём. Как редактор, который тестирует эти модели каждый день, скажу честно: обе крайности — миф. Сентябрь 2026-го дал хороший повод разобраться: разрыв между лидерами рынка ощутимо сократился, а китайские модели впервые сравнялись по цене и качеству с западными флагманами. Разберу четыре заблуждения, которые слышу чаще всего — и что на самом деле показывают тесты.

Миф 1: российские модели — это обёртка над чужими весами

Самое живучее заблуждение. На деле YandexGPT 5.1 Pro — собственная разработка, и по внутренним измерениям Яндекса результаты выглядят убедительно: по результатам внутреннего слепого попарного сравнения для широкого потока запросов к сервисам Яндекса YandexGPT 5.1 Pro превосходит YandexGPT 5 Pro в 58% случаев, а GPT-4.1 компании OpenAI — в 56% случаев. Отдельно стоит отметить работу над честностью модели: доля выдуманных и некорректных ответов сократилась почти в два раза, до 16%, при этом общее качество хороших ответов выросло с 60 до 71%.

С GigaChat похожая история, только акцент другой — на языке. Разработчики не адаптировали чужую модель под русский, а обучали её с нуля: модель изначально обучалась на русскоязычных данных — это принципиальное отличие от GPT-4o или Claude, которые только адаптированы под русский, и GigaChat понимает разговорные конструкции, региональный сленг, профессиональный бизнес-язык без "переводческого" привкуса. Это не значит, что GigaChat обходит GPT везде — в сложном reasoning и агентном кодинге западные флагманы пока держат планку. Но миф о "копипасте без начинки" не подтверждается.

Миф 2: китайские модели — это дешёвая замена для тех, кому не хватило денег на OpenAI

Ещё год назад так и было. Сейчас это уже не так. Alibaba выпустила Qwen3.8 Max, и результат удивил даже аналитиков: Qwen3.8 Max набрал 56 баллов на Artificial Analysis Intelligence Index — композитном показателе, охватывающем девять тестов, включая GDPval-AA, Terminal-Bench, SciCode и Humanity's Last Exam — этот результат сравним с Claude Opus 4.8 и превосходит все модели Google, Meta и xAI. Обойти модель смогли только считанные конкуренты: только топовые релизы Anthropic и OpenAI, а также Kimi K3 от Moonshot AI сейчас находятся выше неё.

Ещё показательнее агентный рейтинг: по данным Agentic Index от Artificial Analysis, Qwen3.8 Max сейчас занимает первое место среди всех моделей по этому показателю. Это не "бюджетная копия" — это модель, которая реально борется за первые строчки глобальных рейтингов, причём по цене, близкой к западным аналогам среднего сегмента. Миф о китайском ИИ как о дешёвом суррогате устарел примерно на год.

Миф 3: Kandinsky умеет только рисовать картинки

Этот миф понятен — Kandinsky действительно начинался как генератор изображений. Но линейка Kandinsky 5.0, представленная Сбером, давно вышла за эти рамки. В неё входит не только Image Lite, но и полноценные видеомодели: релиз включает три линейки моделей — Video Lite (2B параметров) для быстрой генерации 10-секундного видео, Video Pro (19B параметров) для максимального качества и Image Lite (6B параметров) для изображений высокого разрешения.

Результаты в своём классе действительно сильные: Kandinsky 5.0 T2V Lite — лёгкая модель генерации видео с 2 млрд параметров, которая занимает первое место среди open-source моделей своего класса, превосходя более крупные модели Wan (5B и 14B), и предлагает лучшее понимание русских концепций в open-source экосистеме. А старшая модель линейки закрепила успех на специализированной арене: Kandinsky 5.0 Video Pro занял первое место среди open-source моделей text-to-video на LMArena. Плюс всё это выложено в открытый доступ: Сбер опубликовал всю линейку визуальных моделей Kandinsky 5.0 в открытом доступе, выложив код и веса под лицензией MIT на Hugging Face и GitHub. Для дизайнеров и маркетологов, которые работают с русскоязычным визуалом и кириллическими надписями, это реальный рабочий инструмент, а не игрушка для картинок в стиле "нарисуй кота".

Миф 4: если работаешь с русским языком, всё равно нужен западный ИИ

Отчасти правда — для сложного агентного кодинга или анализа огромных кодовых баз зарубежные флагманы пока держат верх. Это честно признают и независимые обзоры: не "вообще", а на конкретных классах задач — на независимых бенчмарках агентского кодирования, сложного reasoning и работы с большой кодовой базой верхний край держат зарубежные флагманы. Но для повседневных бизнес-задач на русском — документы, переписка, клиентская поддержка, контент — разрыв практически стёрся, а локальный контекст и доступность без VPN дают российским и китайским моделям реальное преимущество.

Что с этим делать

Мой личный вывод простой: выбирать модель по национальности разработчика — такая же ошибка, как слепо доверять западным брендам. YandexGPT и GigaChat закрывают русскоязычные бизнес-задачи не хуже западных аналогов, Qwen реально борется за топ мировых рейтингов, а Kandinsky вырос из генератора картинок в полноценный видеоинструмент. Дальше — вопрос конкретной задачи, а не лояльности к бренду.

Если хочется сравнить эти модели на собственных задачах, а не верить чужим бенчмаркам — в GEMERA AI можно протестировать YandexGPT, GigaChat, Qwen и Kandinsky в одном чате или кабинете, без танцев с VPN и разных подписок. Иногда десяти минут в интерфейсе достаточно, чтобы миф развеялся сам.