3 бенчмарка, где GigaChat обошёл DeepSeek и GPT-5

Сбер выложил в открытый доступ новую флагманскую модель GigaChat 3.5 Ultra — и вместе с релизом опубликовал таблицы сравнения с DeepSeek, GPT-5 и внутренними версиями. Цифры любопытные: где-то российская модель действительно обгоняет мировых конкурентов, а где-то разрыв остаётся заметным. Разбираем, что изменилось и почему это важно не только для инженеров, но и для тех, кто просто выбирает, каким чат-ботом пользоваться каждый день.
Что изменилось в самой модели
. Главное отличие от предыдущего флагмана — не рост, а сжатие:.
Технически это стало возможно за счёт собственной гибридной архитектуры:. Разработчики честно признают, что путь был непростым —. Модель уже доступна в веб-версии ГигаЧата для обычных пользователей, а разработчики могут скачать веса и дообучать её под свои задачи.
Где реально видно преимущество
Самое интересное — не архитектура, а конкретные цифры сравнения с зарубежными моделями. По собственным замерам Сбера,, а. В математике разрыв тоже в пользу новой модели:.
Базовая версия модели, до дообучения на диалоги, тоже показывает силу:. Для отрасли это важный сигнал: российская open source модель конкурирует не с прошлогодними версиями зарубежных конкурентов, а с их актуальными релизами.
А где заканчивается победа
Здесь стоит включить критическое мышление. Независимый обзор честно отмечает:. И даже по собственным замерам Сбера победа не тотальная:. То есть в реальных задачах программирования DeepSeek местами всё же впереди.
Независимая аналитика MySummit, охватывающая 42 модели и 80 управленческих сценариев, даёт более сдержанную картину:. Тот же обзор указывает на конкретные слабости:.
- Что точно сильно: математика, работа с длинным контекстом, агентные сценарии, стратегический анализ на русском языке.
- Где нужна проверка руками: сложный код, точные финансовые расчёты, юридические ссылки.
- Что важно помнить: большинство громких цифр — замеры самого вендора, независимые арены дают более скромную картину.
Не только GigaChat: остальной фронт
Похожая динамика видна и в других российских продуктах. Видеомодель Kandinsky 5.0 попала в мировую таблицу лидеров:. Как справедливо замечают авторы обзора,.
YandexGPT после переименования в Алису AI тоже приводит собственные цифры превосходства:. Но и здесь аналитики добавляют важную оговорку:.
Что это меняет
Общая картина такая: разрыв между российскими моделями и глобальными лидерами реально сократился, особенно в задачах на русском языке, математике и работе с документами. Но громкие проценты в пресс-релизах и реальный опыт использования — разные вещи, и судья бенчмарка почти всегда выбран самим вендором. Практический вывод простой: если задача завязана на русский язык, право или локальную специфику — стоит попробовать GigaChat, YandexGPT или Kandinsky на своих реальных запросах, а не верить одним графикам.
Попробовать GigaChat 3.5 Ultra, YandexGPT, Kandinsky и Qwen наравне с GPT, Claude и Gemini можно в GEMERA AI — в одном Telegram-боте и веб-кабинете, без переключения между десятком разных сервисов и подписок.