3 бенчмарка, где GigaChat обошёл DeepSeek и GPT-5

3 бенчмарка, где GigaChat обошёл DeepSeek и GPT-5

Сбер выложил в открытый доступ новую флагманскую модель GigaChat 3.5 Ultra — и вместе с релизом опубликовал таблицы сравнения с DeepSeek, GPT-5 и внутренними версиями. Цифры любопытные: где-то российская модель действительно обгоняет мировых конкурентов, а где-то разрыв остаётся заметным. Разбираем, что изменилось и почему это важно не только для инженеров, но и для тех, кто просто выбирает, каким чат-ботом пользоваться каждый день.

Что изменилось в самой модели

. Главное отличие от предыдущего флагмана — не рост, а сжатие:.

Технически это стало возможно за счёт собственной гибридной архитектуры:. Разработчики честно признают, что путь был непростым —. Модель уже доступна в веб-версии ГигаЧата для обычных пользователей, а разработчики могут скачать веса и дообучать её под свои задачи.

Где реально видно преимущество

Самое интересное — не архитектура, а конкретные цифры сравнения с зарубежными моделями. По собственным замерам Сбера,, а. В математике разрыв тоже в пользу новой модели:.

Базовая версия модели, до дообучения на диалоги, тоже показывает силу:. Для отрасли это важный сигнал: российская open source модель конкурирует не с прошлогодними версиями зарубежных конкурентов, а с их актуальными релизами.

А где заканчивается победа

Здесь стоит включить критическое мышление. Независимый обзор честно отмечает:. И даже по собственным замерам Сбера победа не тотальная:. То есть в реальных задачах программирования DeepSeek местами всё же впереди.

Независимая аналитика MySummit, охватывающая 42 модели и 80 управленческих сценариев, даёт более сдержанную картину:. Тот же обзор указывает на конкретные слабости:.

  • Что точно сильно: математика, работа с длинным контекстом, агентные сценарии, стратегический анализ на русском языке.
  • Где нужна проверка руками: сложный код, точные финансовые расчёты, юридические ссылки.
  • Что важно помнить: большинство громких цифр — замеры самого вендора, независимые арены дают более скромную картину.

Не только GigaChat: остальной фронт

Похожая динамика видна и в других российских продуктах. Видеомодель Kandinsky 5.0 попала в мировую таблицу лидеров:. Как справедливо замечают авторы обзора,.

YandexGPT после переименования в Алису AI тоже приводит собственные цифры превосходства:. Но и здесь аналитики добавляют важную оговорку:.

Что это меняет

Общая картина такая: разрыв между российскими моделями и глобальными лидерами реально сократился, особенно в задачах на русском языке, математике и работе с документами. Но громкие проценты в пресс-релизах и реальный опыт использования — разные вещи, и судья бенчмарка почти всегда выбран самим вендором. Практический вывод простой: если задача завязана на русский язык, право или локальную специфику — стоит попробовать GigaChat, YandexGPT или Kandinsky на своих реальных запросах, а не верить одним графикам.

Попробовать GigaChat 3.5 Ultra, YandexGPT, Kandinsky и Qwen наравне с GPT, Claude и Gemini можно в GEMERA AI — в одном Telegram-боте и веб-кабинете, без переключения между десятком разных сервисов и подписок.