Gemma 4: Google выпустил открытую модель с 31 млрд параметров

Gemma 4: Google выпустил открытую модель с 31 млрд параметров

Google DeepMind выпустил четвёртое поколение открытых языковых моделей — Gemma 4. Линейка включает четыре варианта: компактные E2B и E4B для мобильных устройств, модель 26B с архитектурой смеси экспертов и флагманскую 31B Dense. Все версии доступны под лицензией Apache 2.0 и уже размещены на Hugging Face.

Что такое архитектура смеси экспертов

Ключевая новинка — модель 26B MoE (Mixture of Experts). При общем объёме 26 миллиардов параметров она активирует только 3,8 миллиарда при каждом запросе. Это позволяет сохранить глубину знаний крупной модели, но работать с меньшими затратами памяти и быстрее генерировать ответы.

Принцип работы: модель разделена на специализированные блоки — «экспертов». Для каждой задачи активируется только нужный набор. Например, для программирования включаются одни эксперты, для перевода — другие. Это первый раз, когда Google применил такую архитектуру в открытой линейке Gemma.

Результаты на бенчмарках

Старшая модель 31B Dense заняла третье место среди всех открытых моделей в рейтинге Arena AI Text. По данным исследователей Клемана Фарабе и Оливье Лакомба, команда стремилась максимизировать «интеллект на параметр» — и результат превзошёл модели вдвое большего размера.

Для сравнения: 31B-версия конкурирует с закрытыми моделями на 60–70 миллиардов параметров по качеству рассуждений и программирования. При этом она помещается на одном GPU и работает значительно быстрее.

Мультимодальность и поддержка языков

Все четыре модели Gemma 4 умеют обрабатывать не только текст, но и изображения с видео. Младшие версии E2B и E4B дополнительно поддерживают аудиовход — это открывает возможность распознавания речи прямо на устройстве, без отправки данных на сервер.

Контекстное окно составляет до 128 тысяч токенов у компактных моделей и до 256 тысяч у старших. Поддерживается более 140 языков, включая русский. Модели изначально спроектированы для агентских сценариев: встроена нативная поддержка вызова функций и структурированного вывода в формате JSON.

Где можно запустить

Gemma 4 доступна на нескольких платформах:

  • Hugging Face — для разработчиков и исследователей
  • Kaggle — с готовыми ноутбуками для экспериментов
  • Ollama и LM Studio — для локального запуска на компьютере
  • Docker — для развёртывания в облаке или на собственных серверах

Младшие версии E2B и E4B способны работать на смартфонах Android, одноплатных компьютерах Raspberry Pi и встраиваемых системах Jetson Nano. Это делает их подходящими для офлайн-приложений: голосовых ассистентов, переводчиков, систем распознавания.

Кому подходит Gemma 4

Открытая лицензия Apache 2.0 снимает большинство коммерческих ограничений. Модели можно использовать в продуктах без отчислений Google, модифицировать архитектуру и дообучать на собственных данных.

Основные сценарии применения:

  • Разработка чат-ботов и ассистентов с низкой задержкой
  • Обработка документов и анализ данных на устройстве
  • Прототипирование AI-функций без зависимости от облачных API
  • Задачи с требованиями к цифровому суверенитету и конфиденциальности

Старшая 31B-модель помещается на одном GPU — это делает её доступной для небольших команд и стартапов, которые не могут позволить себе инфраструктуру для моделей на сотни миллиардов параметров.

Попробовать в GEMERA AI

Все модели семейства Gemma, включая новую четвёртую версию, доступны через GEMERA AI — в Telegram-боте и веб-кабинете. Вы можете протестировать разные размеры, сравнить скорость и качество ответов, оценить мультимодальные возможности. Для разработчиков открыт API с гибкими настройками контекста и параметров генерации.