DiffusionGemma: Google научила языковую модель генерировать текст как картинку

DiffusionGemma: Google научила языковую модель генерировать текст как картинку

Google DeepMind в июне 2026 года выпустила DiffusionGemma — языковую модель, которая работает совсем не так, как привычные GPT или Claude. Вместо того чтобы выдавать слова по одному слева направо, она генерирует текст как Midjourney или DALL-E генерируют картинки: начинает со случайного шума и постепенно уточняет результат за несколько итераций.

Это первая по-настоящему практичная открытая модель на дискретной диффузии от крупной лаборатории. Год назад Google показывала похожую технологию в закрытом превью, теперь же веса доступны всем на Hugging Face под лицензией Apache 2.0. Разбираемся, зачем понадобился такой радикальный отход от классической архитектуры и что это меняет для пользователей.

Как работает диффузия в тексте

Классические языковые модели — авторегрессионные. Они генерируют токен за токеном последовательно: прочитали промпт, выдали первое слово, добавили его к контексту, выдали второе — и так до конца. Это быстро и предсказуемо, но есть минус: модель не может вернуться назад и исправить начало фразы, если поняла, что выбрала неудачное направление.

DiffusionGemma работает иначе. Она:

  • Берёт блок из 256 токенов-заглушек (случайный шум)
  • За несколько проходов постепенно заменяет их на осмысленный текст
  • На каждой итерации видит весь блок целиком и может уточнять любые части
  • Выдаёт готовый результат сразу всем фрагментом

Это похоже на то, как художник сначала набрасывает общую композицию, потом прорабатывает детали, потом добавляет тени — а не рисует картину пиксель за пикселем слева направо.

Зачем это нужно

Диффузионный подход открывает новые возможности:

  • Параллельная генерация. Модель может одновременно уточнять разные части текста, что теоретически даёт прирост скорости на специализированном железе.
  • Глобальная согласованность. Видя весь блок сразу, модель лучше держит структуру длинных ответов — не уходит в сторону на середине абзаца.
  • Гибкость редактирования. Можно зафиксировать часть текста и попросить модель дописать или переписать только нужный фрагмент, не трогая остальное.

Google DeepMind подчёркивает, что DiffusionGemma — экспериментальная модель. Она не обязательно лучше авторегрессионных аналогов по всем метрикам, но открывает новое направление исследований. Веса доступны для экспериментов, и сообщество уже начало встраивать модель в популярные фреймворки.

Что внутри и как запустить

DiffusionGemma поддерживает мультимодальный ввод — текст, изображения, видео — и выдаёт текст. Есть поддержка системного промпта и режима рассуждений. Модель работает в Hugging Face Transformers, vLLM, SGLang, MLX и Unsloth с первого дня релиза. Можно развернуть её в Vertex AI Model Garden или через NVIDIA NIM, а квантованные версии в формате GGUF уже доступны для llama.cpp — то есть запустить модель можно даже на домашней видеокарте.

Размер модели и точные бенчмарки Google пока раскрывает дозированно — акцент сделан на том, что это research preview, а не production-ready продукт. Но сам факт публикации весов под открытой лицензией говорит о серьёзности намерений: компания хочет, чтобы сообщество подхватило направление и помогло найти применение диффузионным LLM в реальных задачах.

Контекст: весна 2026 года и гонка архитектур

Релиз DiffusionGemma попал в период, когда все крупные лаборатории одновременно обновили свои флагманы. OpenAI выпустила GPT-5.5, Anthropic — Claude Opus 4.7 и 4.8, сам Google — линейку Gemini 3.1 и 3.5 Flash, xAI — Grok 4.20, DeepSeek — V4. Но почти все эти модели — эволюция одной и той же авторегрессионной архитектуры.

DiffusionGemma — попытка выйти за рамки устоявшейся парадигмы. Пока неясно, станет ли диффузия мейнстримом для текста или останется нишевым инструментом для специфических задач. Но то, что Google открыла веса и инфраструктуру для экспериментов, уже ценно: индустрия получила новую точку отсчёта для исследований.

Попробовать DiffusionGemma и сравнить её с классическими моделями — GPT, Claude, Gemini 3.5 Flash, DeepSeek V4 — можно прямо сейчас в GEMERA AI. Все актуальные модели собраны в одном интерфейсе, переключение между ними занимает секунду, а доступ открыт как через Telegram-бота, так и через веб-кабинет.