DiffusionGemma: Google научила языковую модель генерировать текст как картинку

Google DeepMind в июне 2026 года выпустила DiffusionGemma — языковую модель, которая работает совсем не так, как привычные GPT или Claude. Вместо того чтобы выдавать слова по одному слева направо, она генерирует текст как Midjourney или DALL-E генерируют картинки: начинает со случайного шума и постепенно уточняет результат за несколько итераций.
Это первая по-настоящему практичная открытая модель на дискретной диффузии от крупной лаборатории. Год назад Google показывала похожую технологию в закрытом превью, теперь же веса доступны всем на Hugging Face под лицензией Apache 2.0. Разбираемся, зачем понадобился такой радикальный отход от классической архитектуры и что это меняет для пользователей.
Как работает диффузия в тексте
Классические языковые модели — авторегрессионные. Они генерируют токен за токеном последовательно: прочитали промпт, выдали первое слово, добавили его к контексту, выдали второе — и так до конца. Это быстро и предсказуемо, но есть минус: модель не может вернуться назад и исправить начало фразы, если поняла, что выбрала неудачное направление.
DiffusionGemma работает иначе. Она:
- Берёт блок из 256 токенов-заглушек (случайный шум)
- За несколько проходов постепенно заменяет их на осмысленный текст
- На каждой итерации видит весь блок целиком и может уточнять любые части
- Выдаёт готовый результат сразу всем фрагментом
Это похоже на то, как художник сначала набрасывает общую композицию, потом прорабатывает детали, потом добавляет тени — а не рисует картину пиксель за пикселем слева направо.
Зачем это нужно
Диффузионный подход открывает новые возможности:
- Параллельная генерация. Модель может одновременно уточнять разные части текста, что теоретически даёт прирост скорости на специализированном железе.
- Глобальная согласованность. Видя весь блок сразу, модель лучше держит структуру длинных ответов — не уходит в сторону на середине абзаца.
- Гибкость редактирования. Можно зафиксировать часть текста и попросить модель дописать или переписать только нужный фрагмент, не трогая остальное.
Google DeepMind подчёркивает, что DiffusionGemma — экспериментальная модель. Она не обязательно лучше авторегрессионных аналогов по всем метрикам, но открывает новое направление исследований. Веса доступны для экспериментов, и сообщество уже начало встраивать модель в популярные фреймворки.
Что внутри и как запустить
DiffusionGemma поддерживает мультимодальный ввод — текст, изображения, видео — и выдаёт текст. Есть поддержка системного промпта и режима рассуждений. Модель работает в Hugging Face Transformers, vLLM, SGLang, MLX и Unsloth с первого дня релиза. Можно развернуть её в Vertex AI Model Garden или через NVIDIA NIM, а квантованные версии в формате GGUF уже доступны для llama.cpp — то есть запустить модель можно даже на домашней видеокарте.
Размер модели и точные бенчмарки Google пока раскрывает дозированно — акцент сделан на том, что это research preview, а не production-ready продукт. Но сам факт публикации весов под открытой лицензией говорит о серьёзности намерений: компания хочет, чтобы сообщество подхватило направление и помогло найти применение диффузионным LLM в реальных задачах.
Контекст: весна 2026 года и гонка архитектур
Релиз DiffusionGemma попал в период, когда все крупные лаборатории одновременно обновили свои флагманы. OpenAI выпустила GPT-5.5, Anthropic — Claude Opus 4.7 и 4.8, сам Google — линейку Gemini 3.1 и 3.5 Flash, xAI — Grok 4.20, DeepSeek — V4. Но почти все эти модели — эволюция одной и той же авторегрессионной архитектуры.
DiffusionGemma — попытка выйти за рамки устоявшейся парадигмы. Пока неясно, станет ли диффузия мейнстримом для текста или останется нишевым инструментом для специфических задач. Но то, что Google открыла веса и инфраструктуру для экспериментов, уже ценно: индустрия получила новую точку отсчёта для исследований.
Попробовать DiffusionGemma и сравнить её с классическими моделями — GPT, Claude, Gemini 3.5 Flash, DeepSeek V4 — можно прямо сейчас в GEMERA AI. Все актуальные модели собраны в одном интерфейсе, переключение между ними занимает секунду, а доступ открыт как через Telegram-бота, так и через веб-кабинет.