Gemini 3.1 Flash TTS: Google встроил управление голосом через текстовые команды

Google DeepMind представил новую модель синтеза речи — Gemini 3.1 Flash TTS. Главное отличие от конкурентов — система Audio Tags, которая позволяет управлять голосом через текстовые команды прямо внутри промпта. Вместо того чтобы просто генерировать озвучку, пользователь может задавать стиль, эмоцию, темп и подачу речи как режиссёр — только через текст.
Как работают Audio Tags
Audio Tags — это текстовые метки, которые встраиваются в промпт и управляют параметрами синтеза речи. Например, можно указать эмоциональную окраску (радость, грусть, уверенность), темп (быстрый, медленный, размеренный) или стиль подачи (формальный, дружеский, драматичный).
Система работает нативно — не нужно переключаться между интерфейсами или настройками. Достаточно написать команду в тексте, и модель применит её к озвучке. Это особенно удобно для создателей подкастов, аудиокниг, обучающих материалов и рекламных роликов, где важна точная передача интонации.
Что ещё получила модель
Помимо Audio Tags, Gemini 3.1 Flash TTS включает несколько улучшений:
- Более естественное звучание — плавные переходы между фразами, меньше артефактов
- Поддержка 70+ языков, включая русский, с учётом интонационных особенностей
- Встроенная маркировка SynthID — технология, которая помечает синтезированную речь на уровне аудиосигнала, чтобы отличать её от реальной записи
SynthID работает незаметно для слушателя, но позволяет верифицировать происхождение аудио — важная функция в эпоху дипфейков и клонирования голосов.
Место на бенчмарке TTS Arena
По результатам тестирования на бенчмарке Artificial Analysis TTS Arena, модель заняла 2-е место с рейтингом Elo 1211. Она уступила только Inworld TTS 1.5 Max, но обогнала популярную ElevenLabs v3. Это говорит о высоком качестве синтеза и конкурентоспособности решения от Google.
Для сравнения: ElevenLabs долгое время считался эталоном в озвучке, особенно для коммерческих проектов. Тот факт, что Gemini 3.1 Flash TTS обошёл его, показывает серьёзный прогресс Google в этом направлении.
Где доступна модель
Gemini 3.1 Flash TTS уже открыт в формате preview через Gemini API и Google AI Studio. Для бизнеса модель доступна через Vertex AI. В ближайшее время Google планирует интегрировать её в пользовательские продукты, включая Google Vids — сервис для создания видео с автоматической озвучкой.
Это означает, что скоро функция станет доступна не только разработчикам через API, но и обычным пользователям в интерфейсе Google Workspace.
Почему это важно
Появление Audio Tags меняет подход к работе с синтезом речи. Раньше для управления голосом приходилось либо вручную настраивать параметры (что долго), либо перебирать варианты генерации (что дорого). Теперь можно описать нужный результат текстом — как при работе с актёром озвучки, только быстрее и дешевле.
Это особенно полезно для создателей контента, которые работают с большими объёмами озвучки: подкастеры, авторы обучающих курсов, продюсеры аудиокниг. Вместо того чтобы записывать десятки дублей или нанимать актёров для каждой эмоциональной сцены, можно управлять интонацией через промпт.
Что дальше
Google продолжает развивать направление мультимодальных моделей, где текст, изображение, видео и аудио работают вместе. Gemini 3.1 Flash TTS — часть этой экосистемы. Вероятно, в будущем мы увидим ещё более тесную интеграцию: генерация видео с автоматической озвучкой, адаптация голоса под визуальный контент, синхронизация эмоций между изображением и звуком.
Пока модель находится в режиме preview, но для тех, кто работает с озвучкой регулярно, уже сейчас стоит протестировать её возможности. Доступ открыт через Gemini API — можно попробовать Audio Tags на реальных задачах и оценить, насколько это ускоряет работу.