Можно ли создать голос, которого никогда не существовало, одной фразой?

Ещё недавно работа с озвучкой в нейросетях сводилась к выбору голоса из каталога: мужской или женский, бодрый или спокойный — и всё. Если нужный тембр не подходил под задачу, приходилось либо мириться с компромиссом, либо идти в студию. Google решил закрыть этот разрыв и выпустил модели, которые превращают синтез речи из набора готовых пресетов в полноценный творческий инструмент, где голос собирается под задачу, а не выбирается из того, что есть.
Что именно вышло
23 сентября 2026 года Google представила две новые модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS.. Старшая модель заточена под творческие задачи и сложную актёрскую игру, а младшая — под массовую генерацию аудио подешевле.
Разница между ними понятна из документации самого Google:, а Flash-Lite — для задач, где важны объём и скорость, а не филигранная выразительность.
Голос по описанию, а не из каталога
Главное изменение — это сама логика работы с голосом. Раньше разработчик выбирал голос из списка, теперь он его описывает словами..
Если же собственный уникальный голос не нужен, под рукой огромная библиотека готовых вариантов:.
Режиссура речи построчно
Пожалуй, самая интересная часть обновления — это контроль над подачей внутри одного текста. Модель реагирует не на общие настройки тона, а на построчные указания прямо в сценарии..
Это открывает сценарии, которые раньше требовали ручного монтажа и нескольких дублей:
- диалог двух персонажей из одного сценария с разными голосами и характерами;
- постепенное нарастание эмоции внутри одной реплики — от сомнения к уверенности;
- региональный акцент и особенности произношения конкретного диалекта;
- сохранение тембра и темпа голоса на протяжении длинного ролика без «дрейфа» звучания.
При этом — то, что раньше требовало отдельной сборки из кусков.
Клонирование — только с согласия и водяным знаком
Отдельного внимания заслуживает функция воспроизведения конкретного голоса, а не придуманного с нуля.. Это важная деталь для всех, кто работает с озвучкой на заказ: инструмент сразу встроен в этические рамки, а не оставляет их на совесть пользователя.
Где это пригодится уже сейчас
Новые модели нацелены не на узкую нишу, а сразу на несколько типов задач, с которыми ежедневно сталкиваются копирайтеры, маркетологи и создатели контента:
- озвучка рекламных роликов и лендингов с голосом, который звучит так, как нужно бренду, а не как получилось;
- озвучка персонажей для игр и интерактивных историй с нужным акцентом и характером;
- подкасты и аудиокниги с несколькими голосами из одного текста без привлечения актёров;
- локализация контента сразу на десятки языков с сохранением интонационного рисунка оригинала.
Примечательно, что модели доступны не только разработчикам через API — в обычном продуктовом интерфейсе, подобном Google AI Studio, можно прямо в диалоге придумать голос, описать сцену и получить готовый результат без строчки кода.
Что это значит для тех, кто работает с контентом
Главный сдвиг здесь не в том, что голос стал более «человечным» — качественный синтез речи существовал и раньше. Сдвиг в том, что озвучка перестаёт быть отдельным этапом производства, требующим студии, актёра и монтажёра. Теперь это часть обычной работы с текстом: написал сценарий, описал персонажа — получил готовую дорожку, которую можно тут же вставить в видео или подкаст.
Для тех, кто пишет тексты, собирает рекламные материалы или делает контент для соцсетей, это означает одно: озвучку больше не нужно планировать заранее как отдельную дорогую услугу. Попробовать работу с голосовыми моделями, включая озвучку на базе современных ИИ-инструментов, можно прямо в GEMERA AI — без необходимости разбираться с десятком разных сервисов и интерфейсов.