Suno v6 против Eleven v4 в задачах контент-мейкера

За последние недели вышли два обновления, которые касаются буквально каждого, кто делает аудио с помощью нейросетей. Suno представила семейство v6, а спустя три недели ElevenLabs выпустила Eleven v4. Формально это разные категории — музыка и синтез речи, — но на практике оба релиза решают одну задачу: сделать ИИ-звук менее «машинным» и более управляемым. Разбираемся, что изменилось и какой инструмент выбрать под конкретный сценарий.
Suno v6: музыка из чего угодно, а не только из текста
Девятого сентября 2026 года Suno полностью перешла на новое поколение моделей: v6 (флагман), v6-wild (экспериментальная) и v6-mini (бесплатная). Это первый случай, когда компания выпустила сразу три модели одновременно, а старые версии при этом отключила — вернуться к ним не получится.
Главное отличие нового поколения — v6 добавляет редактирование готовой песни на обычном языке, мэшапы из нескольких источников, сэмплирование в одном рабочем процессе и промпты, которые собираются из аудио, изображений или видео, а не только из текста. То есть теперь можно не просто описать трек словами, а загрузить фотографию или видеофрагмент и попросить модель собрать музыку под настроение этого материала.
Важный момент для тех, кто публикует треки коммерчески: v6 обучена с нуля на лицензированных каталогах партнёров, в отличие от прежних моделей, обучавшихся на неразмеченных веб-данных. Среди партнёров по обучению — крупные музыкальные издательства, что снижает юридические риски при использовании треков в рекламе или на монетизируемых каналах.
Eleven v4: голос, который понимает контекст сцены
28 сентября 2026 года, то есть буквально на днях, ElevenLabs представила Eleven v4 и облегчённую Eleven v4 Turbo. Обе модели построены на новой архитектуре и поддерживают более 90 языков.
Главное обещание разработчиков: модель понимает, как фразу нужно произнести, а не просто читает её вслух, и учитывает тон, темп, характер персонажа и контекст всей сцены. На практике это значит, что одна и та же строка диалога может звучать по-разному в зависимости от того, что происходит в сцене — без ручной настройки каждого параметра.
Управлять подачей можно через теги прямо в тексте: подачу можно описать обычным текстом или вставить теги прямо в строку, например «смеётся», «сказано гневно с французским акцентом», «лёгкий дождь», «телефон вибрирует». Это удобно для озвучки роликов, где нужна эмоциональная динамика, а не монотонное чтение.
Отдельно стоит отметить улучшения для длинных форматов: модель лучше сохраняет тембр и манеру голоса от начала до конца, что важно для аудиокниг, курсов и длинных роликов. Раньше голос в длинных записях мог «плыть» к концу — теперь эта проблема заметно менее острая.
Как выбрать инструмент под задачу
Если вы делаете контент на регулярной основе, вопрос не «что лучше», а «что нужно именно сейчас». Вот практичный чек-лист:
- Нужен саундтрек, джингл или полноценная песня — берите Suno v6. Особенно если хотите собрать трек из визуального референса, а не описывать настроение словами.
- Нужна озвучка видео, рекламы или подкаста с эмоциональной подачей — Eleven v4 даст больше контроля через теги и лучше держит интонацию на длинных текстах.
- Работаете с диалогами нескольких персонажей — тоже в пользу Eleven v4: модель учитывает реплики собеседников, а не склеивает реплики механически.
- Важны коммерческие права на музыку — проверяйте уровень подписки в Suno: полные права доступны не на всех тарифах, а бесплатная v6-mini коммерческого использования не предполагает.
- Нужна скорость ответа в реальном времени — для голосовых ассистентов и интерактивных сценариев логичнее Eleven v4 Turbo: она оптимизирована именно под низкую задержку.
Комбинируем музыку и голос в одном проекте
На практике эти два инструмента чаще дополняют друг друга, чем конкурируют. Типичный рабочий процесс для ролика или рекламы выглядит так:
- Сначала собираете звуковую подложку или джингл в Suno v6, ориентируясь на настроение проекта.
- Затем накладываете озвучку через Eleven v4, прописывая теги подачи под конкретные сцены.
- Сводите результат в любом аудиоредакторе — большинство современных ИИ-сервисов отдают чистые WAV или MP3 без встроенного шума.
Такой подход экономит время по сравнению с поиском готовых треков и дикторов на фрилансе, особенно если контент выходит часто и бюджет на продакшн ограничен.
Что в итоге
Оба релиза — не революция, а закономерный шаг: модели становятся более контекстно-зависимыми и управляемыми через естественный язык, а не через технические параметры. Для практической работы это значит одно: меньше времени на подбор настроек, больше — на сам творческий результат.
Если хочется попробовать обе модели без необходимости разбираться с отдельными подписками и интерфейсами, в GEMERA AI доступ к актуальным музыкальным и голосовым нейросетям организован через один кабинет и Telegram-бота — можно протестировать разные инструменты на своей задаче и сравнить результат напрямую.