Как собрать сложный макет одним запросом с новыми нейросетями для картинок

Как собрать сложный макет одним запросом с новыми нейросетями для картинок

Ещё пару лет назад разговор про российские и китайские нейросети звучал как оправдание: «неплохо для отечественного», «почти как у больших». Сейчас тон другой. На днях команда Qwen показала генератор изображений, который в один проход собирает учебник по физике с формулами и иллюстрациями, а Сбер прямо заявляет, что его модель редактирования обходит GPT Image. Разбираем, что из этого работает уже сегодня и как этим воспользоваться.

Qwen-Image-3.0 верстает целые страницы, а не просто рисует

21 июля Alibaba выпустила третье поколение своего генератора изображений. Главная фишка — не красота картинки, а плотность и точность содержимого. Простой запрос — и готова газетная полоса, медицинская схема или целый комикс. В демонстрации разработчиков модель за один проход создала сетку из девяти самостоятельных блоков, в неё вошли комикс о безопасности в тоннеле, уроки по геометрии и физике, медицинская схема, материалы по биологии и теории групп, банковская инфографика и сравнение структуры ДНК, а для описания всей композиции потребовалась инструкция объёмом примерно 3700 токенов.

Технически это стало возможным благодаря выросшему окну инструкций: Qwen-Image-3.0 принимает промпты длиной до 4500 токенов, что даёт модели достаточно пространства для создания плотных макетов за один проход, а не сборки их из нескольких изображений. Модель уверенно читает мелкий текст: процессор обрабатывает вводные данные объёмом до 4500 токенов и отображает текст размером до десяти пикселей, математические формулы и двенадцать языков разборчиво за один проход.

Есть и оговорка, которая честно снижает пафос: Alibaba впервые не опубликовала технический отчет, независимые бенчмарки и веса модели. Пока это облачная версия, которая поддерживает генерацию и редактирование, выдаёт до шести вариантов за один запрос и работает с разрешением до 2048×2048 пикселей, доступ к ней предоставляется в режиме закрытого тестирования, публичной цены и весов пока нет.

Kandinsky 6.0 отвечает тем же уровнем — и не только на бумаге

Российский ответ вышел раньше, весной, но по духу это тот же самый разговор — не «догоняем», а «конкурируем». Сбер прямо заявил: по результатам сравнений Kandinsky 6.0 Image Pro работает на уровне Flux 2 Max и превосходит GPT Image 1.5. Независимые обзоры подтверждают похожую картину: внутренние тесты показывают, что в ряде задач по редактированию Kandinsky 6.0 сопоставим с такими международными моделями, как Nano-Banana, Flux и Qwen.

Список того, что модель умеет делать с одной фотографией, впечатляет:

  • Реставрация — модель возвращает четкость выцветшим или поцарапанным снимкам.
  • Стилизация — превращает фото в иллюстрацию в стиле аниме, комикса или мультфильма.
  • Нейрофотосессия — позволяет сгенерировать серию новых кадров на основе одной фотографии — с другим фоном, одеждой или локацией.
  • Точечные правки — модель точнее понимает сложные многосоставные инструкции и аккуратнее делает точечные правки: если попросить поменять персонажу причёску или добавить очки, всё остальное остаётся нетронутым.

И главное — доступ без барьеров: нейросеть интегрирована в ИИ-помощника «ГигаЧат» и доступна бесплатно в веб-версии, мобильном приложении и мессенджерах без ограничений по количеству запросов.

Текст тоже подтягивается: YandexGPT и GigaChat учатся рассуждать

Пока картинки бьют рекорды, текстовые модели решают более скучную, но не менее важную задачу — думать дольше перед ответом и меньше выдумывать. YandexGPT 5.1 Pro уже показывает результат: она на потоке, в котором сочетаются вопросы пользователей и сложные задачи, востребованные в бизнес-сфере, превосходит предыдущую модель и достигает уровня GPT-4.1 компании OpenAI, а также эффективнее работает с системным промтом и почти вдвое реже прошлой версии даёт выдуманные ответы.

У GigaChat в июле обновилась документация по режиму рассуждений — модель теперь явно показывает цепочку размышлений перед ответом. Ранее Сбер уже выложил в открытый доступ флагманские модели этого семейства: по замерам компании, Ultra обходит non-reasoning Qwen3-235B-A22B и DeepSeek-V3-0324 в математике и general reasoning, а Lightning на аренах с судьёй GPT-4.1 играет на уровне GPT-4o, при этом модели лежат на HuggingFace и GitVerse под MIT-лицензией.

Как попробовать всё это уже сегодня

  1. Сложный макет или инфографику — доверьте задаче с текстом и структурой Qwen: даже без полного доступа к 3.0 предыдущая версия уверенно держится в топе по работе с надписями.
  2. Точечное редактирование фото — реставрация старых снимков, смена фона или стилизация под комикс — это ровно то, для чего сделан Kandinsky 6.0, и это бесплатно.
  3. Текст, который важно не переврать — включайте режим рассуждений в GigaChat или задачи с расширенным анализом в YandexGPT 5 Pro, когда нужна не скорость, а точность.
  4. Сравнение вариантов — прогоните один и тот же промпт через несколько моделей и сравните ответы вживую, прежде чем выбирать инструмент для конкретной задачи.

Разрыв между российскими, китайскими и западными моделями сокращается быстрее, чем кажется со стороны — особенно в задачах редактирования изображений и работы с русским языком. Попробовать GigaChat, Kandinsky, Qwen и YandexGPT в одном месте — без переключения между сайтами и разными аккаунтами — можно в GEMERA AI: через Telegram-бота или веб-кабинет. Загляните и составьте собственное мнение о том, кто сейчас действительно впереди.