ChatGPT Image 2.0: как OpenAI научила нейросеть рисовать читаемый текст

Пока все ждали новых агентов и видеогенераторов, OpenAI незаметно представила ChatGPT Image 2.0 — модель, которая закрывает одну из самых болезненных проблем всех нейросетей для изображений. Теперь текст на картинках не превращается в набор искажённых символов, а остаётся читаемым — даже если это абзац на плакате или подписи на инфографике.

Встроенное мышление: модель планирует перед генерацией

ChatGPT Image 2.0 — первая модель OpenAI с встроенными способностями к мышлению. Это значит, что перед генерацией она планирует композицию, сверяет результат с промптом и может перегенерировать несоответствующие части. Если в кадре несколько объектов со сложными пространственными связями — модель учитывает это на этапе планирования, а не пытается исправить ошибки постфактум.

Ещё одна возможность — загрузка данных из интернета прямо в процессе генерации. Попросите создать изображение Эйфелевой башни на рассвете, и модель подтянет реальные фото из поиска, чтобы точно передать архитектуру. Это решает проблему «красивых, но неправдоподобных» результатов, когда модель додумывает детали вместо того, чтобы опираться на факты.

Текст на изображениях: проблема решена

Все генеративные модели испытывали сложности с текстом: искажённые буквы, слова с опечатками, перепутанные знаки. ChatGPT Image 2.0 — первая, которой можно доверить создание плаката с абзацем текста и получить читаемый результат. Модель специально настроена для работы с небольшими текстами, элементами интерфейса, диаграммами и сложными макетами.

Многоязычная визуализация работает без ограничений. Русский, арабский, китайский, хинди — модель корректно рендерит символы любого алфавита. Это открывает возможности для локализованной рекламы, образовательного контента с подписями на разных языках и дизайнерских инструментов для международных проектов.

В режиме расширенного мышления (Extended Thinking) модель работает дольше и расходует больше токенов, но генерирует заметно более согласованный результат для задач с несколькими объектами, точными пространственными связями или многослойным текстом.

Практические сценарии: от маркетинга до фотореалистичных сцен

Маркетинговые и дизайнерские материалы — очевидная область применения. Инфографика, афиши мероприятий, реклама в социальных сетях, обложки книг, презентации с настоящей типографикой. Это первая модель OpenAI, которой можно доверить создание готового материала для рекламной кампании без последующей доработки в графических редакторах.

Фотографы получают инструмент для создания реалистичных сцен с точной передачей освещения и текстур. Уровень детализации позволяет генерировать изображения, которые сложно отличить от профессиональной съёмки — от портретов до сложных многофигурных композиций.

Режим работы с несколькими изображениями сохраняет согласованность персонажей и объектов во всех кадрах. Запросите восемь вариантов одного персонажа в разных позах — модель сохранит его внешность, одежду и детали во всех восьми генерациях. Раньше для такой задачи требовались ControlNet, IP-Adapter и полный рабочий процесс в ComfyUI.

Доступность и ограничения

Каждый пользователь ChatGPT, включая бесплатную версию, получает доступ к быстрому режиму. Это прорыв: бесплатные пользователи теперь имеют доступ к модели, которая ещё год назад была бы доступна только по подписке.

Модель по-прежнему не идеальна в том, с чем не справляются все генераторы изображений. Руки в сложных позах, точная анатомия в напряжённых ситуациях, отражения, подчиняющиеся законам физики — эти аспекты улучшаются, но пока не решены окончательно.

Внимание пользователей привлечёт рендеринг текста, и это заслуженно. Но именно лежащая в основе способность модели анализировать собственные результаты и планировать композицию расширяет границы того, что можно создать с её помощью. Это не просто улучшенная версия предыдущей модели — это новый подход к генерации изображений.

Все упомянутые модели — ChatGPT Image 2.0, Imagen 4, Nano Banana 2 и другие — доступны в GEMERA AI через Telegram-бота и веб-кабинет. Попробуйте генерацию изображений с читаемым текстом, точной передачей деталей и встроенным мышлением — без ограничений по языкам и стилям.