Реалистичные лица в Midjourney и DALL-E: почему «кукольная кожа» — это не баг?

В феврале 2026 года OpenAI выпустила GPT-Image-2 — модель, которая точно воспроизводит текст на вывесках и упаковках, но продолжает генерировать лица с текстурой силиконовой куклы. Пользователи Midjourney жалуются на то же самое: кожа выглядит как отполированный пластик, поры выстроены идеальной сеткой, а блики слишком равномерные. Сообщество винит несовершенство моделей. Но что, если «кукольность» — не баг, а сознательный выбор разработчиков? Разбираем четыре главных заблуждения о фотореализме портретов в нейросетях.
Миф первый: добавь «realistic photo» — и получишь фотореализм
Самая частая ошибка новичков — считать, что промпт вроде «realistic photo of a woman» гарантирует живую кожу. На практике такие запросы дают обратный эффект. Модели обучены на миллионах рекламных фотографий, где кожу ретушируют до идеала: убирают поры, выравнивают тон, сглаживают микрорельеф. Слово «realistic» для нейросети означает не документальную съёмку, а коммерческую фотографию — ту самую, где модели выглядят как восковые фигуры.
Что работает на самом деле: конкретные технические указания. Вместо абстрактного «realistic» пишите «skin texture, visible pores, natural imperfections, subtle blemishes». Добавьте «film photography, analog» — это сдвигает стилистику в сторону плёночной зернистости и неидеальной оптики. Укажите конкретную камеру и объектив — например, «shot on Canon 5D Mark IV, 50mm f/1.4» — это даёт модели референс по глубине резкости и характеру боке.
Миф второй: чем больше деталей в промпте, тем реалистичнее результат
Многие думают, что длинный промпт с десятком прилагательных улучшит качество. На деле перегруженный запрос размывает фокус: модель пытается угодить всем требованиям сразу и выдаёт усреднённый результат. Особенно вредны клише вроде «4K, HDR, cinematic lighting, divine beauty» — они тянут генерацию в сторону глянцевой рекламы и сказочной эстетики.
Правильная стратегия — послойное усложнение. Начните с минимального запроса: сцена, основной объект, освещение. Получили первый результат — проанализируйте, что не так. Затем добавьте одну-две детали: текстуру кожи или угол камеры. Ещё один проход — уточните свет или перспективу. Такой итеративный подход даёт больше контроля, чем попытка написать идеальный промпт с первого раза.
Миф третий: нейросети скоро научатся рисовать живую кожу сами
Сообщество ждёт, что следующая версия Midjourney или DALL-E наконец исправит проблему силиконовых лиц. Но дело не в технических ограничениях — модели уже умеют воспроизводить реалистичную текстуру. Проблема в датасетах и в том, что считается «хорошим» результатом. Обучающие выборки переполнены коммерческими фотографиями с идеально отретушированной кожей — потому что таких изображений в интернете большинство. Документальные портреты с естественными несовершенствами составляют меньшинство.
Более того, разработчики намеренно сглаживают текстуру кожи, чтобы избежать жалоб на «некрасивые» результаты. Пользователи массово генерируют портреты для соцсетей и рекламы — там востребована именно глянцевая эстетика. Если модель начнёт по умолчанию выдавать лица с расширенными порами и покраснениями, поток негативных отзывов гарантирован. Так что «кукольность» — это компромисс между реализмом и коммерческой привлекательностью.
Миф четвёртый: для продуктовой съёмки с людьми нейросети уже годятся
GPT-Image-2 отлично справляется с продуктовыми фото без людей: упаковка, электроника, еда выглядят убедительно. Но как только в кадре появляется человек — текстура кожи портит всё впечатление. Ранние тестировщики отмечают: модель идеально воспроизводит текст на этикетке рамэн-лапши и правильно рендерит пар над тарелкой, но руки, держащие палочки, выглядят как у манекена.
Причина та же — перекос в данных. Фуд-фотография и съёмка гаджетов представлены в обучающих выборках тысячами профессиональных снимков. А вот портреты людей в продуктовых сценах чаще всего отретушированы для рекламы. Модель научилась копировать этот стиль. Пока для съёмки, где важна естественность человека, надёжнее нанять фотографа или использовать нейросеть только для фона и продукта, а модель снять отдельно.
Что делать прямо сейчас
Если вам нужен реалистичный портрет, откажитесь от слов вроде «beautiful, perfect, flawless». Укажите конкретные несовершенства: «subtle freckles, uneven skin tone, fine lines». Добавьте технический контекст: тип камеры, плёнку, естественное освещение — «natural window light, soft shadows». Избегайте упоминания макияжа или пишите «minimal makeup, no retouching».
И главное — принимайте ограничения. Нейросети сегодня — это инструмент для быстрых итераций и концептов, а не замена профессиональной фотосъёмке. Для рекламы продукта без людей они уже работают отлично. Для портретов с живой кожей — пока требуют многократной ручной доводки или комбинирования с реальными фото.
Хотите попробовать разные подходы к генерации портретов? В GEMERA AI доступны Midjourney, DALL-E и другие модели — экспериментируйте с промптами и сравнивайте результаты в одном интерфейсе, чтобы найти баланс между скоростью и качеством для вашей задачи.