Разборы
Нейросеть для генерации изображений: что она умеет, а что нет
Разбираем, какие картинки нейросеть делает хорошо, где она стабильно ошибается и как формулировать запрос, чтобы не тратить попытки впустую.
· 4 мин чтения
Генераторы изображений показывают в рекламе лучшие из тысячи результатов. Поэтому первое столкновение с реальностью обычно разочаровывает: руки с шестью пальцами, текст на вывеске из несуществующих букв, лица, которые «почти нормальные», но смотреть на них неприятно.
Это не поломка. Это границы технологии, и их полезно знать заранее — тогда вы будете просить то, что получится.
Что получается хорошо
Фактуры и материалы. Дерево, ткань, металл, вода, туман — модели обучены на огромном количестве фотографий, и материал они передают убедительно.
Атмосфера и свет. Закат, дождь за окном, свет одной лампы в тёмной комнате — здесь генераторы сильны настолько, что результат часто интереснее задуманного.
Абстракция и фон. Заливки, градиенты, узоры, обложки без конкретного сюжета — задача, где почти невозможно ошибиться.
Стилизация. Акварель, гравюра, рисунок углём, пиксель-арт. Чем дальше от фотореализма, тем меньше заметны типичные ошибки.
Что получается плохо
Текст внутри картинки. Вывески, надписи на упаковке, буквы на футболке. Модель рисует нечто похожее на текст, но читаемых слов не выходит. Надёжный обходной путь один: оставить место и добавить надпись отдельно, в любом редакторе.
Руки и пальцы. Классическая проблема. Стало лучше, но не решилось. Если руки не главное в кадре — просите крупный план лица или композицию, где кисти не видны.
Точное количество. «Ровно пять яблок» превращается в четыре или семь. Считать модель не умеет — она воспроизводит образ, а не пересчитывает объекты.
Повторяемость персонажа. Сгенерировать одного и того же человека в двух разных сценах — задача, которая штатными средствами не решается. Каждая генерация независима.
Схемы и чертежи. Всё, где важна инженерная точность, а не впечатление. Получится картинка, похожая на схему, но бессмысленная по содержанию.
Как устроен работающий запрос
Разложим на слои. Не обязательно использовать все — но порядок именно такой по важности.
Объект. Что главное в кадре. Одно, а не список из пяти.
Действие или состояние. Что происходит. Статичный объект почти всегда скучнее.
Окружение. Где это. Задаёт половину настроения.
Свет. Самый недооценённый параметр. «Мягкий утренний свет», «жёсткий контровой», «неон в темноте» меняют кадр сильнее, чем замена объекта.
Оптика и ракурс. Крупный план, вид сверху, широкий угол, малая глубина резкости.
Стиль. Фотореализм, иллюстрация, конкретная техника.
Пример сборки:
пожилой пекарь достаёт противень из печи, старая пекарня, ранее утро, тёплый свет от печи сбоку, крупный план, малая глубина резкости, фотореализм
Сравните с «пекарь в пекарне» — разница будет не в качестве рендера, а в том, что второй запрос допускает миллион прочтений, а первый — одно.
Попробовать можно прямо в генераторе изображений.
Три ошибки, которые стоят попыток
Список вместо сцены. «Кот, собака, дом, дерево, машина, солнце» — модель попытается уместить всё и не справится ни с чем. Одна сцена, один смысловой центр.
Отрицания в лоб. «Без людей» иногда работает наоборот: слово «люди» в запросе есть, и модель на него реагирует. Надёжнее описать, что должно быть: «пустая улица на рассвете».
Слишком длинный запрос. После определённого объёма модель начинает терять начало. Двадцать уточнений хуже, чем шесть точных.
Сколько попыток закладывать
Честная цифра: на осмысленный результат обычно уходит от трёх до пяти генераций, если запрос составлен нормально. Первая почти никогда не финальная — и это нормальный рабочий процесс, а не признак того, что что-то не так.
Поэтому имеет смысл сначала сделать несколько быстрых черновых генераций, выбрать направление, и только потом доводить деталями. Обратный порядок — сразу вылизывать один запрос — обходится дороже.
Права на результат
Вопрос, который возникает у всех, кто собирается использовать картинку в работе.
Изображения, созданные в Qevli, вы можете использовать в коммерческих проектах — это зафиксировано в пользовательском соглашении. Но есть ограничение, которое не снимается ничьими правилами: не стоит генерировать узнаваемые товарные знаки и лица реальных людей — здесь работает уже не лицензия сервиса, а обычное право.
Коротко
- Сильные стороны: фактуры, свет, атмосфера, стилизация
- Слабые: текст в кадре, пальцы, точный счёт, повторяемость персонажа
- Свет и оптика меняют кадр сильнее, чем замена объекта
- Одна сцена вместо списка объектов
- Три-пять генераций на результат — норма, а не провал