Top.Mail.Ru
Фоновое изображение
3 привычки, из-за которых ИИ-генерации выглядят одинаково

Весь ИИ-контент стал на одно лицо. Удобно винить нейросеть, но она лишь выдаёт средний результат — а берём это среднее мы сами. Разбираем привычки, из-за которых генерации похожи на чужие, и показываем на проекте, где проходит граница между серым результатом и рабочим.

Откройте любую ленту: банан допытывается у клубники, почему их ребёнок похож на её босса-яблоко. Листаете дальше и натыкаетесь на глянцевые лица без единой поры и «ожившие» фото из детства. Решаете почитать, а там тексты под копирку, где успех непременно «не про деньги, а про путь».

Списать на нейросеть проще всего: штампует, мол, что с неё взять. Но штампует она по нашему заказу. Нейросеть выдаёт средний результат, такая у неё работа. Беда в том, что нам этого среднего обычно хватает: выглядит прилично, и ладно.

Вот только это «прилично» одинаковое у всех. Чтобы из него выбраться, не нужен талант, нужно поменять несколько привычек. В конце покажем, как эти привычки работают на живом проекте.

Как мы сами загоняем себя в среднее

У серости есть автор, и это человек, который торопится. Часто опытный и совсем не лентяй, а тот, кто ищет короткую дорогу. Загвоздка в том, что она у всех одна и приводит к схожим результатам. Ниже три привычки, которые по ней ведут.

Генерировать без задачи

«Сделай красиво и современно». Этот запрос наплодил половину одинаковых картинок в вашей ленте.

Красиво как? Современно для чего? Если задача не сформулирована, модель не виновата, что выдаёт обтекаемый вариант. Ей просто не из чего выбирать, и она достраивает самое вероятное прочтение ваших слов. Это как попросить в кафе «что-нибудь вкусное»: принесут самое ходовое. А «красиво» в ту же секунду набирают ещё тысячи людей, запрос один, ответ один. На выходе у вас не своя картинка, а усреднённая по всем, кто просил то же самое.

Кажется, что можно добавить слов и получить что-то небанальное. И появляется «красивая девушка, стильно, качественно, детально, 4k». Слов больше, толку нет: «стильно» и «качественно» можно представить как угодно. Длина не спасает: за этими словами нет задачи и образа. Сначала вы решаете, что и зачем показываете, и только потом это превращается в промпт.

Прогонять всё через одну модель

У каждого есть любимая нейросеть, где всё привычно. А проверить, как ту же сцену сделает другая, — морока: свой интерфейс, своя оплата, иногда ещё и VPN поднимать приходится. И мы по инерции прогоняем через одну модель все задачи подряд.

Это как готовить весь ужин на одной сковороде. Омлет и стейк приготовятся, но привкус у них будет общий, сковородкин. С моделями так же: каждая сильна в своём. Одна делает живые фотографии, другая — иллюстрацию, у третьей хорошо выходят лица, а у четвёртой нет. Сидя в одной, вы привыкаете к её манере и принимаете её за единственно возможную.

Брать первый результат

Кадр готов, придраться не к чему, выкладываем. Но первый результат — черновик-ноль: модель показала, куда сворачивает по умолчанию. А по умолчанию она сворачивает в самое вероятное, то есть в то же самое среднее.

Подвох в том, что выглядит этот результат прилично. Будь он плохим, вы бы пошли переделывать. А он нормальный, поэтому рука тянется выложить. На приличном и застреваете, хотя до хорошего ещё идти.

Тут и проходит граница между средним и сильным: «получил картинку» против «получил рабочий материал». Любитель на первом кадре заканчивает. Профессионал с него начинает: кадрирует, правит, пересобирает.

Все три привычки звучат безобидно. Но именно из них и рождается тот самый ИИ-стиль, который видно за километр.

Один бриф и два разных результата

Теперь покажем на деле, как вредные привычки портят результат. Возьмём в руки личную жизнь нашего оленя Максима из Mish и создадим ему пару.

Нового персонажа назовём Оля и сгенерируем дважды. Первый раз — с теми же тремя привычками: размытый промпт, одна модель, первый результат. Второй раз — обходя каждую: сначала задача, потом сравнение моделей, потом доработка. Работать будем в Строфи, нашей платформе, где модели для картинок, видео и 3D лежат на одном холсте, так что сравнивать их можно сразу, без пяти вкладок и отдельных подписок.

Ленивый заход

Берём любую модель и пишем ровно то, что просится:

милая девушка-олениха, красивая, нежная, в современном стиле, 4k

Модель выдаёт непонятное существо, которое с оленем не имеет ничего общего.

И к Максиму она не имеет никакого отношения. Другой материал, другой силуэт, даже рогов нет. Модель показала самое вероятное прочтение слов «милая девушка-олениха», мы его забрали и получили недоразумение.

Рабочий заход

Сначала задача, потом промпт. До генерации отвечаем на вопрос: кто такая Оля и зачем она. Она пара Максиму, поэтому должна быть с ним из одной вселенной. Смотрим на маскота и выписываем, что делает его узнаваемым: плюшевый мех, крупная голова и маленькое тело, маленькие рога, синяя футболка с надписью Mish. Для Оли повторяем этот набор, иначе выйдет посторонняя олениха.

Собираем промпт и даём Максима как референс. Слов много, но это не «стильно и качественно», каждое описывает конкретную деталь сцены, материала или света, которую модель за нас не придумает:

Милый антропоморфный оленёнок в стиле премиальной 3D-анимации, с большими выразительными глазами, мягкой бархатистой шерстью, небольшими рогами, украшенными красными бантиками. На персонаже синяя футболка с минималистичным белым логотипом. Он радостно выскакивает из большой праздничной подарочной коробки красного цвета с золотыми новогодними узорами, держа в руке маленький подарочный кубик с красной лентой.

Уютный деревянный бар или таверна с теплым интерьером, полки с бутылками размыты на заднем плане, гирлянды из теплых лампочек создают красивое боке. Передний план — деревянный стол, усыпанный разноцветным конфетти, серпантином, рваной подарочной бумагой, праздничными украшениями и коктейльными бокалами.

В воздухе летает конфетти, сверху направлен мягкий театральный луч света, объемное освещение, кинематографичная атмосфера праздника. Камера расположена на уровне глаз, симметричная композиция, персонаж находится точно по центру кадра.

Стиль современной CGI-рекламы, уровень Pixar и Disney, чрезвычайно детализированная шерсть, реалистичные материалы, PBR-рендеринг, глобальное освещение, трассировка лучей, объемный свет, мягкие тени, малая глубина резкости, кинематографичный цветокор, фотореалистичная ткань, ультрадетализированный рендер, Unreal Engine 5, Octane Render, 8K, праздничное настроение, высокое качество, выразительная мимика, коммерческий уровень исполнения.

Сравниваем модели. Один и тот же промпт прогоняем через несколько моделей сразу и кладём результаты рядом.

В одной модели мы приняли бы её  за единственный вариант. Когда есть доступ сразу к нескольким моделям, видна разница. Grok Imagine Image и Nano Banana Pro остались в сцене брифа — подарочная коробка, гирлянда, синий верх. У Nano Banana Pro при этом чётко читается бренд-надпись Mish, у Grok она смазана и почти не читается. GPT Image 2 ушёл в сторону совсем: сменил сцену на концертную, цвет — на сиреневый, пропорции — на более вытянутые, от чиби почти ничего не осталось. Krea 2 держит палитру и рога, но кадрирует крупным планом вместо полного роста, поэтому пропорции тела с остальными не сравнить. Выбирать есть из чего только тогда, когда варианты лежат рядом.

Дорабатывать не пришлось. Nano Banana Pro сразу дала лучший результат.

Тут и заканчивается среднее

Ленивый запрос выдал пушистое существо с цветочным узором на морде и огромным красным ртом, в деревянной бочке вместо фирменной коробки — ни рогов, ни бренда, ни намёка на Максима. Рабочий заход дал персонажа, которого узнаёшь сразу: рога, бант, синяя футболка с Mish, та же праздничная сцена с гирляндами и конфетти.

Разница между двумя Олями — не талант и не везение. Вторая стала собой там, где мы сформулировали задачу до промпта, сравнили несколько моделей и выбрали из вариантов, а не остановились на первом.

Нейросеть в обоих случаях честно делала свою работу — выдавала самый вероятный ответ. Самобытной Оля получилась, потому что вокруг моделей был выстроен процесс.

Под такой процесс мы когда-то и собрали Строфи. Просто в какой-то момент устали перескакивать между сервисами, когда хотелось сделать одну простую вещь — положить варианты рядом и спокойно понять, какой действительно лучше.

Не соглашайтесь на первое «нормально». Именно там чаще всего и начинается усреднённость.

Мы сделали Строфи, чтобы хорошие идеи не терялись между вкладками и бесконечными пересадками из сервиса в сервис. Сравнивайте модели, ищите сильные решения и забирайте лучший результат, а не первый попавшийся. Присоединяйтесь к  Строфи.

Ещё статьи

  • Предыдущая статья

    7 принципов тестирования

    Привет, меня зовут Владимир Серов, я QA в Mish. Делюсь с вами принципами тестирования, которые мы используем в своей работе.

    project thumbnail
  • Следующая статья

    Скрытая сила бизнеса: кому и зачем нужен аккаунт-менеджмент

    Привет от продуктовой лаборатории Mish — и меня, Никиты, аккаунт-менеджера. Уже два года я работаю в команде, приношу пользу и занимаюсь любимым делом. Одновременно. В этой статье расскажу, как работает аккаунт-менеджмент на стороне лаборатории, как специалисту нарастить экспертизу и приносить пользу бизнесу.

    project thumbnail