Нейросети не читают мыслей — они считывают слова. Чтобы сгенерировать изображение с конкретной позой, недостаточно написать «красивая сцена». Нужно уметь описывать положение тела, ракурс и композицию языком, понятным модели. Этот материал разбирает анатомию точного промта на простых примерах.
Материал носит образовательный характер: речь идёт о технике составления запросов для взрослых пользователей, без графических описаний. Перед генерацией изучайте правила конкретного сервиса — многие платформы ограничивают откровенный контент.
Почему простой промт не работает
Большинство генеративных моделей обучено на миллионах изображений с подписями. Модель отлично понимает термины из искусства, фотографии, аниме и иллюстрации, но плохо справляется с размытыми описаниями вроде «интересная поза». Когда запрос слишком общий, нейросеть достраивает сцену по наиболее вероятному паттерну — и результат почти никогда не совпадает с задумкой.
Точность позиционирования тел достигается не длиной промта, а его структурой. Короткий, но правильно собранный запрос даёт стабильный результат чаще, чем «простыня» текста в триста слов.
Формула точного промта
Рабочий промт для конкретной позы строится из пяти блоков, каждый из которых отвечает за свой слой изображения:
1. Субъекты
Кто на изображении: количество персонажей, типажи, одежда или её отсутствие (в рамках правил сервиса).
2. Поза
Точное положение тел: кто где находится, взаимное расположение, положение рук и головы.
3. Ракурс
Точка съёмки: профиль, вид сверху, крупный план, общий план.
4. Окружение
Локация, освещение, время суток, стилистика сцены.
5. Стиль
Художественная манера: фотореализм, аниме, живопись, глянец.
Как описывать позу: три работающих приёма
Приём 1. Описание через отношение частей тела
Самый надёжный способ — описывать позу через взаимное положение рук, ног и корпуса, а не через названия. Модель знает тысячи учебных описаний из фотографии и рисунка: «персонаж лежит на спине, вторая фигура расположена сверху, руки упираются по обе стороны от головы». Такое описание даёт модели точные координаты.
Приём 2. Заимствование терминов из смежных областей
Нейросети превосходно знают лексику йоги, танца, гимнастики, танго и балета. Позы из этих дисциплин имеют устоявшиеся названия и множество размеченных изображений. Указание «поза лотоса», «бананасплит», «поза птицы из акройоги» воспринимается моделью как готовая заготовка композиции тел.
Приём 3. Декомпозиция сцены
Вместо одного сложного описания сцену разбивают на простые утверждения через точку или запятую. Каждое утверждение отвечает за один элемент расположения. Модель обрабатывает такие списки значительно точнее, чем сплошной текст.
Сравнение: слабый и сильный промт
| Критерий | Слабый промт | Сильный промт |
|---|---|---|
| Описание позы | «красивая романтическая поза» | «один персонаж лежит на спине на кровати, второй лежит сверху, опираясь на локти, лица на уровне друг друга» |
| Ракурс | не указан | «вид сбоку, камера на уровне кровати, общий план» |
| Окружение | «в комнате» | «спальня, тёплый приглушённый свет ночника, белое постельное бельё» |
| Результат | Случайная композиция, позы меняются от генерации к генерации | Стабильная композиция, соответствующая задумке |
Частые ошибки и способы их исправить
Ошибка 1
Литературный язык. Метафоры и завуалированные обороты модель не понимает. Решение — заменить образные описания конкретными указаниями положения тела.
Ошибка 2
Смешение ролей. Когда на изображении два персонажа, модель часто путает, кто где находится. Решение — описывать положение каждого персонажа отдельным предложением и последовательно: сначала один, потом другой.
Ошибка 3
Отсутствие ракурса. Без указания точки съёмки модель сама выбирает угол. Решение — всегда добавлять блок про камеру: сбоку, сверху, со спины, крупный план.
Ошибка 4
Слишком длинный текст. После определённого порога токенов модель теряет внимание к деталям. Решение — оставить только пять ключевых блоков и убрать воду.
Дополнительные инструменты контроля позы
Текстовый промт — не единственный способ задать положение тела. Современные инструменты предлагают более точные методы:
- Скелетные референсы. Схема позы в виде «человечка из точек» загружается вместе с промтом и жёстко фиксирует расположение конечностей — текст только описывает внешность и стиль.
- Референсные изображения. Подача картинки-образца позволяет перенести композицию на новых персонажей.
- Итеративная дорисовка. Начинают с генерации позы, затем отдельными проходами дорабатывают лица, руки и детали в нужных областях изображения.
Шаблон для самостоятельного написания
[Персонаж 1: типаж и внешность], [его положение тела]. [Персонаж 2: типаж и внешность], [его положение тела относительно первого]. [Ракурс камеры: вид сбоку / сверху, общий план]. [Локация и освещение]. [Стиль: фотореализм / живопись / аниме].
Такой шаблон подставляется под любую задумку: остаётся заполнить пять заготовленных блоков — и промт готов к генерации.
Чек-лист перед генерацией
Итог
Точный промт для позы — это структура, а не объём. Пять блоков, конкретный язык описания тела, отдельные предложения для каждого персонажа и явный ракурс превращают случайную генерацию в управляемый результат. А сложные композиции подчиняются скелетным референсам и итеративной дорисовке лучше, чем любой текст.