Полный текст · рабочий preview

Промпты изображения и видео

Разделить описание статичного кадра и изменение во времени, а затем выдать модели чистую инструкцию для каждого артефакта.

05. Промпт Для Изображения И Промпт Для Видео

Статус: черновик урока v3 / добавлен вход через ловушку одного большого промпта.

05.0. Карта Урока

Сначала кажется: можно написать один большой промпт, и модель сама поймёт, где картинка, где движение, где монтаж, а где финальный титр.

Иногда повезёт. Но курс не строится на "вдруг повезёт".

В этой главе разделяем две разные инструкции:

🎬 Мини-пример. Флакон духов на чёрной воде - это задача изображения. Капля падает, круги расходятся, камера чуть приближается - это уже задача видео.

05.1 главное различие
05.2 промпт для изображения
05.3 промпт для видео
05.4 Seedance: короткая карточка правил
05.4A режим сначала, текст потом
05.5 плохой пример
05.6 нормальный пример
05.7 мини-практика

Пауза: если запомнить только одно: изображение описывает кадр, видео описывает изменение.

05.1. Главное Различие

Промпт для изображения отвечает на вопрос:

что должно быть видно в одном кадре?

Промпт для видео отвечает на другой вопрос:

что должно измениться во времени?

Если смешать их в одну кашу, модель получает странную просьбу: одновременно нарисовать красивую фотографию, снять кино, поставить камеру, смонтировать сцену и не забыть про логотип. Иногда она справляется. Чаще она делает вид, что поняла.

05.2. Промпт Для Изображения

Промпт для изображения описывает замороженный кадр.

Представьте, что вы ставите сцену для фотографии. Ничего ещё не движется. Камера не летит. Машина ещё не въезжает в кадр. Мы просто собираем один кадр так, чтобы его можно было показать модели или потом оживить.

Сразу раскладываем кадр на понятные поля:

Короткая форма:

Главный объект:
Состояние / поза:
Локация:
Композиция:
Крупность / ракурс:
Освещение:
Материалы и детали:
Вид кадра:
Что сохранить:
Что не добавлять:

Да, модель иногда очень щедрая. Попросили флакон - принесла ещё второй флакон, золотой текст, лепестки, туман и ещё какой-то праздничный блеск. Поэтому запреты нужны не для строгости, а для тишины в кадре.

Что не писать в промпт для изображения:

🎬 Пример. Для стартового кадра короткой кино-сцены мы описываем человека в дверном проёме ночной кухни, мокрое окно, холодный боковой свет, пустое пространство справа и тёмный фон. Не пишем: "камера медленно заходит внутрь, герой оборачивается и начинается погоня". Это уже видео-задача.

Если трудно описать кадр словами, можно взять film still как опору. Например, не копировать чужой фильм, а выписать:

крупность: средний план;
ракурс: низкий угол;
свет: холодный боковой источник;
композиция: герой слева, пустое пространство справа;
фон: тёмный, без лишних деталей.

Такие кадры удобно искать в подборках скриншотов фильмов, например Movie-Screencaps (https://movie-screencaps.com/) или через фильмовые базы вроде Kinorium (https://ru.kinorium.com/). Это уместно именно для киношных сцен, трейлерных кадров, драматичных проходов, хоррора, action, бытовой сцены с настроением или любого ролика, где важны крупность, свет, ракурс и расстановка объектов. Смысл не в том, чтобы копировать кадр. Смысл в том, чтобы быстрее понять, как построить свой кадр.

05.3. Промпт Для Видео

Промпт для видео описывает изменение во времени.

Здесь мы уже не фотограф. Здесь мы режиссёр короткого движения.

Видео можно делать с разным уровнем входных опор:

Только текстовый видеопромпт может дать быстрый результат, но он слабее контролируется. Модель сама выбирает лицо, одежду, локацию, свет и детали. Это может быть нормально для быстрых вирусных тестов. Для профессионального ролика от и до обычно нужны изображения, элементы, референсы или контрольные кадры.

Вопрос меняется:

не "что видно?"
а "что должно измениться, пока зритель смотрит?"

Сразу раскладываем видео на рабочие поля:

Короткая форма:

Управляемый отрезок:
Что есть на входе:
Главное действие:
Камера:
Что сохраняется:
Финальное состояние:
Риски:
Что не ломать:

Длительность выбирается по содержанию

Короткий ролик не означает, что каждый фрагмент нужно сжать до 2–3 секунд. Сначала проверьте, сколько времени нужно для полного действия, реплики с паузами, реакции, движения камеры или физического процесса от начала до результата. Кадр на 5–6 секунд и дольше допустим, если он удерживает внимание речью, реакцией, движением или изменением материала.

Не смешивайте четыре величины: исходный тайминг сценария, время речи и пауз, длительность клипа в интерфейсе и цель монтажа. Если времени не хватает, выберите более длинную доступную длительность или разделите действие по смысловой границе. Не ускоряйте речь и не добавляйте случайную склейку только ради трейлерного темпа.

📌 Важно. Если камера не важна или не была заранее утверждена, не надо придумывать сложную камеру просто для красоты. Иногда "камера стабильная" лучше, чем "драматичный кинематографичный орбитальный полёт", после которого флакон стал похож на расплавленную лампочку.

Как правильно думать: сначала одно главное движение. Потом камера. Не наоборот.

Плохой порядок:

красивая камера, драматичный облет, кинематографичный полёт, а ещё пусть капля падает и логотип появляется

Нормальный порядок:

главное действие: одна капля падает в воду;
камера: стабильная, лёгкое приближение;
что сохраняется: флакон, тёмная вода, чистая подсветка, пустой фон.

Так модель понимает, что в сцене главное, а что просто помогает.

05.4. Seedance: Короткая Карточка Правил

Это не вечный закон для всех моделей, а рабочая карточка для Seedance-подобного маршрута. Такие правила всегда нужно проверять на своих тестах.

Сначала кажется: чем длиннее промпт, тем умнее модель поймёт. На практике длинная простыня часто превращает видео в чемодан без ручки: всё вроде внутри, но нести невозможно.

Стартовая норма для Seedance:

60-120 слов;
одно главное действие;
одно движение камеры;
явно описанное освещение;
один сильный референс персонажа на первом тесте;
короткие реплики, примерно до 10 слов;
сложное движение = понятные опорные состояния: стартовая поза, финальная поза, элементы или ключевые кадры.

🎬 Пример. Если персонаж делает сальто, не надо просить: "бежит, прыгает, делает сальто, камера облетает, толпа реагирует, свет меняется". Для модели это уже не сцена, а спортивный инвентарь в стиральной машине.

Лучше:

персонаж начинает в устойчивой позе;
одно читаемое сальто вперёд;
камера: стабильный боковой ракурс;
финал: персонаж приземляется лицом к камере;
освещение: мягкий дневной свет, без резких вспышек.

Форматы съёмки одной фразой можно использовать как короткие подсказки:

UGC, bodycam, FPV, ASMR, product commercial, luxury ad,
security camera, documentary handheld, trailer shot, macro product shot.

Не надо вставлять их пачкой. Один формат - одна понятная оптика сцены. bodycam и luxury ad в одном коротком шоте могут начать спорить, как два режиссёра у одного штатива.

📌 Вывод: Seedance-подобному промпту часто нужна не большая поэма, а короткая режиссёрская команда: кто, что делает, где, какой свет, какая камера, что нельзя ломать.

05.4A. Режим Сначала, Текст Потом

В Seedance-подобных правилах полезнее всего не "магические слова", а порядок мышления.

Сначала выбираем режим задачи:

Видео из текста - сделать ролик только по описанию;
Видео из изображения - оживить уже готовое изображение;
Сцена из нескольких референсов - собрать сцену из нескольких материалов с ролями;
Первый и последний кадр - провести переход между первым и финальным кадром;
Несколько ключевых кадров - связать несколько ключевых кадров;
Правка существующего видео - изменить уже готовое видео;
Длинный проход + много материалов - проверить длинный фрагмент с большим пакетом материалов, если модель это реально поддерживает.

Если интерфейс сервиса показывает английские подписи, перевод такой: T2V - видео из текста, I2V - видео из изображения, Omni Reference или Multi-reference - несколько референсов с ролями, First and Last Frame - первый и последний кадр, Multiframes - несколько ключевых кадров, V2V - правка существующего видео.

Почему это важно: один и тот же красивый промпт будет вести себя по-разному в разных режимах.

Для режима видео из текста нужно описать саму сцену:

кто в кадре -> что делает -> где происходит -> какой свет -> как движется камера -> что нельзя ломать

Это самый свободный режим. Он может быть полезен для быстрых тестов, но если нужно сохранить конкретного персонажа, автомобиль, одежду, продукт или стиль, одного текста обычно мало.

Для режима видео из изображения нельзя заново пересказывать всю картинку. Картинка уже дана. Нужно описать только движение:

что оживает;
как движется объект;
как движется камера;
какой свет сохранить;
что нельзя менять в исходном кадре.

Для режима несколько референсов с ролями важно не просто загрузить 10 файлов, а дать каждому роль:

персонаж;
одежда;
машина;
локация;
стиль света;
пример камеры;
логотип;
предмет в руке.

Иначе модель может смешать элементы вместо того, чтобы собрать сцену.

Для режима "длинный проход + много материалов" важно не просто загрузить много файлов. Это проверочный маршрут для моделей уровня Seedance 2.5: один длинный фрагмент, много входных материалов и обязательная проверка, удержала ли модель сцену лучше, чем сегментная сборка. Пока это не базовое правило курса, а наблюдение для тестов.

Для режима правка существующего видео важно прямо сказать:

что добавить / удалить / заменить;
что оставить неизменным: руки, тайминг, свет, камеру, лицо, форму продукта.

Рабочий порядок промпта для Seedance-подобного маршрута:

главный объект / герой;
действие;
сцена и свет;
камера;
вид кадра;
ограничения и запреты.

Но порядок не нужен ради красоты. Он нужен потому, что модель чаще держит первые важные инструкции лучше, чем хвост промпта. Если лицо, объект или финал критичны, не прячьте их в конце.

📌 Вывод: сначала режим и то, что нельзя сломать. Потом действие, свет, камера и вид кадра. На следующей странице разберём это на одном плохом промпте, чтобы не повторять одно и то же два раза.

05.5. Плохой Пример

Сделай премиальное видео с флаконом духов, 6 секунд, камера красиво движется,
вода, логотип, дорого, кинематографично, свет, капля, всё красиво, без ошибок.

Что тут сломается:

Это не промпт. Это эмоциональная записка модели: "пожалуйста, будь умной".

05.6. Нормальный Пример

Сначала промпт для стартового изображения:

Главный объект: люксовый стеклянный флакон духов на чёрной глянцевой поверхности.
Состояние: флакон стоит вертикально, чистый силуэт, без лишних предметов.
Композиция: вид сверху под небольшим углом, флакон в центре нижней трети кадра.
Освещение: холодная мягкая подсветка, тонкие отражения по граням стекла.
Материалы: прозрачное стекло, тёмная вода, чистое отражение.
Что сохранить: форма флакона, чистое место для будущего титра или этикетки.
Что не добавлять: случайный текст, лишние бутылки, яркие цвета.

Потом промпт для видео:

Управляемый отрезок: капля падает в воду рядом с флаконом.
Начало: флакон стоит на чёрной глянцевой поверхности, вода спокойная.
Главное действие: одна капля падает сверху, по воде расходятся мягкие круги.
Камера: стабильная, лёгкое приближение.
Что сохраняется: форма флакона, тёмная вода, холодная мягкая подсветка, чистый фон без лишних предметов.
Финальное состояние: круги на воде становятся читаемым пространством для логотипа.
Риски: не ломать флакон, не добавлять лишний текст, не делать кислотную подсветку.

Видите разницу? Сначала мы строим кадр. Потом заставляем его двигаться.

В большом production-процессе это называется Frame Pack.

Frame Pack - это не storyboard и не карта референсов. Он появляется после них:

Reference System -> Shot Plan / Storyboard Map -> Frame Pack -> Video Segment Pack

Reference System говорит, что должно сохраняться. Shot Plan / Storyboard Map говорит, какие шоты нужны. Frame Pack делает статичные start/key/final frames под эти шоты. Video Segment Pack уже пишет video prompts и двигает принятые кадры.

Если перепрыгнуть сразу к video prompt, модель начинает сама решать, какой кадр был стартовым, каким должен быть финал и какие референсы важнее. Это слишком много власти для одного промпта.

05.7. Остановка: Промпт Кадра И Промпт Движения

Это не ещё одно задание. Это короткая финальная таблица, чтобы не смешать два разных текста в один ком.

| Если вы пишете... | Что там должно быть | Чего там не должно быть | |---|---|---| | Промпт изображения | кто или что в кадре, композиция, свет, материал, фон, что сохранить | длительность, монтаж, движение камеры, "пусть красиво развивается" | | Промпт видео | что меняется во времени, одно главное действие, движение камеры, что остаётся неизменным, финальное состояние | пересказ всей картинки заново, пять действий сразу, новая сцена без причины | | Проверка перед запуском | понятно, что модель должна удержать и что ей запрещено ломать | общие слова вроде "дорого", "кинематографично", "без ошибок" без конкретики |

📌 Итог страницы: промпт изображения строит неподвижный кадр. Промпт видео двигает уже понятный кадр. Если один текст пытается сделать оба шага сразу, модель начинает угадывать.

05.8. Где Смотреть Больше Примеров

Эта глава показывает базовую разницу: кадр отдельно, движение отдельно.

Больше живых примеров лежит в отдельной библиотеке:

13_PROMPT_REFERENCE_LIBRARY.md

Там есть:

📌 Вывод: один пример с флаконом нужен для понимания. Но курс не должен опираться только на него.

05.10. Промпт Не Заменяет Производственный План

План отвечает на вопрос «что мы строим и из каких опор». Промпт отвечает на вопрос «что конкретно должна сделать выбранная модель сейчас».

Перед видеопромптом зафиксируйте:

Начальное состояние:
Главное видимое изменение:
Конечное состояние:
Камера:
Какие персонажи, объекты и материалы должны сохраниться:
Какой звук или реплика относится к этому отрезку:
Что особенно легко сломать:

🎬 Мини-пример. Машина стоит целой, затем её панели складываются, в конце на дороге уже другой объект. Это одно главное изменение. Если одновременно попросить сменить погоду, город, цвет, камеру и персонажа, модель начнёт выбирать, что забыть.

Запреты в конце промпта должны защищать конкретный риск: не менять лицо, не добавлять логотип, не ломать геометрию. Длинный список всего плохого на свете только размывает задачу.

Стартовый или финальный кадр считается рабочим не потому, что он красивый. В нём должны читаться нужный объект, состояние, ракурс, свет и детали, которые понадобятся следующему шагу.