Полный текст · рабочий preview

Референсы и контроль внешнего вида

Собрать визуальные опоры так, чтобы разные сегменты оставались частью одного ролика.

04. Референсы И Контроль Внешнего Вида

Статус: черновик урока v10 / абстрактные слова заземлены в видимые детали.

04.0. Карта Урока

В прошлой главе мы разложили ролик на управляемые сегменты.

Теперь вопрос: как сделать так, чтобы эти сегменты выглядели как один ролик, а не как пять разных попыток из разных миров?

Для этого нужны визуальные материалы: картинки, видео-примеры, контрольные кадры, примеры движения и рабочая карта файлов.

Слово "референс" часто используют слишком широко. Поэтому сразу разделим.

Референс для модели - это файл или кадр, который вы реально показываете генератору: например, робот, логотип, продукт, персонаж, локация.

Референс для автора - это пример, который вы смотрите сами: чужая картинка, видео, промпт, удачная генерация. Он помогает вам выписать конкретные вещи: освещение, ракурс, материал, движение, монтаж.

Видео-референс - это ролик, из которого вы разбираете не внешний вид одного объекта, а движение, ритм, камеру или структуру сцены.

Кадр из фильма / film still - это отдельный стоп-кадр, который помогает разобрать композицию: где стоит персонаж, какая крупность, какой свет, сколько воздуха вокруг объекта, как работает глубина, цвет и ракурс.

Пакет референсов - это набор материалов проекта: персонаж, объект, локация, освещение, цвета, элементы сцены, контрольные кадры и заметки.

План сбора референсов - это не сами красивые картинки, а маршрут их добычи: где искать, что скачать, что снять самому, какие кадры вытащить из видео, какие промпты или исходники подготовить.

Визуальная карта проекта - это собранное поле, где видно, что именно должно держаться одинаковым: герой, объект, стиль, свет, цвет, логотип, локация, старт и финал.

В production pipeline это называется Reference System: сначала вы решаете, какие референсы нужны и какую роль они выполняют, потом из них строите Shot Plan и Frame Pack. Нельзя сначала нагенерировать стартовые кадры, а потом задним числом придумывать, какая у них была карта референсов.

Правильный порядок:

Reference System -> Shot Plan / Storyboard Map -> Frame Pack -> Video Segment Pack

Reference System отвечает за постоянство мира: робот тот же, корабль тот же, вода без суши, свет холодный, волна нужного масштаба. Shot Plan потом говорит, в каких шотах это понадобится. Frame Pack делает статичные кадры. Video Segment Pack уже оживляет эти кадры.

Если сказать проще: один человек говорит "референс" и имеет в виду красивую картинку, второй - видео с движением камеры, третий - удачный промпт. Поэтому дальше мы называем материалы точнее, иначе все кивают, а потом модель спокойно готовит будущую проблему.

Отдельно: не пишите человеку просто refs. Это слишком мутно. В production-ответе нужно назвать точный тип:

Reference Acquisition Pack - какие материалы нужны и как их получить.
Visual Reference Map / Identity Board - настоящая визуальная карта/лист панелей.
Входной референс-материал (`input reference asset`) - конкретный файл, который прикрепляем к генератору.
Single input reference image - один исходный кадр/картинка.
Input reference role-line - строка вида @Image1 = [тип файла] - [что фиксирует].

@Image1 = [объект] недостаточно. Лучше: @Image1 = single input reference image: primary subject identity anchor - fixes silhouette, proportions, material and key details. Если это не одиночный кадр, а настоящая визуальная карта/board, так и пишем: @Image1 = Visual Reference Map / Identity Board: primary subject.

📌 Важно: один красивый кадр не становится Reference Map только потому, что он используется как референс. Reference Map - это отдельная карта/board с ролями и проверкой.

Сначала кажется: "я же словами написал, как должно выглядеть, зачем ещё картинки?"

Проблема в том, что слова вроде "дорого", "киношно", "мрачно", "премиально" у разных моделей и людей могут означать разные картинки. Поэтому рядом нужны видимые детали: тёмный фон, холодная боковая подсветка, чистая композиция, без лишних предметов, спокойная камера.

Контроль внешнего вида - это простое решение до генерации: что должно остаться одинаковым. Например: лицо, форма робота, логотип, водная планета без суши, холодное освещение, спокойная камера или точный финальный кадр.

🎬 Мини-пример. Если вы пишете "служебный робот", модель может сделать строгую промышленную машину или милую игрушку с лампочками. Референс резко сужает эту свободу.

🧭 Маршрут урока:

04.1 зачем нужны референсы
04.2 что можно удерживать
04.3 мудборды и банк насмотренности
04.4 канва-поле проекта
04.5 персонаж
04.6 объект, продукт, логотип
04.7 локация
04.8 визуальная склейка
04.9 уровни контроля видео
04.10 практика

Первая точка паузы: после 04.2 вы поймёте, какие материалы помогают удержать лицо, объект, освещение, локацию, движение или финальный кадр.

04.1. Зачем Нужны Референсы

Начнём с референса для модели.

Промпт может описать персонажа словами.

Например:

простой служебный робот, строгий промышленный дизайн, без игрушечности

Звучит понятно. Но модель всё равно может решить, что "утилитарный" - это милый пластиковый робот с лампочками и лицом.

Не потому что модель вредная. Просто слова оставляют слишком много пространства для фантазии.

📌 Простая мысль: референс для модели сужает случайность.

🎬 Пример.

Если в ролике важен один и тот же робот, лучше дать модели картинку этого робота. Тогда она меньше придумывает форму, материал, пропорции и детали.

Без модельного референса робот может каждый раз быть "примерно роботом". А "примерно" в производстве ролика быстро превращается в "почему он опять другой?"

04.2. Что Можно Удерживать Картинкой Или Контрольным Кадром

Не каждый визуальный материал называется референсом.

Есть три близких, но разных типа:

Инструменты разные, цель одна: меньше угадывания, больше контроля.

Проще так:

референс = "смотри, как это должно выглядеть"
контрольный кадр = "начни отсюда" или "приди вот сюда"
пример движения = "двигайся примерно вот так"

Это важно не из-за терминологии. Это важно потому, что разные материалы решают разные проблемы.

Если робот меняет форму, нужен референс робота. Если видео должно закончиться точным логотипом, нужен финальный контрольный кадр. Если капля должна падать мягко сверху, нужен пример движения или очень простое описание движения.

Смешать всё в слово "референсы" можно, но потом сам не поймёшь, что именно надо прикрепить, что просто держать рядом, а что превратить в промпт.

⚙️ Что можно удерживать через такие материалы:

🎬 Мини-пример. Если вы делаете product-shot с флаконом духов, форму флакона и читаемость этикетки нельзя отдавать модели на угадывание. Нужен чистый референс продукта или контрольный кадр.

📌 Вывод: отдельный визуальный материал нужен там, где "примерно похоже" не подходит.

04.3. Мудборды И Банк Насмотренности

Есть ещё один тип референсов: не для удержания конкретного лица или логотипа, а для поиска вкуса и идей.

Это мудборды.

📌 Мудборд - это подборка изображений, film stills, кадров, промптов или видео-примеров, по которым вы выписываете будущий вид ролика: освещение, цвет, ракурс, крупность, материалы, движение, запреты.

Он отвечает не только на вопрос "что сохранить?", но и на вопрос:

что зритель должен увидеть в кадре?

🎬 Пример.

Вы хотите сделать ролик с флаконом духов, который выглядит как дорогая реклама. Можно долго писать "дорого, кинематографично, премиально". А можно собрать мудборд и выписать, что именно видно в кадре:

После этого слово "премиально" перестаёт быть туманом. Оно превращается в видимые вещи: чёрная вода, чистый флакон, холодная подсветка, пустой фон, без лишнего текста.

Если совсем по-бытовому, мудборд - это не "я красиво насохранял картинок". Это как показать парикмахеру фото и сказать: "мне не эту голову, мне вот такой объём и форму". Мы не копируем чужой ролик. Мы вытаскиваем то, что заставляет его работать.

04.3.1. Как Снять Визуальные Правила С Референса

Сильный референс полезен не только как картинка. Из него можно вытащить рабочие слова для промпта.

Не надо смотреть на изображение и думать: "ну красиво". Это слишком скользко. Модель тоже умеет делать "красиво", только иногда это красота из соседнего жанра.

Лучше разобрать референс как маленькую анкету:

🎬 Пример.

Вы нашли кадр с флаконом духов в чёрной воде. Не копируем флакон. Выписываем, что там работает:

тёмная глянцевая поверхность;
холодная боковая подсветка;
чистый рекламный крупный план;
медленные круги по поверхности;
без лишних предметов в кадре.

Вот это уже можно перенести в свой ролик. Не чужую картинку, а конкретные приёмы: подсветку, поверхность, камеру, движение, запреты.

📌 Вывод: визуальные правила рождаются из референсов. Сначала смотрим глазами, потом переводим увиденное в короткие рабочие формулировки.

📌 Правило для visual character reference map: если карта персонажа генерируется как одно 16:9 изображение-лист, количество панелей - production parameter, а не вечное число. Сначала уточняем или предлагаем плотность: compact 4-6 panels, standard 8-10 panels, expanded 12-15 panels. В промпте обязательно называем выбранную плотность и зачем она выбрана.

Что собирать в банк насмотренности на старте:

🧭 Нормальный маршрут работы с мудбордом: смотрим примеры → собираем мудборд → вытаскиваем приёмы → переносим их в свою сцену.

⚠️ Важно. Мудборд не нужен, чтобы копировать чужую картинку. Он нужен, чтобы забрать конкретный приём: световой рисунок, ракурс, композицию, материал, ритм, способ раскрытия.

🎬 Видео-референс. Если вам понравился чужой ролик, его можно разобрать: что идёт первым, где пауза, где крупный план, где поворот, где финальный удар. Это уже референс не картинки, а сценария и монтажа.

Где можно искать на старте, как пример:

Выдох: если вы не умеете "придумывать с нуля", это не проблема. Многие сильные идеи начинаются не с пустоты, а с хорошего разбора чужих решений.

Пауза: мудборд нужен не для копирования. Он нужен, чтобы натренировать глаз и выписать рабочий приём: освещение, ракурс, материал, ритм, движение.

04.4. Канва-Поле Проекта

Мудборд можно хранить в папке. Но многие будут работать иначе: в одном большом визуальном поле.

📌 Канва-поле проекта - это рабочая доска, где рядом лежат:

🎬 Как это выглядит.

Слева вы кладёте 10 изображений для визуального направления. Рядом пишете промпт для стартового кадра. Ниже появляются четыре варианта изображения. Один вариант уходит вправо в видео. Под видео написана заметка: "камера слишком резкая, робот стал игрушечным". Следующий промпт уже исправляет эту ошибку.

Это удобно, потому что видна не только картинка, но и причинно-следственная цепочка.

🧭 Простая схема канва-поля: замысел → мудборд → референсы и промпты → входные опоры → видео-варианты → заметки о поломках → лучший результат.

Три примера, чтобы понять принцип:

⚠️ Важно. Канва не отменяет порядок. Если всё назвать "вариант 1", "вариант 2" и раскидать по полю без групп, это будет не производственная система, а красивая свалка.

Правило простое: у каждого блока на канве должно быть имя и роль.

референсы
промпты
генерации
ошибки
лучшие версии
финал

📌 Как думать про Weavy/Dreamina-подход.

Если сервис устроен как узловое поле, полезно смотреть не на красоту интерфейса, а на цепочку:

Если сервис устроен как узловое поле, смотрим на цепочку: вход, шаг, результат, ошибка и следующий шаг.

Если сервис устроен как единое творческое пространство, полезно держать рядом:

Если сервис устроен как единое творческое пространство, держим рядом персонажа, локацию, промпт, кадр и видео-версию.

Смысл тот же: модель меньше гадает, а вы быстрее видите, где процесс поехал не туда.

Пауза: папки и канва-поле решают одну задачу - не потерять причинную цепочку. Где был референс, какой был промпт, что получилось, что сломалось, что меняем дальше.

04.5. Персонаж

Если персонаж должен повторяться, ему нужен чистый набор изображений-примеров.

Это особенно важно, если в ролике есть:

🎬 Пример.

Герой выходит из корабля, потом смотрит на робота, потом оборачивается к волне. Если модель каждый раз рисует ему новое лицо, зритель не думает "какая интересная вариативность". Зритель думает: "кто это вообще?"

⚠️ Отдельное правило для живого photoreal-персонажа.

Если исходник выглядит как настоящий cinematic portrait, не начинаем с листа ракурсов на сером фоне. Слова вроде character sheet, turnaround, studio background, game character realism, 3D render, CGI и bodysuit часто превращают живое лицо в пластиковую 3D-куклу.

Правильный порядок:

  1. Сначала получить один полный рост в том же live-action стиле.
  2. Проверить лицо, кожу, волосы, свет, одежду и материалы.
  3. Принять этот кадр как главный anchor, а не как всю карту.
  4. Собрать карту персонажа: что сохраняем в лице, волосах, имплантах, теле, костюме, материалах, ракурсах и запретах.
  5. Только потом делать боковой вид, спину или 3/4, если они реально нужны.

📌 Важно: один красивый полный рост - ещё не референс-мап. Референс-мап отвечает, что именно модель обязана держать одинаковым и какие дополнительные кадры нужны для контроля.

Хороший набор для персонажа:

фронтальный вид;
ракурс 3/4;
боковой вид;
вид со спины или второй 3/4;
нейтральный фон;
читаемое лицо;
стабильная одежда.

Это не магическое правило. Это способ показать модели одно и то же лицо, одежду и силуэт с разных сторон.

⚠️ Важная оговорка для Seedance-подобных моделей.

Подготовить несколько ракурсов - нормально. Это ваша рабочая база.

Но в первую конкретную видео-генерацию не всегда нужно загружать всё сразу. Избыток похожих фото лица может дать морфинг: модель начинает смешивать лица вместо того, чтобы удержать одно.

Проще говоря: дома можно иметь целый альбом персонажа, но на съёмку сначала привести одного нормального актёра, а не всю родню.

Практический порядок:

  1. Готовим несколько чистых ракурсов персонажа.
  2. Выбираем один самый сильный кадр: лицо читается, одежда видна, лишнего фона нет.
  3. Первый Seedance-тест делаем с этим одним кадром.
  4. Если модель теряет силуэт, одежду или ракурс, добавляем второй референс уже как отдельный тест.

🎬 Практические обходы. Если модель плохо принимает лицо как входной материал или начинает смешивать несколько фото в нового человека, можно тестировать несколько рабочих приёмов.

Что можно тестировать:

Это не гарантия. Это набор отвёрток: иногда нужна одна, иногда другая, иногда хочется закрыть ноутбук и сделать чай. Но лучше иметь набор, чем каждый раз биться в одну и ту же ошибку. 📌 Вывод: набор референсов нужен для подготовки. Но вход в модель подбирается аккуратно, а не по принципу "чем больше, тем умнее".

⚠️ Если персонаж не важен: не надо тратить полдня на идеальный набор. Референсы готовятся под задачу, а не потому что так красиво выглядит в папке.

04.6. Объект, Продукт, Логотип

Если в ролике важен продукт, логотип, упаковка, гаджет, робот или предмет, ему нужен отдельный референс.

🎬 Пример.

Вы делаете ролик: флакон духов стоит на чёрной воде, рядом падает капля, по поверхности расходятся круги.

Если логотип важен, нельзя просто написать:

в конце красиво раскрывается продукт

Модель может сделать красивый, но неправильный. А неправильный логотип - это не "авторская версия". Это проблема.

Объект должен быть виден чисто:

📌 Вывод: всё, что должно быть точным, нужно показывать модели отдельным чистым примером.

04.7. Локация

Локация - это не просто красивый фон.

Она должна помогать действию.

🎬 Плохой пример.

Вы нашли красивую тёмную комнату с кучей деталей, проводов, экранов и дымом. Кадр выглядит богато. Но герой теряется, логотип не читается, камера не понимает, куда смотреть.

Красивая локация не стала рабочей.

Хорошая локация:

🎬 Пример для водной планеты.

Локация должна показывать масштаб водной равнины, заданную атмосферу и угрозу горизонта. Если модель добавила жанрово чужие детали, сцена уже ушла не туда.

Пауза: персонаж, объект и локация - это не три скучных пункта. Это три вещи, которые чаще всего начинают жить своей жизнью, если их не закрепить.

04.8. Визуальная Склейка

Визуальная склейка - это когда соседние куски ролика выглядят так, будто сняты в одном мире.

Она отвечает:

где мы находимся;
какая схема света повторяется;
какие цвета повторяются;
картинка реалистичная или мультяшная;
камера спокойная или резкая;
какие материалы видны;
что нельзя добавлять.

Без визуальной склейки разные кадры могут выглядеть как разные проекты.

🎬 Пример правил:

Тёмный реалистичный мир.
Холодная подсветка.
Сдержанная палитра.
Спокойная камера, без резких клиповых прыжков.
Без мультяшности.
Без случайных зданий.
Без кислотных цветов.

Это не украшение. Это способ держать ролик в одном мире.

Если один сегмент тёмный и чистый, второй яркий как реклама санатория, а третий мультяшный, зритель не обязан понимать, что это был творческий поиск. Он просто уйдёт.

04.9. Уровни контроля видео

Не каждый ролик начинается со стартового кадра. И не каждый ролик требует финального кадра.

Есть несколько уровней контроля.

Только текстовый видеопромпт - самый быстрый путь. Вы описываете сцену словами, а модель сама придумывает картинку. Это подходит для быстрых тестов, вирусных экспериментов и случаев, где рандом допустим.

Минус: контроля мало. Лицо, одежда, локация, стиль, предметы и финал могут уехать.

Стартовое изображение - когда вы уже задали первый кадр и хотите его оживить. Это сильнее контролирует композицию, свет, персонажа и объект.

Стартовое изображение + элементы - когда к старту добавляются отдельные опоры: персонаж, одежда, автомобиль, продукт, логотип, локация, предметы. Модель собирает движение, но не должна изобретать всё сама.

Элементы без стартового кадра - когда вы даёте набор материалов и просите собрать сцену. Например: персонаж, машина, городская улица, стиль света, пример камеры. Это гибче, но требует точнее описывать роли каждого элемента.

Стартовый и финальный кадр - когда важно, откуда движение начинается и куда должно прийти. Это полезно для точного reveal, логотипа, продукта, превращения, рекламного финала.

Несколько ключевых кадров - когда сцена должна пройти через несколько состояний, а не просто старт и финал.

📌 Правило: чем меньше входных опор, тем больше свободы у модели. Чем больше нужна повторяемость и профессиональный контроль, тем точнее должны быть изображения, элементы и роли.

🎬 Пример 0. Text-only тест.

Можно написать только видеопромпт: "ночная улица, герой идёт под дождём, камера следует за ним". Это быстро. Но модель сама выберет лицо, одежду, улицу, свет и детали. Для быстрого теста нормально. Для точного ролика с конкретным персонажем - слабый контроль.

🎬 Пример 1. Продолжение сцены.

Одно видео закончилось хорошим кадром: персонаж стоит у двери, камера замерла, световой рисунок удачный. Вы делаете стоп-кадр и используете его как стартовый кадр для следующего видео. Так сцена продолжается, а не начинается заново с другой картинки.

🎬 Пример 2. Элементы.

Если в сцене есть персонаж, машина и конкретная куртка, можно дать их как отдельные элементы и прописать роли: персонаж сохраняет лицо, машина стоит справа, куртка остаётся той же, городская улица задаёт фон.

🎬 Пример 3. Логотип.

Если в конце должен быть точный AIS FLOWS, финальный кадр лучше подготовить заранее. Иначе модель может сделать похожую надпись, а похожая надпись бренду не помогает.

🎬 Пример 4. Точный финал.

Если финал сегмента должен показывать машину в точной позиции у края кадра, можно заранее подготовить финальный кадр. Тогда видео-модель не будет гадать, где должен оказаться объект и насколько крупным он должен быть.

📌 Вывод: стартовый и финальный кадр - не базовая обязанность. Это инструмент для точного контроля. Иногда достаточно текста. Иногда нужен один стартовый кадр. Иногда нужны элементы. Иногда старт+финал. Сначала выбираем уровень контроля, потом пишем промпт.

04.10. Проверка Перед Промптами

После уровней контроля не нужен ещё один новый план. Нужна короткая сверка: вы понимаете, какие визуальные опоры понадобятся именно этому ролику.

Проверьте по вопросам:

Персонаж:
Нужен ли референс персонажа:

Объект / продукт / логотип:
Нужен ли отдельный референс:

Локация:
Что должно быть видно в месте действия:

Вид кадра:
Какое освещение, цвета, уровень реализма:

Мудборд:
Какие 6-12 изображений или 2-3 видео показывают нужную световую схему, цвет, ракурс или движение:

Канва-поле:
Где лежат референсы, промпты, кадры, видео-версии и заметки:

Уровень контроля:
Текст / стартовый кадр / элементы / старт+элементы / старт+финал / несколько ключевых кадров:

Отдельные элементы сцены:
Персонаж / одежда / машина / продукт / логотип / локация / предметы:

Что должно остаться одинаковым:

Что может меняться:

04.12. Кто За Что Отвечает В Наборе Референсов

Когда вы загружаете несколько изображений, каждому нужна одна понятная работа.

🎬 Мини-пример. Портрет отвечает за лицо героя. Фото куртки — за одежду. Кадр улицы — за окружение. Отдельный пример закатного света — только за свет. Если два изображения по-разному показывают лицо, заранее выберите главное.

Рабочая запись:

Референс:
За что отвечает:
Что обязан сохранить:
Что разрешено менять:
Какой референс главнее при конфликте:

Если нужно исправить один дефект, меняйте одну вещь за попытку.

Цель правки:
Одно изменение:
Что нельзя затронуть:
Что можно изменить:
Как проверить результат:

Так вы видите, из-за чего результат стал лучше или хуже. Если одновременно менять лицо, одежду, фон и свет, причину уже не определить.