# 06. Работа С Разными Типами Моделей

Статус: черновик урока v5 / усилен живой вход и логика выбора маршрута.

## 06.0. Карта Урока

Сначала кажется: "надо просто выбрать самую сильную нейросеть".

Это ловушка. Сильная модель не обязана быть правильной моделью для вашей задачи.

Это как выбирать транспорт. Самолёт быстрее велосипеда, но если вам нужно переехать на соседнюю улицу, самолёт выглядит немного нервно.

Одна модель лучше делает стартовый кадр. Другая лучше оживляет готовое изображение. Третья удобна для быстрых клипов. Четвёртая полезна, когда уже есть видео и его нужно переделать.

📌 **Простая мысль:** мы выбираем не "лучшую модель вообще", а **подходящий маршрут под конкретную задачу**.

🧭 **Маршрут урока:**

```text
06.1 зачем думать типами задач
06.2 четыре класса модельных задач
06.3 канва-маршрут для моделей
06.4 подготовка персонажа, если персонаж нужен
06.5 адаптация промпта под модель
06.5A карточка режима Seedance-подобной модели
06.6 как использовать manual/PDF как правила модели
06.7 как использовать чужой сильный промпт
06.8 когда улучшать качество
```

⏸ **Первая точка паузы:** после `06.2` вы уже поймёте главное: сервисы меняются, а логика выбора задачи остаётся.

## 06.1. Что Это За Подход

В курсе мы не учимся работать только с одной конкретной моделью.

Мы учимся собирать рабочий маршрут под разные типы моделей:

- модели для изображений (например, ChatGPT Images, Nano Banana Pro, Midjourney, Luma);
- модели для видео (например, Seedance, Kling, Luma, Runway, Veo);
- модели для голоса (например, ElevenLabs);
- агенты и чаты для подготовки промптов и структуры (например, Codex, ChatGPT, Claude, Gemini).

Конкретные названия могут быстро меняться.

Логика работы остаётся важнее названия сервиса.

⏸ **Пауза:** если вы не знаете половину названий выше - это нормально. В этой главе важнее понять роли: кто делает кадр, кто оживляет кадр, кто помогает думать, кто полирует результат.

## 06.2. Четыре Разных Типа Задач

Самая частая ошибка на старте - сравнивать все модели как будто они делают одно и то же.

Они не делают одно и то же.

**Класс задачи** - это простое название того, что вы просите сделать.

Если проще: сначала не выбираем сервис. Сначала называем работу.

Это как в обычной жизни: вы не спрашиваете "какой самый лучший инструмент?". Вы сначала понимаете, что делаете: режете хлеб, сверлите стену или чините звук. Нож, дрель и наушники могут быть прекрасными, но друг друга они не заменяют.

Например:

- не "сделай красиво", а "создай стартовое изображение";
- не "сделай ролик", а "оживи готовый кадр";
- не "улучши сцену", а "переработай уже существующее видео".

Так проще выбирать инструмент. Вы не спорите с моделью, а сначала понимаете, какую работу ей даёте.

- из изображения можно получить картинку или референс;
- из изображения или текста можно получить видео;
- из изображения можно быстро сделать короткий клип со звуком;
- из готового видео можно получить переработанную сцену.

Расшифровка без умных вывесок:

- **изображение** - нужно получить один сильный кадр или референс;
- **изображение в видео** - есть кадр, и его нужно оживить;
- **быстрый клип** - нужен короткий эффектный тест, крючок или движущийся постер;
- **готовое видео в новую версию** - у вас уже есть видео, и вы хотите его изменить.

Не надо на этом этапе выбирать "самую модную нейросеть". Список модных сервисов меняется быстрее, чем их интерфейсы после обновления. Задача меняется медленнее.

🎬 **Пример.** Если вам нужен рекламный ролик с флаконом духов, где камера плавно движется вокруг продукта, это один маршрут. Если у вас уже есть удачный ролик, но нужно заменить фон или свет, это другой маршрут. Если вам нужен быстрый смешной крючок для внимания из одной картинки, это третий маршрут.

Поэтому Grok-подобные инструменты удобно держать как класс быстрых клипов. Gemini/Omni-подобные инструменты - как класс переработки уже существующей сцены. А Seedance/Dreamina-подобный маршрут - как генерацию нового короткого видео из текста, изображения и референсов.

Сервисы меняются. Разделение задач остаётся.

Для Seedance-подобной модели это разделение особенно важно:

| Режим | Когда выбирать | Что писать в промпте | Главный риск |
|---|---|---|---|
| Видео из текста | нужен быстрый тест из текста или рандом допустим | субъект, действие, локация, свет, камера, ограничения | слабый контроль лица, одежды, локации и деталей |
| Видео из изображения | есть стартовый кадр | движение, камера, свет, что сохранить | модель пересобирает исходную картинку вместо оживления |
| Несколько референсов с ролями | нужны элементы сцены: персонаж, одежда, машина, продукт, локация, стиль | какой референс за что отвечает | референсы конфликтуют между собой или смешиваются |
| Первый и последний кадр | финал должен быть точным | переход между первым и последним кадром | красивое движение ломает точный финал |
| Несколько ключевых кадров | есть несколько ключевых состояний | отдельная точка действия на каждый кадр + общая строка | слишком много кадров в одном коротком промпте |
| Правка существующего видео | уже есть видео, нужно изменить его | что добавить/удалить/заменить и что не менять | правка меняет руки, тайминг, свет или камеру |
| `Длинный проход + много материалов` | модель реально поддерживает длинный фрагмент и много материалов | роли всех материалов, сценарий, ритм, что сохранить, что запретить | много референсов конфликтуют, а 30 секунд превращаются в красивый дрейф |

Это не значит, что каждый проект обязан пройти все режимы. Наоборот: правильный выбор режима экономит генерации.

Если нужно просто проверить идею, можно начать с режима **видео из текста**. Если нужен управляемый ролик с конкретным человеком, продуктом, машиной, одеждой или брендом, лучше переходить к изображениям, элементам и ролям референсов. Режим **первый и последний кадр** нужен только там, где важно точно начать или точно закончить.

Если появляется маршрут уровня Seedance 2.5 с длинным проходом и большим количеством материалов, не переносим его в привычку автоматически. Сначала сравниваем: тот же ролик сегментами и тот же ролик одним длинным проходом. Побеждает не новый режим, а тот, который лучше держит лицо, объект, стиль, ритм и смысл.

Модельный маршрут выбирается не вместо production order, а после него. Для управляемого ролика порядок остаётся таким:

```text
Scenario / Timing / Audio Basis
-> Reference System
-> Shot Plan / Storyboard Map
-> Frame Pack
-> Video Segment Pack
```

То есть storyboard / shot plan не должен впервые появляться в главе про видеогенерацию. В этой главе он уже считается подготовленной картой, по которой выбираются режимы: text-to-video, image-to-video, first+last frame, multi-reference, multiframes или video-to-video.

Один из практических подходов:

Один практический маршрут выглядит так: локация, персонаж и адаптированный промпт дают видео-генерацию; потом выбираем лучший результат и только после этого улучшаем качество.

Это не единственный способ делать AI-video, но полезная схема для коротких сцен, где важны свет, камера и точный финал.

📌 **Вывод:** сначала называем тип задачи, потом выбираем инструмент. Не наоборот.

## 06.3. Канва-Маршрут Для Моделей

Если папки - это архив с разделами, то канва - это стена, на которой видно весь проект сразу.

Если вы работаете через визуальное поле, модельный маршрут можно раскладывать прямо на канве:

На канве это можно разложить так: референс локации, референс персонажа и адаптированный промпт лежат рядом с вариантами изображений, видео-тестами, заметками о поломках и выбранным победителем.

Такой подход удобен, когда нужно сравнить несколько вариантов и не потерять, какой вход дал какой результат.

🎬 **Мини-пример.** Слева лежит референс локации, рядом референс героя или объекта, ниже промпт, справа четыре видео-теста. Один тест ломает идентичность, второй ломает действие, третий держит сцену. На канве это видно сразу, а не через археологию в папке загрузок.

## 06.4. Подготовка Персонажа, Если Персонаж Нужен

Важное уточнение: персонажа нужно готовить **только если он реально есть в ролике**.

Если вы делаете абстрактный ролик с водой, product-shot без человека или интерьер без героя, не надо внезапно готовить "свои фото". Это не обязательный ритуал перед генерацией. Это инструмент для задач, где лицо, тело, одежда или силуэт должны сохраняться.

Если в ролике есть человек или герой, сначала нужен устойчивый референс персонажа.

Один из рабочих подходов:

- сделать несколько ракурсов на нейтральном фоне;
- выбрать лучший;
- использовать его как основу для адаптации промпта.

Для Seedance-подобных моделей есть важная оговорка: подготовить несколько ракурсов можно, но первый видео-тест лучше начинать с одного самого сильного кадра. Если сразу загрузить много похожих фото лица, модель может начать смешивать их между собой.

Это не отменяет карту персонажа. Это разделяет два этапа:

```text
подготовка персонажа = можно иметь несколько ракурсов;
вход в первую генерацию = один самый чистый кадр;
добавление новых референсов = только если тест показал необходимость.
```

Инструменты для подготовки изображений могут быть полезны для таких референсов.

Примеры: Nano Banana Pro, ChatGPT Images, Midjourney, Luma или любой другой инструмент, который умеет делать чистые референсы персонажа.

Важное правило:

не привязывать курс к одному названию. Если завтра другой инструмент лучше держит лицо, курс должен оставаться полезным.

📌 **Простая проверка:** если в ролике нет человека, этот блок можно пропустить без чувства вины. Мы не делаем ритуалы ради ритуалов.

## 06.5. Адаптация Промпта Под Модель

Сначала кажется: нашёл чужой хороший промпт, вставил своё имя или фото, получил такой же результат.

Обычно так не работает. Чужой промпт держится на своём персонаже, своей локации, своём движении и своей модели.

**Адаптация промпта** - это не копирование текста. Это перенос конкретного приёма в вашу задачу.

Если prompt взят из большого архива референсов, сначала нужно понять его тип. Это не бюрократия, а защита от ошибки: prompt для одного оживлённого изображения нельзя автоматически использовать как большой multi-shot prompt, а storyboard prompt нельзя превращать в обычную красивую простыню.

Внутри AIS FLOWS такие референсы классифицируются по модели, route и сложности. Рабочая карта лежит в guide:

```text
AIS_FLOWS_GENERATION_GUIDE/00_PROMPT_REFERENCE_ARCHIVE_MAP.md
```

Для человека это означает простое правило: сначала понять, **какую работу делал чужой prompt**, и только потом переносить его структуру.

Чат или агент можно использовать как помощника для адаптации промпта под конкретную модель.

Примеры: Codex, ChatGPT, Claude, Gemini.

Их задача:

- понять, какой приём работает в исходном промпте;
- взять вашего персонажа;
- взять вашу локацию;
- переписать промпт под задачу;
- убрать лишнее;
- сохранить главный приём: движение, свет, ракурс, финальный поворот или способ появления объекта.

Важно:

Агент не должен придумывать новую историю, если задача была только адаптировать промпт.

Иначе вы просили поменять костюм, а агент уже переписал фильм, добавил дракона и решил, что "так будет как в кино".

### 06.5A. Карточка Режима Seedance-Подобной Модели

Перед генерацией пройдите короткую карточку вопросов:

```text
Режим: видео из текста / видео из изображения / несколько референсов с ролями / первый и последний кадр / несколько ключевых кадров / правка существующего видео
Что уже есть: текст / стартовый кадр / элементы / финальный кадр / персонаж / локация / видео
Элементы сцены: персонаж / одежда / автомобиль / продукт / логотип / предмет / фон
Главное действие:
Камера:
Свет:
Что сохранить первым:
Какие референсы прикреплены:
Роль каждого референса:
Что нельзя копировать из готового промпта:
Что нельзя ломать:
Ожидаемая ошибка:
```

Если у референса нет роли, он не помогает. Он просто лежит в куче и надеется, что модель догадается.

Нормальные роли:

```text
@Image1 = identity / character
@Image2 = location / environment
@Image3 = product / object
@Image4 = style anchor
@Video1 = camera movement / pacing / choreography
@Audio1 = голос / атмосфера / синхрон с ритмом / звуковой эффект
```

Для звука сначала разделите роли. Музыкальная подкладка - это отдельный слой: score, soundtrack, background music, music bed. Остальной звук - это SFX, ambience, foley, речь, lip sync, ветер, волны, шаги, дыхание, удары. Если музыка уже есть отдельным треком или будет наложена в монтаже, video prompt не должен просить модель генерировать музыку. В блоке `Политика звука` пишите: `Музыка: no music in generation / свой трек в монтаже`, а SFX и речь указывайте отдельно.

Если выбранная модель может сама добавить звук, не отдавайте человеку готовый prompt, пока не ясно, нужна ли музыка внутри видеогенерации. Это уточняется до controlled segments и перед финальным `Prompt to paste`.

В controlled segment эти роли не сжимают в одну строку через запятую. Пишите отдельными строками и сразу указывайте, что фиксирует каждый файл:

```text
Входные референс-материалы / прикрепляемые материалы:
- @Image1 = single input reference image: primary subject / identity anchor - фиксирует силуэт, пропорции, материал и ключевые детали.
- @Image2 = single input reference image: environment anchor - фиксирует локацию, фон/поверхность, масштаб и базовый свет.
- @Image3 = single input reference image: lighting/style reference - фиксирует направление света, цветовое настроение и атмосферу без потери читаемости @Image1.
```

Карточка сегмента может быть на русском, если человек проверяет логику на русском. Но `Prompt to paste` для генератора по умолчанию остаётся на английском. Не пишите "тот же объект" / `same object`, пока в этой же карточке или prompt body не назван конкретный входной identity reference.

Для длинного или мультишотного сегмента добавляйте адреса внутренних коротких частей. Это не украшение, а способ чинить ролик после генерации:

```text
S6-A / 0:24.0-0:25.5 - командир понимает ошибку.
S6-B / 0:25.5-0:28.0 - главный визуальный поворот развивается.
S6-C / 0:28.0-0:29.0 - кадр приходит к финальному состоянию.
```

Если плохо получился только `S6-B`, не надо заново менять `S1-S5` и весь `S6`. Сначала выберите маршрут. Если надо поправить логику всего сегмента, перепишите родительский segment prompt. Если `S6-A` и `S6-C` приняты, а заменить нужно только `S6-B`, выдайте `Local Replacement Short Package`: отдельный image / start-frame prompt для нового кадра `S6-B` и отдельный video prompt для оживления этого кадра. Оба prompt должны сохранить родительские референсы, свет, персонажей, камеру на границах и место в монтаже.

📌 **Вывод:** модель не обязана понимать вашу папку. Ей нужно объяснить, какой файл за что отвечает.

## 06.6. Как Использовать Manual/PDF Как Правила Модели

Иногда у модели или автора есть отдельный manual, PDF или карточка правил. Это не надо читать как священную табличку. Но это можно использовать как инструкцию для агента.

Плохой путь:

```text
напиши красивый промпт для Seedance
```

Нормальный путь:

```text
вот правила Seedance;
вот моя идея;
вот мой персонаж;
вот моя локация;
перепиши промпт под эту сцену и не нарушай правила модели.
```

Так Codex, ChatGPT, Claude или Gemini работают не как генератор красивых слов, а как редактор под конкретную модель.

✅ **Мини-шаблон задачи агенту:**

```text
Используй этот manual как правила для Seedance-подобной модели.
Перепиши промпт под мою сцену, персонажа и локацию.
Сначала выбери режим: видео из текста, видео из изображения, несколько референсов с ролями, первый и последний кадр, несколько ключевых кадров или правка существующего видео.
Оставь одно главное действие и одно движение камеры.
Сделай освещение явным.
Если есть реплика, держи её короткой.
Каждому референсу назначь роль.
Не копируй старую одежду, лицо, бренд или локацию из исходного промпта.
Верни: финальный промпт, режим/настройки, что может сломаться, один запасной вариант только если он реально нужен.
```

📌 **Вывод:** manual/PDF полезен не потому, что там магия. Он задаёт ограничения модели, чтобы агент не писал промпт как рекламный буклет на две страницы.

## 06.7. Как Использовать Чужой Сильный Промпт

Не копировать буквально.

Разобрать:

- что за сцена;
- какое движение там работает;
- какой визуальный эффект;
- какая камера;
- какой финальный удар;
- что может сломаться.

Потом заменить:

- персонажа;
- локацию;
- что меняется в вашей версии;
- смысл;
- финал.

Шаблон безопасной адаптации:

```text
Source prompt даёт только механику.
Сохрани: тип движения, порядок событий, камеру, способ появления/перехода, уровень детализации.
Замени: персонажа, лицо, одежду, бренд, IP-локацию, чужие имена, чужую сцену.
Проверь: промпт не тащит старую идентичность и не нарушает референсы.
```

🎬 **Мини-пример.** Если готовый промпт работает за счёт parkour-прыжка через готическую башню, нам не нужна чужая башня. Нам нужен механизм: персонаж движется через читаемую архитектуру, камера держит траекторию, финал фиксирует позу и окружение.

## 06.8. Улучшение Качества

**Улучшение качества** - это финальная обработка хорошего результата: сделать резче, чище, детальнее.

Это не больница для сломанной сцены.

Улучшать качество нужно после выбора лучшего результата.

Не апскейлить слабую генерацию.

Если лицо, объект или композиция сломались, улучшение качества только сделает поломку резче.

## 06.9. Остановка: Режим Модели И Адаптация

Возьмите один понравившийся промпт или приём ролика и разберите его:

```text
Что происходит в сцене:
Какое движение работает:
Камера:
Какие референсы нужны:
Что заменить:
Что сохранить:
Риск:
Адаптированная идея:
```

## 06.10. Сначала Универсальная Задача, Потом Конкретный Сервис

Одна и та же сцена может идти в разные модели, но поля интерфейса у них меняются.

Сначала держите независимое описание:

```text
Сцена и действие:
Камера:
Длительность и монтажная цель:
Референсы:
Звук:
Что сохранить:
Что проверить:
```

Потом переводите его в конкретный маршрут выбранной модели: что вставляется в поле промпта, какие изображения можно загрузить, какие длительности реально доступны и какие настройки существуют в текущем интерфейсе.

🎬 **Мини-пример.** Если в заметке написано `три входных изображения`, это ещё не значит, что любой сервис примет три изображения. Сначала открываем нужный режим и проверяем реальный интерфейс. Неподдерживаемое поле не становится рабочим только потому, что красиво выглядит в JSON.

Названия версий, лимиты, режимы, цены и доступные функции меняются. Такие сведения всегда проверяются заново перед работой и не превращаются в вечное правило курса.









