Text-to-video промпты 2026: как описать сцену для реалистичного видео

В 2026 году видео-генераторы научились создавать ролики длиной до 10 секунд за один промпт, а с расширениями — до 148 секунд. Модели Veo 3.1, Kling 3, Seedance 2 и MiniMax Video понимают киношный язык буквально: движение камеры, освещение, планы. Но 80% неудач связаны с одной причиной — слабым промптом. Эта статья — пошаговое руководство, как правильно описать сцену для реалистичного видео в любой нейросети.
Из чего состоит промпт для видео
Промпт для видео сложнее промта для картинки: ИИ достраивает не только пространство, но и время. Рабочая формула состоит из семи блоков:
- Субъект — кто или что в кадре (один главный объект)
- Действие — конкретное движение в развитии, не статичная поза
- Камера — план, угол, движение камеры
- Сеттинг — место, время суток, окружение, свет
- Стиль — кинематография, референс, цветовая палитра
- Длительность — длительность и темп
- Аудио — звук, окружение, речь (для Veo 3.1)
Оптимальная длина промта — 100–150 слов, 3–6 предложений. Длиннее — модель начинает игнорировать часть параметров. Принцип: один параметр на строчку точнее, чем длинное предложение. Veo 3.1, Kling 3 и Seedance 2 одинаково точнее следуют верхним строкам промта.
Субъект и действие
Конкретный объект и конкретное движение. ИИ строит видео вокруг главного действия — оно должно быть одно. Плохо: «человек в офисе». Хорошо: «молодая женщина встаёт из-за стола, подходит к окну, останавливается и смотрит наружу». Глаголы силы — push, pull, lift, sway, ripple, spiral, drift — работают лучше абстрактных moves, does, performs. Они задают энергию движения, и ИИ-модель её удерживает.
Камера: план и движение
Камера — самый частый сбой в промптах. Без явной камеры Veo и Kling ставят статичный кадр или лёгкий handheld. План пишется первым словом промта — так Veo 3.1 точнее следует кадрированию. Базовые планы: wide shot (общий), medium shot (средний), close-up (крупный план), extreme close-up (деталь), over-the-shoulder (из-за плеча), low angle / high angle (снизу / сверху).
Движения камеры: static (фиксация), slow zoom in/out (наезд/отъезд), tracking (параллельное движение), dolly in/out (физический наезд), pan (поворот), tilt (наклон), crane (кран), orbit/arc (облёт), handheld (ручная), steady cam (плавная), aerial/drone (с дрона). Одно движение на промт. «Camera orbits then dollies in then cranes up» — каша. Указывайте направление и привязку: «camera tracks left, following the runner» точнее, чем «camera moves left». Скорость движения — отдельный модификатор: very slow, slow, moderate, brisk, rapid, sudden.
Освещение и атмосфера
Свет — главный инструмент атмосферы. Видео-модели 2026 года распознают киношный язык буквально. Основные термины: golden hour (тёплый низкий свет, длинные тени), blue hour (холодная пурпурно-синяя гамма после заката), soft light (рассеянный без теней), hard light (точечный с резкими тенями), backlit / rim light (свет сзади субъекта / светящийся контур), practical light (свет из источников в кадре: лампа, экран, фары), volumetric / god rays (лучи в пыли, тумане, дыму), chiaroscuro (высокий контраст света и тени).
Сочетания работают стабильно: «soft natural window light from the left + warm practical lamp on the table» — двусоставная схема. Время суток и погода — отдельные параметры: тот же субъект при golden hour и overcast midday дают два разных видео.
Стили и длительность
Стиль — пакет настроек камеры, света, грейдинга и грейна одним именем. Несколько прилагательных в конце промта меняют картинку сильнее, чем длинное описание сцены. Основные стили 2026 года: cinematic (анаморф, плёночный грейн, тёплая палитра, малая глубина резкости), anime (японская стилизация — уточняйте автора: Studio Ghibli look, Makoto Shinkai style), documentary (натуральные цвета, ручная камера, естественный свет), vintage / retro (Super 8 home video, VHS aesthetic, 70s Kodachrome), noir (высокий контраст, глубокие тени, дождь, неоновые блики), hyperrealism (микродетали кожи и материалов — лучше у Seedance 2).
Референсы операторов и эпох коротко: «in the cinematic style of Roger Deakins», «in the visual style of Wong Kar-wai», «35mm anamorphic», «Pixar 3D animation style». Один стиль на промт: смешивание (cinematic anime noir watercolor) — каша.
Большинство моделей в 2026 году генерируют 4–10 секунд за один промт. Veo 3.1 — до 8 секунд, с Video Extend — до 148. Kling 3 — до 10. Seedance 2 — до 10. Темп: slow steady pace, real-time continuous shot, quick energetic cuts, building tempo.
Аудио
В 2026 году нативный звук генерирует только Veo 3.1: окружение, шумы, в части кейсов — речь. Формат блока в промте: «Audio: ambient cafe sound, distant chatter, occasional cup clinks» или «Audio: rain on the window, soft jazz playing in background». У остальных моделей аудио добавляется отдельно — через встроенные TTS или монтаж.
Как сделать видео в CreatorHub AI
В Telegram-боте CreatorHub AI доступны модели Veo, Kling, Seedance и MiniMax Video. Пошаговая инструкция:
- Откройте бота @CreatorHubAI_bot или веб-приложение eazium.ru/c/video
- Перейдите в раздел «Видео»
- Выберите модель: Veo для реализма и нативного звука, Kling для динамики, Seedance для гиперреализма, MiniMax для длинных роликов
- Напишите промпт по формуле: план + субъект + действие + движение камеры + свет + стиль + длительность. Пример: «Medium shot of a young woman walking through a Moscow park at golden hour, camera tracks her slowly from the side, soft warm rim light, cinematic style in the look of Roger Deakins, 5 seconds, slow steady pace»
- Нажмите «Генерировать» — модель вернёт видео за 30–90 секунд
- Если нужно продлить ролик — используйте Video Extend для Veo (до 148 секунд суммарно)
Стоимость: от ~10 кредитов за 5-секундный ролик (около 30₽). Новым пользователям — бесплатные кредиты на старте. Оплата в рублях, без VPN.
Что НЕ писать в промпте
Список того, что ломает кадр или игнорируется:
- Длинные деепричастные конструкции — «девушка, проходящая мимо, оборачиваясь и улыбаясь, идёт дальше». Один глагол в настоящем времени на действие
- Конфликтующие движения камеры — «static handheld dolly tracking shot». Одно движение
- Противоречивые планы — «wide shot, close-up of her face». Один план
- Имена реальных людей и бренды — блокируются. Описывайте через типаж
- Слова-усилители без смысла — «very very very beautiful» модель игнорирует. Конкретное прилагательное лучше
- Отрицания — «без логотипов, без текста, без размытия». Модель цепляется за существительные. Переформулируйте в положительное: clean surface, no signage in frame
- Число объектов > 3 — модель не считает. До 3 стабильно, выше — повезёт
- Слишком детальный сценарий — «сначала она входит, потом садится, потом смотрит, потом улыбается». Один основной момент на промт
Принцип: положительные формулировки точнее отрицательных, конкретные термины — точнее общих.
Примеры рабочих промптов
Для рекламы: Wide shot of a coffee cup on a wooden table, slow dolly in, steam rising, warm morning light from window, shallow depth of field, cinematic style, 6 seconds, soft ambient cafe sound.
Для клипа: Close-up of a dancer's feet, quick cuts, neon floor lighting, high contrast, music video style, 8 seconds, building tempo.
Для документалки: Medium shot of an elderly man reading a newspaper in a park, handheld camera, natural overcast light, documentary style, real-time continuous shot, 10 seconds, ambient park sound with distant footsteps.
Для анимации: Wide shot of a floating island in the sky, slow orbit camera, golden hour light, Studio Ghibli style, 8 seconds, gentle wind sound.
Все эти промпты работают в CreatorHub AI — выбирайте модель под задачу, пишите промпт по формуле из семи блоков, получайте реалистичное видео за минуту. Полный список инструментов и цены — на eazium.ru.