Как сгенерировать видео из нескольких референсов в MiniMax H3

MiniMax H3 — одна из немногих моделей, которая умеет работать с несколькими типами референсов одновременно. Вы можете загрузить изображения персонажа, видео с нужным движением камеры и аудиодорожку для атмосферы — и модель объединит всё это в одном ролике. В этом гайде разберём, как правильно загружать референсы, составлять промпты и получать предсказуемый результат.
Что такое мультимодальные референсы в MiniMax H3
MiniMax H3 поддерживает до 12 файлов в одном запросе: до 9 изображений, до 3 видеоклипов и до 3 аудиофайлов. Каждый референс выполняет свою роль — один задаёт внешность персонажа, другой определяет движение камеры, третий отвечает за звуковую атмосферу. Модель генерирует видео длительностью от 4 до 15 секунд в разрешении до 2K при 24 FPS, причём сразу со стереозвуком.
Ключевое отличие H3 от других моделей — возможность явно указать роль каждого файла прямо в промпте. Вы загружаете референсы, а затем вызываете их через символ @ и описываете, за что отвечает каждый. Например: «Персонаж с @image1 идёт по улице, движение камеры как на @video1, атмосфера соответствует @audio1». Так модель понимает, какой файл отвечает за внешность, какой — за динамику, а какой — за звук.
Типы референсов и их ограничения
- Изображения: до 9 файлов, разрешение от 256 до 5760 пикселей по любой стороне
- Видео: до 3 клипов, каждый от 2 до 15 секунд, общая длительность не более 15 секунд, соотношение сторон от 2:5 до 5:2
- Аудио: до 3 файлов, каждый от 2 до 15 секунд, общая длительность не более 15 секунд
- Смешанный ввод: максимум 12 файлов всех типов суммарно
Согласно официальной документации MiniMax API, модель поддерживает режим Reference Generation (ref2va), который позволяет сохранять характеристики референсных объектов на протяжении всего видео — будь то персонаж, стиль движения, голос или ритм монтажа.
Как правильно составлять промпты с референсами
Главное правило — всегда явно указывайте роль каждого файла в промпте. MiniMax H3 использует систему ролей для референсов, и чем точнее вы опишете назначение каждого файла, тем предсказуемее будет результат. Вот базовая формула промпта с несколькими референсами:
- Опишите основную сцену или действие
- Укажите референс для персонажа или объекта через @imageN
- Добавьте референс для движения камеры через @videoN
- Если нужно, задайте звуковую атмосферу через @audioN
- Опишите финальные детали: освещение, настроение, стиль
Пример промпта: «Женщина с @image1 танцует в студии, движение камеры повторяет @video1, музыкальный ритм соответствует @audio1, мягкое студийное освещение, киноматографичный стиль». Такая структура помогает модели точно распределить информацию из каждого референса.
Типичные ошибки при работе с референсами
- Не указывать роль файла — модель сама решает, как использовать референс, и результат может быть непредсказуемым
- Загружать слишком много референсов без чёткого описания — чем больше файлов, тем важнее явно прописать назначение каждого
- Противоречия между промптом и референсами — если текст описывает одно, а изображение показывает другое, модель может «запутаться»
- Использовать видео-референсы с резкими сменами кадров — лучше выбирать клипы с плавным движением камеры
Как сгенерировать видео из нескольких референсов в CreatorHub AI
В боте @CreatorHubAI_bot доступна модель MiniMax H3 с полной поддержкой мультимодальных референсов. Вот пошаговая инструкция:
- Откройте бота @CreatorHubAI_bot и перейдите в раздел Видео
- Выберите модель MiniMax H3 из списка доступных генераторов
- Нажмите кнопку загрузки референсов и прикрепите нужные файлы: изображения персонажа, видео с движением камеры, аудио для атмосферы
- В поле промпта опишите сцену и явно укажите роль каждого файла через @: например, «Персонаж с @image1 бежит по лесу, камера движется как на @video1, звуковая атмосфера из @audio1»
- Настройте параметры: длительность видео (4–15 секунд), разрешение (768p или 2K), соотношение сторон
- Нажмите Сгенерировать и дождитесь результата — обычно генерация занимает 1–3 минуты
- Скачайте готовое видео со звуком прямо из бота
На платформе eazium.ru/c/video доступен тот же функционал через веб-интерфейс — удобно, если нужно работать с большим количеством референсов или сохранять историю проектов.
Сколько стоит генерация с референсами
В CreatorHub AI генерация видео в MiniMax H3 оплачивается кредитами. Стоимость зависит от разрешения и длительности: ролик на 10 секунд в 768p обойдётся примерно от 15 кредитов (около 45₽), в 2K — дороже. При регистрации вы получаете бесплатные кредиты на старте, чтобы протестировать модель. Загрузка референсов не увеличивает стоимость — цена зависит только от параметров выходного видео.
Согласно официальному блогу MiniMax, стоимость генерации в H3 в пересчёте на секунду видео в 2K меньше трети от цен конкурентов, а в 768p — меньше половины. CreatorHub AI предлагает оплату в рублях и прозрачную систему кредитов, что удобнее подписок с лимитами.
Советы для экономии кредитов
- Начинайте с 768p для черновиков — качество достаточно для оценки композиции и движения
- Используйте 2K только для финальных версий — разница в цене ощутимая
- Тестируйте промпты на коротких роликах (4–6 секунд), прежде чем генерировать полные 15 секунд
- Загружайте только те референсы, которые действительно нужны — лишние файлы не улучшат результат, но усложнят промпт
MiniMax H3 — мощный инструмент для тех, кто хочет точно контролировать каждый аспект видео: от внешности персонажа до движения камеры и звуковой атмосферы. Правильная работа с мультимодальными референсами открывает возможности, недоступные в обычных text-to-video моделях. Попробуйте сами в CreatorHub AI — первые кредиты бесплатно.
Примеры: как это выглядит на самом деле
Пример сделан нашим сервисом — промпт указан, результат можно повторить:
FLUX Schnell. Промпт: «Split-screen composition showing three reference images on left merging into single cohesive video frame on right, modern UI interface, soft blue lighting, sleek tech visualization style»