Как сгенерировать видео из нескольких референсов в MiniMax H3

15 августа 2026 г.5 минРедакция CreatorHub AI
Как сгенерировать видео из нескольких референсов в MiniMax H3

MiniMax H3 — одна из немногих моделей, которая умеет работать с несколькими типами референсов одновременно. Вы можете загрузить изображения персонажа, видео с нужным движением камеры и аудиодорожку для атмосферы — и модель объединит всё это в одном ролике. В этом гайде разберём, как правильно загружать референсы, составлять промпты и получать предсказуемый результат.

Что такое мультимодальные референсы в MiniMax H3

MiniMax H3 поддерживает до 12 файлов в одном запросе: до 9 изображений, до 3 видеоклипов и до 3 аудиофайлов. Каждый референс выполняет свою роль — один задаёт внешность персонажа, другой определяет движение камеры, третий отвечает за звуковую атмосферу. Модель генерирует видео длительностью от 4 до 15 секунд в разрешении до 2K при 24 FPS, причём сразу со стереозвуком.

Ключевое отличие H3 от других моделей — возможность явно указать роль каждого файла прямо в промпте. Вы загружаете референсы, а затем вызываете их через символ @ и описываете, за что отвечает каждый. Например: «Персонаж с @image1 идёт по улице, движение камеры как на @video1, атмосфера соответствует @audio1». Так модель понимает, какой файл отвечает за внешность, какой — за динамику, а какой — за звук.

Типы референсов и их ограничения

  • Изображения: до 9 файлов, разрешение от 256 до 5760 пикселей по любой стороне
  • Видео: до 3 клипов, каждый от 2 до 15 секунд, общая длительность не более 15 секунд, соотношение сторон от 2:5 до 5:2
  • Аудио: до 3 файлов, каждый от 2 до 15 секунд, общая длительность не более 15 секунд
  • Смешанный ввод: максимум 12 файлов всех типов суммарно

Согласно официальной документации MiniMax API, модель поддерживает режим Reference Generation (ref2va), который позволяет сохранять характеристики референсных объектов на протяжении всего видео — будь то персонаж, стиль движения, голос или ритм монтажа.

Как правильно составлять промпты с референсами

Главное правило — всегда явно указывайте роль каждого файла в промпте. MiniMax H3 использует систему ролей для референсов, и чем точнее вы опишете назначение каждого файла, тем предсказуемее будет результат. Вот базовая формула промпта с несколькими референсами:

  1. Опишите основную сцену или действие
  2. Укажите референс для персонажа или объекта через @imageN
  3. Добавьте референс для движения камеры через @videoN
  4. Если нужно, задайте звуковую атмосферу через @audioN
  5. Опишите финальные детали: освещение, настроение, стиль

Пример промпта: «Женщина с @image1 танцует в студии, движение камеры повторяет @video1, музыкальный ритм соответствует @audio1, мягкое студийное освещение, киноматографичный стиль». Такая структура помогает модели точно распределить информацию из каждого референса.

Типичные ошибки при работе с референсами

  • Не указывать роль файла — модель сама решает, как использовать референс, и результат может быть непредсказуемым
  • Загружать слишком много референсов без чёткого описания — чем больше файлов, тем важнее явно прописать назначение каждого
  • Противоречия между промптом и референсами — если текст описывает одно, а изображение показывает другое, модель может «запутаться»
  • Использовать видео-референсы с резкими сменами кадров — лучше выбирать клипы с плавным движением камеры

Как сгенерировать видео из нескольких референсов в CreatorHub AI

В боте @CreatorHubAI_bot доступна модель MiniMax H3 с полной поддержкой мультимодальных референсов. Вот пошаговая инструкция:

  1. Откройте бота @CreatorHubAI_bot и перейдите в раздел Видео
  2. Выберите модель MiniMax H3 из списка доступных генераторов
  3. Нажмите кнопку загрузки референсов и прикрепите нужные файлы: изображения персонажа, видео с движением камеры, аудио для атмосферы
  4. В поле промпта опишите сцену и явно укажите роль каждого файла через @: например, «Персонаж с @image1 бежит по лесу, камера движется как на @video1, звуковая атмосфера из @audio1»
  5. Настройте параметры: длительность видео (4–15 секунд), разрешение (768p или 2K), соотношение сторон
  6. Нажмите Сгенерировать и дождитесь результата — обычно генерация занимает 1–3 минуты
  7. Скачайте готовое видео со звуком прямо из бота

На платформе eazium.ru/c/video доступен тот же функционал через веб-интерфейс — удобно, если нужно работать с большим количеством референсов или сохранять историю проектов.

Сколько стоит генерация с референсами

В CreatorHub AI генерация видео в MiniMax H3 оплачивается кредитами. Стоимость зависит от разрешения и длительности: ролик на 10 секунд в 768p обойдётся примерно от 15 кредитов (около 45₽), в 2K — дороже. При регистрации вы получаете бесплатные кредиты на старте, чтобы протестировать модель. Загрузка референсов не увеличивает стоимость — цена зависит только от параметров выходного видео.

Согласно официальному блогу MiniMax, стоимость генерации в H3 в пересчёте на секунду видео в 2K меньше трети от цен конкурентов, а в 768p — меньше половины. CreatorHub AI предлагает оплату в рублях и прозрачную систему кредитов, что удобнее подписок с лимитами.

Советы для экономии кредитов

  • Начинайте с 768p для черновиков — качество достаточно для оценки композиции и движения
  • Используйте 2K только для финальных версий — разница в цене ощутимая
  • Тестируйте промпты на коротких роликах (4–6 секунд), прежде чем генерировать полные 15 секунд
  • Загружайте только те референсы, которые действительно нужны — лишние файлы не улучшат результат, но усложнят промпт

MiniMax H3 — мощный инструмент для тех, кто хочет точно контролировать каждый аспект видео: от внешности персонажа до движения камеры и звуковой атмосферы. Правильная работа с мультимодальными референсами открывает возможности, недоступные в обычных text-to-video моделях. Попробуйте сами в CreatorHub AI — первые кредиты бесплатно.

Примеры: как это выглядит на самом деле

Пример сделан нашим сервисом — промпт указан, результат можно повторить:

Пример генерации: FLUX SchnellFLUX Schnell. Промпт: «Split-screen composition showing three reference images on left merging into single cohesive video frame on right, modern UI interface, soft blue lighting, sleek tech visualization style»