ComfyUI с MiniMax H3: превосходит ли он Kling AI, Seedance и другие генераторы видео в бесплатной версии?

Бесплатно пользоваться генераторами видео на базе ИИ значительно сложнее, чем типичными моделями большого языкового моделирования (LLM), такими как ChatGPT, поскольку большинство провайдеров скупо предоставляют бесплатные кредиты. Заставить их создать именно то, что вам нужно — при этом сохранив качественный и единообразный вид — ещё сложнее. Поэтому я решил опробовать альтернативный вариант: развернуть локальную модель, например MiniMax H3.
Мой сын хочет использовать ИИ для создания собственного, так сказать, видео о световых мечах, снятого в стиле «конструктора». В настоящее время эта тема его очень увлекает. Но поскольку я не хотел сразу тратить большие деньги на дорогую подписку на сервис видео-ИИ для его экспериментов, он сначала попробовал бесплатно воспользоваться Kling AI и подобными сервисами.
Большинство генераторов видео на базе ИИ привлекают пользователей бесплатным начальным лимитом, чтобы побудить их создать учётную запись. Однако подвох становится очевидным очень быстро: если вы хотите на постоянной основе создавать более одного-двух трёхсекундных видеороликов в день, вас быстро подталкивают к покупке дорогостоящей подписки.
Однако даже с визуальной точки зрения видео, созданные к тому моменту, не вызывали особого восторга. Кроме того, обычно сложно обеспечить единообразие окружающей среды, объектов и персонажей. Разочарованный ребёнок подтолкнул меня к тому, чтобы попробовать локальное решение.
Локальные модели и решения, естественно, требуют мощного оборудования. Мы проводим тестирование на ноутбуке Razer Blade 16 (2025) с видеокартой RTX 5090 и 24 ГБ видеопамяти. В целом, генерация видео становится достаточно интересной только при наличии 8 ГБ видеопамяти, и в данном случае больше объёма действительно означает лучший результат.
Для данной модели доступно множество интерфейсов — мы остановили свой выбор на MiniMax H3. Он может работать, например, в Ollama, а также в Pinokio или Stability Matrix. Последний также включает ComfyUI — графический интерфейс для рабочих процессов с использованием ИИ, который не ограничивается только генерацией видео. Однако у меня возникли проблемы с этой комбинацией, поэтому я остановился на автономной версии ComfyUI (ComfyUI.org), которую можно загрузить в виде приложения для Windows и других платформ.

Новичкам может потребоваться некоторое время, чтобы привыкнуть к ComfyUI, однако этот инструмент открывает огромные возможности для генерации видео. Вы создаете рабочие процессы из отдельных узлов — по сути, это модульный набор инструментов, состоящий из множества инструментов и узлов. Каждый узел имеет вход и выход и может быть подключён к другим узлам.

Все инструменты разделены на отдельные узлы. Например, имеется узел для текстового запроса, несколько узлов с изображениями, которые могут служить в качестве справочных материалов или промежуточных этапов перед генерацией видео, а также другие инструменты. Теоретически в каждый узел можно загрузить отдельную модель искусственного интеллекта — LLM для текстового запроса, модель генерации изображений для узлов с изображениями и так далее. Модели искусственного интеллекта, естественно, занимают много места для хранения. В конечном итоге все узлы подают данные в узел генерации видео, который и формирует конечный результат.
Сначала мы экспериментировали с предустановками «текст-в-видео», но вскоре перешли к подходу «изображение-в-видео».

Особенно полезно это тем, что позволяет обеспечить единообразие окружающей среды, объектов и персонажей. Например, в нашем первом видео мы создали линкор из кубиков, пролетающий через кадр. При разрешении 480p на его генерацию ушло около 5,5 минут, хотя при наличии соответствующего оборудования возможны и более высокие разрешения. Однако в одной из предстоящих сцен нам потребовалось вновь использовать именно этот же боевой корабль. Поэтому мы сделали скриншоты переднего и заднего видов корабля, импортировали изображения, привязали их в качестве справочных материалов под названиями Ship_front и Ship_rear к главному узлу и дали ИИ указание использовать именно этот корабль в другой сцене. В противном случае ИИ сгенерировал бы новый вариант внешнего вида.
Потратив немного времени на ознакомление с системой и воспользовавшись помощью «профессора YouTube», мы быстро разработали первый рабочий процесс для наших видеосцен и создали видеоролики, которыми мы оба остались очень довольны. Модель большого языкового обучения (LLM) — в данном случае ChatGPT — помогла нам адаптировать текстовые подсказки специально для MiniMax H3, сделав их точными и подробными.
Мой рабочий процесс: в ChatGPT я описал задуманный мной образ, указал, что определённые названия брендов не должны появляться, хотя образ всё же может быть ими вдохновлён, пояснил, что он должен иметь кинематографический характер, и указал, какие справочные материалы (например, Ship_front) следует включить. Только после этого я описал саму сцену. Я вставил подсказку, адаптированную ChatGPT, в текстовый узел в ComfyUI, при необходимости добавил эталонные изображения — и всё было готово.

Вы также можете попросить ChatGPT сгенерировать универсальный промпт на основе желаемого стиля и других параметров, который можно сохранить для дальнейшего использования. Если вы вновь введете этот промпт в LLM, он будет содержать всю необходимую информацию, и вы сможете сразу же описать следующую сцену.
В любом случае, мы с сыном остались гораздо более довольны результатами, чем при использовании бесплатных версий Kling AI, Seedance и подобных сервисов. Множество доступных опций также побуждает к экспериментам, и вы, наконец, избавляетесь от раздражающих ограничений по кредитам, запросов на подписку, рекламы и проблем с безопасностью данных. Однако разрешение по-прежнему остаётся проблемой. Full HD или более высокое разрешение даже не предлагается в качестве варианта, вероятно, из-за слишком высоких требований к аппаратному обеспечению. Будущие модели, скорее всего, станут более эффективными в этом отношении. А пока вы также можете расширить свой рабочий процесс с помощью инструментов повышения разрешения.
Любой, кто располагает необходимым оборудованием и интересуется созданием фильмов, должен обратить внимание на ComfyUI и хорошую локальную модель искусственного интеллекта. В частности, ComfyUI позволяет создавать невероятно сложные многоуровневые рабочие процессы — если они вам действительно нужны. Однако для начала все необходимое уже имеется и освоить его можно довольно быстро.






