Hailuo AI H3 (Хайлуо): что советуют на Reddit про видео с речью
Hailuo AI H3 (Хайлуо, она же MiniMax H3) — видеомодель, которая делает ролики до 15 секунд с речью персонажей прямо в кадре: по тексту, из фото или по набору референсов. На Reddit о ней за последний месяц вышло больше десятка тредов на тысячи голосов, и почти все советы сводятся к одному: писать промпт как сценарий, а не как пожелание. Ниже — честный дайджест того, что советуют на Reddit, и как это повторить в студии ИИшки, где Hailuo H3 работает без VPN, на русском, в 768p или 2K, а рядом стоят Kling 3.0, Veo 3.1 и Seedance 2.0 на случай, если задача не про речь.
Что вообще обсуждают на Reddit про Hailuo AI H3
Сообщество r/StableDiffusion после выхода открытых весов H3 разобрало модель по винтикам: там есть тред с официальным гайдом по промптам (около 900 голосов), тред про эмоции через микровыражения и теги (1600+), разбор того, как выжать качество на слабой видеокарте с помощью референсов, лайфхак с кружком на референсе и AMA-сессия с командой MiniMax. Локальные пользователи и пользователи API работают с одной моделью, поэтому выводы переносятся один в один — с той разницей, что в студии не нужно ждать 40 минут рендера и настраивать ComfyUI.
Сквозная мысль всех тредов: Hailuo AI H3 — первая видеомодель, которой можно режиссировать, а не просить. Если написать «кот идёт по улице», модель сама придумает, куда смотрит камера, когда сделать монтажную склейку и кто что скажет. Если написать сценарий с планами, репликами и таймингом — получите то, что написали.
Какую модель брать под задачу
Hailuo H3 сильна в речи и референсах, но не единственная в студии. Вот куда смотреть по задачам — все ссылки ведут на открытые модели.
| Задача | Модель | Почему |
|---|---|---|
| Говорящий персонаж на русском, реклама, ведущий | Hailuo H3 | Речь в кадре, до 15 с, форматы от 9:16 до 21:9, референсы героя и голоса |
| Собрать сцену из нескольких фото и видео | Seedance 2.0 | До 9 фото, 3 видео, 3 аудио, упоминания @Image1/@Video1 в промпте |
| Оживить одно фото с точным движением камеры | Kling 3.0 | Первый и последний кадр, мультикадр до 5 сцен, звук переключателем |
| Кинематографичная картинка, 4K | Veo 3.1 | Тиры 720p / 1080p / 4K, 4–8 с, звук генерируется вместе с видео |
| Первый кадр для видео | Nano Banana Pro | H3 не генерирует одиночную картинку — команда MiniMax советует делать кадр отдельной моделью |
Подробнее о том, как эти модели соотносятся, — в подборке лучших нейросетей для видео и сравнении Veo 3.1 и Kling 3.0.
Совет 1. Промпт — это сценарий с планами и таймкодами
Самый популярный тред — «прочитайте наконец гайд». Автор перечисляет типовые жалобы: реплику произносит не тот персонаж, речь превращается в набор звуков, в ролике появляются склейки, которых никто не просил, герои говорят одновременно. И показывает, что каждая из них лечится структурой промпта, а не перегенерацией.
Структура выглядит так: каждый план начинается с пометки «Кадр 1», «Кадр 2», внутри плана — крупность, положение камеры, действие, реплика. Второй и последующие планы можно снабдить временем начала — тогда модель сама управляет темпом: если следующий план начинается на шестой секунде, всё, что описано в предыдущем, займёт ровно эти секунды. Первому кадру время не ставят никогда. Без таймкодов модель решает момент склейки сама — это тоже нормально, если вам не важен ритм.
Кадр 1: средний план, ведущая в светлой студии смотрит в камеру, руки на столе. Ведущая говорит по-русски: «Сегодня три нейросети для видео — и одна из них умеет речь». Кадр 2, с 6-й секунды: камера медленно наезжает на её лицо, она улыбается и поднимает палец. Фон — мягкий дневной свет, тихий шум студии, музыки нет.
В студии ИИшки этот промпт вставляется как есть в поле описания: Hailuo H3 принимает до 7000 символов, так что места хватит и на три плана. Если планов больше трёх или нужны свои кадры на каждую сцену, посмотрите режим «Мультикадр» у Kling 3.0 — там раскадровка встроена в форму.
Совет 2. Назовите говорящего и язык — перед каждой репликой
Второй по важности вывод из того же треда и из треда про эмоции: модель не угадывает, кто произносит фразу. Реплика без адресата уходит первому попавшемуся персонажу или превращается в бормотание. В открытой версии пользователи оборачивают реплики в служебные теги с указанием языка; через API, которым пользуется студия, промпт разворачивает встроенный интерпретатор, поэтому достаточно написать словами:
Мужчина в синем свитере говорит по-русски, спокойно и негромко: «Это займёт пять минут, обещаю». Женщина рядом отвечает по-русски с улыбкой: «Проверим».
Три правила, которые повторяются в комментариях:
- Имя или описание + язык перед каждой фразой, даже если персонаж один.
- Одна реплика — одна эмоция. «Устало вздыхает и говорит…» работает лучше, чем «говорит грустно, но с надеждой и лёгкой иронией».
- Паузы и дыхание — словами. «Делает паузу», «выдыхает», «шёпотом», «смеётся» — модель отыгрывает их голосом и лицом. В треде про микровыражения таких приёмов больше двадцати, и все они описываются обычным языком.
Совет 3. Сверяйте объём действия с длительностью
Классическая ошибка, которую на Reddit называют главной причиной «слишком быстрых» роликов: в промпте на 5 секунд — две реплики, поворот головы, наезд камеры и улыбка. Модель попытается уместить всё, и получится каша с наложением речи.
Ориентир из обсуждений: одна короткая фраза плюс одно действие на 4–5 секунд, диалог из двух реплик — от 8 секунд, три плана со сменой крупности — 12–15 секунд. В студии длительность Hailuo H3 выбирается от 4 до 15 секунд с шагом в секунду, и цена растёт вместе с ней — так что лишние секунды «на всякий случай» просто съедят токены.
Совет 4. Черновик в низком разрешении, финал в 2K
Автор гайда генерирует каждую сцену сначала в самом низком разрешении, проверяет тайминг и реплики и только потом запускает долгий рендер. В студии это буквально переключатель «Качество видео»: 768p для черновика, 2K для финала. Разница в цене заметная, поэтому обкатывать промпт на 2K — самый дорогой способ учиться.
Из AMA с командой MiniMax стоит знать одну техническую деталь: 2K у H3 — это не просто больший кадр, а второй проход модели поверх готового ролика, который дорисовывает детали. Поэтому «мыльные» текстуры, на которые жалуются пользователи открытой версии в 768p, в 2K заметно уходят. Если ролик идёт на большой экран или в рекламу — 2K, если в сторис — 768p часто достаточно. Старый ролик в 768p можно дотянуть и позже через Topaz Апскейл видео.
Совет 5. Референсы решают больше, чем промпт
Тред про «максимум качества на 8 ГБ видеопамяти» набрал 1200+ голосов не из-за железа, а из-за метода: автор собрал короткую комедийную сцену из стоп-кадров фильма как референсов персонажей и локации плюс 15-секундных чистых записей голоса — и получил узнаваемых героев с узнаваемыми голосами. Его вывод, который поддержали в комментариях: даже убедительная картинка «разваливается» на слух, если голос генерируется наугад, а референс голоса чинит это за один шаг.
В студии ИИшки за это отвечает режим «Референсы» у Hailuo H3: до 9 фото (герой, предмет, стиль), до 3 видеофрагментов и до 3 аудиодорожек, суммарно не длиннее 15 секунд каждого типа. Практические замечания из того же треда:
- Девять референсов — предел, но стабильнее всего работает до шести.
- Аудиореференс должен быть чистой речью без музыки и шума — иначе модель скопирует и шум.
- В промпте всё равно нужно написать, кто что говорит; референс задаёт тембр, а не текст.
- Если музыку планируете накладывать сами — попросите в промпте «без музыки», а трек соберите в ElevenLabs Музыке.
Важное ограничение, о котором спрашивают чаще всего: кадры и референсы не совмещаются. Либо «Кадры» (первый и последний), либо «Референсы» — студия не даст загрузить и то и другое в один запуск.
Совет 6. Обведите на референсе, где должна быть сцена
Свежий тред с 770+ голосами: автор нарисовал на фото локации красный кружок и написал в промпте, что персонаж должен оказаться в обведённом месте, — модель поставила героя именно туда, сохранив здания на фоне. В комментариях подтверждают, что цвет кружка не принципиален, а вот фраза в промпте обязательна: без неё пометка просто исчезнет.
Это работает в режиме «Референсы»: одно фото — герой, второе — локация с кружком, в промпте — «поставь героя с первого фото в место, обведённое на втором». Простой способ управлять композицией без описания «слева от фонаря, чуть дальше скамейки».
Как повторить это в студии ИИшки: 6 шагов
Шаг 1. Выберите режим ввода
Откройте Hailuo H3. Для одного фото — режим «Кадры» и загрузка первого кадра (последний — по желанию, для управляемого финала). Для сцены из нескольких источников или голоса — «Референсы».
Шаг 2. Подготовьте первый кадр отдельно
Команда MiniMax в AMA прямо сказала: H3 не умеет остановиться на одном кадре-превью, правильный маршрут — сделать кадр image-моделью и оживить его. Сгенерируйте кадр в Nano Banana Pro в нужном формате (для сторис — 9:16), проверьте свет и лицо, затем загрузите в H3.
Шаг 3. Напишите промпт-сценарий
Планы, крупность, действие, говорящий + язык + реплика, атмосфера звука. Пример для товарного ролика:
Кадр 1: крупный план, керамическая кружка на деревянном столе, утренний свет из окна. Женская рука поднимает кружку, пар идёт вверх. Закадровый женский голос говорит по-русски мягко: «Первая чашка — самая тихая». Кадр 2, с 5-й секунды: камера отъезжает, за столом улыбается девушка в сером свитере и делает глоток. Звук: тихая кухня, без музыки.
Шаг 4. Подберите длительность под текст
Одна фраза — 4–5 секунд, диалог — от 8, три плана — 12–15. Не ставьте максимум «про запас».
Шаг 5. Черновик в 768p
Запустите на 768p, проверьте, кто говорит, успевает ли действие, нет ли лишних склеек. Правьте промпт, а не параметры: почти все дефекты из списка выше — про текст.
Шаг 6. Финал в 2K и монтаж
Переключите качество на 2K и запустите ту же сцену. Несколько сцен удобно собирать на Канвасе: там кадр из Nano Banana Pro, ролик из H3 и апскейл связываются нодами, и повторный прогон меняет только нужный узел.
Частые ошибки Hailuo AI H3 и что с ними делать
| Ошибка | Причина | Что сделать |
|---|---|---|
| Реплику произносит не тот персонаж | Говорящий не назван | Имя или описание + «говорит по-русски» перед каждой фразой |
| Речь — набор звуков | Не указан язык или фраза слишком длинная | Добавить «по-русски», сократить реплику под длительность |
| Склейки, которых не просили | Модель сама решила смонтировать | Один план — «непрерывный кадр без склеек»; несколько — явные «Кадр 1, Кадр 2» |
| Герои говорят одновременно, всё слишком быстро | Действия не помещаются в секунды | Увеличить длительность или убрать половину действий |
| Форма не принимает файлы | Загружены и кадр, и референсы | Оставить один режим ввода |
| Голос «пластмассовый» | Нет аудиореференса | Загрузить до 15 с чистой речи в режиме «Референсы» |
| Персонаж не там, где нужно | Композиция описана словами | Обвести место на референсе локации и сказать об этом в промпте |
| Мыльная картинка | Черновик 768p ушёл в финал | Пересчитать сцену в 2K или прогнать через апскейл видео |
Что дальше
Если задача — оживить одно фото без речи, начните со статьи как оживить фото нейросетью: там пошагово про Kling 3.0 и Grok Imagine. Если нужен ролик из нескольких референсов с упоминаниями @Image1 и @Video1 — Seedance 2.0 даёт тот же набор входов, но с другой логикой промпта. А для говорящих персонажей на русском Hailuo AI H3 сейчас самый прямой путь — при условии, что промпт написан как сценарий. Все советы выше проверяются за один черновик в 768p; стоимость запуска показана в карточке модели до старта.
Модели из статьи
Частые вопросы
Hailuo AI и MiniMax H3 — это одна модель?
Да. Hailuo — семейство видеомоделей MiniMax, H3 — третье поколение; в обсуждениях её называют Hailuo 3, Hailuo 3.0 и MiniMax H3. В студии ИИшки она называется Hailuo H3 и работает через API MiniMax: до 15 секунд, 768p или 2K, шесть форматов кадра.
Нужен ли VPN и английский, чтобы пользоваться Hailuo AI?
В студии ИИшки Hailuo H3 запускается без VPN и принимает промпт на русском. Реплики персонажей тоже можно писать по-русски — модель произносит их в кадре. Главное — прямо в промпте назвать, кто говорит и на каком языке.
Почему герой в Hailuo AI говорит тарабарщину или не тем голосом?
Самый частый совет с Reddit: реплика не привязана к говорящему и языку. Пишите «Ведущая говорит по-русски: «…»» — и имя, и язык — перед каждой репликой. Вторая причина — слишком много текста для выбранной длительности: на 5 секунд помещается одна короткая фраза.
Можно ли в Hailuo H3 загрузить и первый кадр, и референсы сразу?
Нет. Модель работает либо по кадрам (первый и последний), либо по референсам (до 9 фото, до 3 видео и до 3 аудиодорожек). В студии ИИшки это переключатель «Режим ввода»: «Кадры» или «Референсы». Смешать два режима в одном запуске нельзя.
Сколько стоит генерация в Hailuo H3?
Цена в токенах показана в карточке модели до запуска и зависит от длительности и качества: 2K дороже 768p. Участникам клуба ИИшки доступна клубная цена. Черновики выгоднее делать в 768p на 4–5 секунд.
Все модели из подборки доступны в студии ИИшки по сниженным клубным ценам. Каждый месяц участникам клуба начисляются токены на генерации.
Вступить в клубЕщё статьи
- Дубляж видео нейросетью: как перевести и озвучить ролик в 2026Как сделать дубляж видео нейросетью: перевод текста, новая озвучка в ElevenLabs или MiniMax и синхрон губ в Kling Avatars v2. Пошагово, на русском без VPN.
- Kling Avatar (Клинг Аватар): как сделать говорящее фото в 2026Как сделать говорящее фото нейросетью: портрет + голос в Kling Avatars v2, озвучка текста в ElevenLabs и MiniMax, речь в кадре в Hailuo H3. На русском без VPN.
- Промпты для Kling 3.0 (Клинг): 20 готовых примеров для видеоГотовые промпты Kling 3.0 на русском: портреты, товары, пейзажи, мультикадр и звук. Формула промпта, частые ошибки и запуск в студии ИИшки без VPN.