Maestro: обзор локальной AI-студии для видео, изображений и музыки — и как её установить через Pinokio

Maestro — это полностью локальная AI-студия нового поколения, которая объединяет в одном интерфейсе генерацию видео, изображений и музыки. Проект построен поверх хорошо зарекомендовавшего себя бэкенда WanGP и распространяется через лаунчер Pinokio. Текущая стабильная версия — v1.9.0 от 19 августа 2026 года.

Главная идея проекта — избавить пользователя от «зоопарка» отдельных скриптов и Gradio-интерфейсов под каждую модель. Maestro предлагает единый современный React-UI и автоматически подбирает оптимальные настройки под железо, а его флагманская фича — режим Director, в котором локальный LLM берёт на себя роль режиссёра и превращает один промпт (или готовый аудиотрек) в полноценный музыкальный клип или короткометражку.

🎬 Director Mode — флагманская фича

Director Mode — это то, что отличает Maestro от других локальных студий. Пользователь загружает аудиофайл или пишет короткую историю, а дальше пайплайн работает сам:

  1. Локальный LLM анализирует вход и составляет сценарный план.
  2. Генерируются стартовые и ключевые кадры с сохранением внешности персонажей.
  3. Под каждую модель промпты дополнительно полируются с учётом LoRA-гайдов.
  4. Запускается многоклиповая генерация с финальной склейкой.

Доступно два «скилла»:

  • Music Video — beat-aware планирование кадров. LLM анализирует BPM, секции (куплет / припев / бридж) и энергию трека, чтобы удары попадали в downbeats. Поддерживается транскрипция с диаризацией дикторов — можно давать имена голосам и певцам.
  • Short Film — сценарный режим с именованными персонажами, диалогами и континуителом между кадрами. Слайдер pacing-bias управляет частотой склеек.

В режиме Auto Mode весь пайплайн (анализ → планирование → генерация картинок → генерация клипов → склейка) идёт end-to-end без участия пользователя. В Manual mode каждый шаг можно остановить и отредактировать вручную.

Архитектура Director v2 использует трёхпроходное уточнение:

  1. Сценарий — максимальная креативность LLM.
  2. Разбивка на шоты — структурированный JSON-вывод.
  3. Полировка промптов под конкретную модель и LoRA — инъекция специализированных гайдов.

⚡ Performance Auto-Tune — настройка «на автомате»

При первом запуске Maestro определяет GPU, объём VRAM и RAM и сам подбирает подходящий профиль: квантизацию, VAE-тайлинг и коэффициент запаса по VRAM. Это избавляет от необходимости вручную выбирать между «Profile 1 / 2 / 4.5» и угадывать, какие параметры не уронят генерацию в OOM.

  • OOM-recovery banner — если генерация упала из-за нехватки памяти, Maestro сам предложит снизить запас VRAM, и применить изменение можно одной кнопкой.
  • Живой статус загрузки — вместо безликого спиннера показывается, что именно сейчас скачивается («Downloading transcription model (first use downloads ~300MB)…»).
  • Show advanced settings — для опытных пользователей доступен полный ручной контроль.

🎨 Studio Mode — полное ручное управление

Помимо Director, есть классический Studio Mode с прямым доступом к каждой модели и каждому ползунку. На текущий момент поддерживаются:

Видео

  • MiniMax H3 и LTX-2.5 — с нативной синхронизацией аудио.
  • LTX-2.3, Wan1/2, Hunyuan и другие.

Изображения

  • Flux 2 Klein 9B, Krea 2 RAW/Turbo и Identity Edit, Qwen Image Edit и др.

Аудио

  • TTS: Kugelaudio, Qwen3 TTS.
  • Генерация музыки: MiniMax-Music3, ACE-Step.
  • SFX: MMAudio.

Продвинутые возможности Studio

  • Multi-clip generation с индивидуальными промптами на каждый клип и плавными overlapping-переходами (sliding window).
  • Shared LoRAs между всеми клипами проекта.
  • Blend video Mode — наложение двух видео с AI-смешиванием (аналог blend-режима из Sora 1).
  • Frames Injection (KFI) для сохранения внешности персонажей в длинных роликах.
  • Sliding window — генерация роликов произвольной длины.
  • Пост-обработка: spatial upsampling, film grain, выбор кодека.

🤖 Локальный LLM — без облаков

Maestro сам скачивает llama-server (~600 МБ) и выбранную GGUF-модель при первом использовании. По умолчанию — Gemma 4 4B (Recommended): быстрая, способная и комфортно работает на небольших GPU. CUDA определяется автоматически, LLM биндится к GPU при наличии.

В курируемом реестре уже есть Gemma 4 (2B / 4B / 26B MoE / 31B) и Qwen3.6 27B — в том числе uncensored / abliterated варианты, тюнингованные под креативные задачи.

Также поддерживаются внешние провайдеры (экспериментально):

  • OpenAI
  • Anthropic
  • любой OpenAI-совместимый endpoint

Доступно vision — LLM может улучшать промпт на основе референсных изображений. После 60 секунд простоя LLM автоматически выгружается, освобождая VRAM под видеогенерацию.

🛒 Встроенный браузер LoRA с CivitAI

LoRA-браузер встроен прямо в UI — искать, фильтровать и устанавливать LoRA можно не выходя из Maestro:

  • Кнопка Check обновляет данные из CivitAI, рядом с устаревшими LoRA появляется бейдж.
  • Раздел My LoRAs с фильтрами по обновлениям и возможностью удаления.
  • AI-генерируемые промпт-гайды — при скачивании LoRA ассистент сам объясняет, что она делает, даёт примеры промптов и рекомендует значения весов, которые применяются автоматически при выборе LoRA.
  • Рекомендуемые диапазоны весов берутся из CivitAI sidecars, HuggingFace или fallback-эвристик и отображаются прямо на слайдерах.
  • Multi-LoRA pack auto-extraction — архивы, в которых несколько LoRA, распаковываются автоматически.

🛠 Edit Mode — пост-продакшн прямо в студии

  • Retake — переснять фрагмент существующего видео новым промптом.
  • Edit Anything — добавить, изменить или убрать объекты в видео текстом с помощью In-Context LoRA.
  • Outpaint — расширить кадр в любую сторону, сохранив оригинальное действие, тайминг и аудио.
  • Repaint — через SCAIL-2 перекрасить персонажей, объекты или сцены, удерживая исходное движение и камеру.
  • Recast — заменить одного или нескольких людей в кадре другими персонажами, в том числе в мультишот-сценах и групповых планах.

📂 Workspaces, темы и режимы

Workspaces — несколько изолированных выходных директорий с быстрым переключателем в боковой панели. Удобно разделять клиентские проекты, NSFW/SFW и эксперименты. Закреплённые и избранные результаты хранятся отдельно для каждого workspace.

Темы (Settings → System):

  • Golden Hour (по умолчанию) — тёплая кинематографическая палитра, градиентные CTA, акценты цвета заката.
  • Classic — оригинальная холодная угольная палитра с синими акцентами.
  • Onyx — минималистичный монохром: чистый чёрный с нейтральными серыми поверхностями.

У каждой темы есть тёмная и светлая вариация. Режим Dark / Light / Auto в Auto следует за системной темой и переключается «на лету».

Mature mode — opt-in с дисклеймером. По умолчанию выключен. Открывает доступ к uncensored-моделям, NSFW-LoRA в CivitAI-браузере и тогглу NSFW в Settings → Services.

Experimental features gate — по умолчанию скрывает «продвинутые» переключатели (external API keys, Voice Reference, Inpaint, Restyle, Wan2GP Enhancer), чтобы первый запуск был сфокусированным.

📊 Director Pipeline Dashboard

В Dashboard сохраняются все прошлые запуски Director: план клипов, сгенерированные изображения и клипы, диффы полировки промптов. Любой клип можно перезапустить отдельно, не гоняя весь пайплайн заново.

🛠 Системные требования

Maestro — это «толстый» локальный клиент: модели весят десятки гигабайт, а генерация идёт на GPU. Ориентиры для комфортной работы:

  • GPU: NVIDIA с поддержкой CUDA (от 8 ГБ VRAM для базовых моделей, 16–24 ГБ для MiniMax H3 и LTX-2.5 в приличном качестве).
  • RAM: от 16 ГБ.
  • Диск: SSD, свободно от 50–150 ГБ под модели и кэш (зависит от набора).
  • ОС: Windows 10/11, Linux (Ubuntu / Mint проверены), macOS — поддерживается через Pinokio, но с ограничениями для топовых CUDA-моделей.
  • Дополнительно: для некоторых компонент (FlashAttention, SageAttention) используются pinned-варианты под конкретную CUDA-версию — не нужно ничего собирать руками.

📦 Установка через Pinokio

Maestro распространяется через лаунчер Pinokio — это самый простой и рекомендованный способ установки. Вручную ставить Python, CUDA, модели и прочие зависимости не нужно.

Шаг 1. Установить Pinokio

  1. Перейти на pinokio.computer.
  2. Скачать установщик под свою ОС (Windows / macOS / Linux).
  3. Установить и запустить Pinokio.

Шаг 2. Установить Maestro из GitHub

В Pinokio есть два равноценных пути.

Вариант A — Discover / URL:

  1. Открыть Pinokio.
  2. Перейти во вкладку Discover.
  3. Вставить URL репозитория: https://github.com/Blizaine/Maestro
  4. Нажать Install.

Вариант B — Install via URL:

  1. Скопировать адрес репозитория Maestro.
  2. В Pinokio нажать InstallFrom URL и вставить ссылку.
  3. Дождаться, пока Pinokio сам подтянет исходники, развернёт окружение и зависимости.

Шаг 3. Первый запуск

  1. В библиотеке Pinokio появится карточка Maestro — нажать Launch.
  2. Приложение откроется в браузере. На первом запуске Maestro определит GPU, VRAM и RAM и предложит оптимальные настройки — соглашаемся.
  3. В фоне автоматически скачаются:
    • llama-server (~600 МБ).
    • Дефолтная LLM — Gemma 4 4B.
    • Необходимые компоненты выбранных моделей (MiniMax H3, LTX-2.5 и др. — по запросу).
  4. Скачивание можно наблюдать в реальном времени — Maestro показывает конкретные статусы, а не «висит».

Шаг 4. Дополнительные модели и LoRA

  • В Studio выбираете нужные модели (видео / изображения / аудио) — Maestro сам предложит их скачать.
  • В CivitAI-браузере ищете и устанавливаете LoRA в один клик.
  • При первом использовании ASR-транскрипции один раз скачается ~300 МБ модели распознавания речи.

Шаг 5. Обновление

Текущая версия отображается прямо рядом с заголовком Maestro в UI. Чтобы обновиться, в Pinokio нажмите кнопку Update на карточке Maestro — лаунчер сам подтянет свежий коммит и перезапустит окружение.

🧭 Что в итоге

Maestro — это редкий пример локального проекта, который пытается по-настоящему закрыть сценарий «от идеи до готового клипа», не разбрасывая пользователя по десяткам отдельных инструментов. Сильные стороны:

  • Director Mode с реальным планированием сценария и бит-синхронизацией — не маркетинговая пустышка, а работающий пайплайн.
  • Авто-настройка под железо: «из коробки» работает на среднем игровом GPU.
  • Поддержка актуальных моделей (MiniMax H3, LTX-2.5, Flux 2, MiniMax-Music3) с регулярными апдейтами.
  • Удобный LoRA-браузер с AI-гайдами и автоподбором весов.
  • Полный цикл пост-продакшна (Retake, Outpaint, Repaint, Recast, Edit Anything) внутри одного UI.

Ограничения, о которых стоит помнить:

  • Проект ресурсоёмкий — на слабом GPU топовые модели пойдут медленно или потребуют квантизаций.
  • Внешние LLM-провайдеры пока помечены как experimental.
  • Для стабильной работы на Windows и Linux желательно иметь свежие драйверы NVIDIA и CUDA, совместимые с эталонным рантаймом Maestro.

Если вы уже работаете с WanGP, LTX или MiniMax H3 и устали прыгать между Gradio-интерфейсами — Maestro стоит попробовать одной из первых. Установить можно буквально за десять минут через Pinokio.

Репозиторий проекта: github.com/Blizaine/Maestro