<figure><img src="https://res.cloudinary.com/dcsny9dt4/image/upload/v1779305806/Slide_4_3_-_2_usuik5.png"></figure>
<p>Обычно с генеративными моделями идут от простого к сложному: сначала учат рисовать картинки, потом — видео. Здесь пошли в обратную сторону. Разработчики взяли готовый <b>Qwen-Image-Edit</b> и научили его работать с видеолатентами напрямую, не добавляя отдельный видео-трансформер.</p>
<p>Схема работает так: кадры ролика раскладываются в виртуальную сетку, которая для модели выглядит как одна большая картинка. Редактор правит эту сетку по текстовой инструкции точно так же, как обычное фото, а на выходе результат снова собирается в видеопоток.</p>
<h2>Что умеет редактор</h2>
<ul><li>Редактирование видео по текстовой инструкции</li><li>Работа с длинными роликами — они режутся на куски по 45 кадров, и для каждого куска можно задать отдельный промпт</li><li>Нативная поддержка портретного видео без искажения пропорций кадра</li><li>Финальный прогон через <b>Wan 2.2</b> для сглаживания и временной стабильности картинки</li></ul>
<h2>Технические детали</h2>
<p>В основе — VAE от Wan 2.1. Чекпоинт обучен на клипах 360p длиной 45 кадров, так что нативное разрешение и длительность роликов пока ограничены именно этими параметрами. По весу модель не маленькая: DiT занимает около 40 ГБ, текстовый энкодер — порядка 15 ГБ, а Wan 2.2 A14B, который отвечает за финальную стабилизацию, добавляет ещё около 80 ГБ.</p>
<p>Код и веса опубликованы на <b>Гитхабе</b> и на Hugging Face — там можно посмотреть, как устроена сборка, и запустить редактор самостоятельно.
Нейро Отличник
www.neurootlichnik.ru