<figure><img src="https://rss.neurootlichnik.ru/images/cf2a3fb3-62d5-4525-82b7-a6eb56ae2270/0.jpg"></figure>

<p>Команда <b>Qwen</b> показала систему <b>AVA-Encoder</b>, которая разбирает фильм или видеоролик на структурированный граф знаний. В граф попадают персонажи, сцены, события, объекты, стили, параметры камеры и аудио — то есть почти все смысловые слои видео превращаются в связанные узлы, с которыми можно работать напрямую.</p>

<p>Ключевая идея — обратимость. Видео преобразуется в граф, а затем граф пытается восстановить исходное видео обратно. Чем точнее получается реконструкция, тем больше информации энкодер сохранил при разборе. Такая проверка через восстановление служит прямой метрикой качества самого графа, без отдельной ручной оценки.</p>

<p>Граф не статичен — его можно редактировать как обычную базу данных. Если заменить персонажа в конкретной сцене или поменять стиль освещения, связанные элементы обновляются автоматически благодаря связям внутри графа. Не нужно вручную синхронизировать десятки зависимых параметров — система делает это сама, отслеживая, какие узлы связаны с изменённым.</p>

<p>Готовый граф можно передавать другим видеоагентам без дополнительного обучения. Среди упомянутых систем:</p>

<ul><li>MovieAgent</li><li>FilmAgent</li><li>Anim-Director</li></ul>

<p>Их качество генерации растёт просто за счёт того, что они получают на входе уже структурированное представление сцены вместо сырого видео.</p>

<p>Обучение самого энкодера построено на двух циклах. Внешний цикл настраивает политику энкодера ещё до его развёртывания — это происходит один раз и работает как база для всех последующих задач. Внутренний цикл включается опционально и дорабатывает граф конкретного видео уже на лету, подстраиваясь под особенности отдельного ролика без переобучения всей системы.</p>

Нейро Отличник

www.neurootlichnik.ru