<figure><img src="https://res.cloudinary.com/dcsny9dt4/image/upload/v1779305806/Slide_4_3_-_7_vrgpdx.png"></figure>

<p>Вышла новая версия <b>Wan-Streamer</b> — интерактивного генератора аудио и видео. Обновление до v0.3 принесло несколько заметных изменений, которые делают модель более гибкой и выразительной.</p>

<video><source src="https://rss.neurootlichnik.ru/images/00370926-26f0-4799-894e-bfe8ca5ce434/video_0.mp4" type="video/mp4"/></video>

<video><source src="https://rss.neurootlichnik.ru/images/00370926-26f0-4799-894e-bfe8ca5ce434/video_1.mp4" type="video/mp4"/></video>

<p>Главное отличие — теперь агент способен не только реагировать на команды, но и проявлять свободное поведение, описываемое обычным языком. Это заметно расширяет сценарии использования: можно задавать действия и речь в одной временной последовательности, а синхронизация между ними происходит автоматически.</p>
<p>В версии v0.3 используется новая схема обучения: сначала модель обучается на видео, а затем адаптируется к интерактивным задачам. В предыдущей версии акцент был только на данных взаимодействия. При этом разрешение и частота кадров остались прежними — 640×368 и 25 fps.</p>
<p>Возможности Wan-Streamer v0.3 позволяют:</p>
<ul>
<li>Генерировать синхронизированные аудио и видео с участием агента</li>
<li>Описывать действия и речь на естественном языке</li>
<li>Экспериментировать с поведением агента в интерактивном режиме</li>
</ul>
<p>Пока не ясно, будет ли проект <b>опенсорс</b>. За обновление благодарят <b>@m_franz</b>.</p>

Нейро Отличник

www.neurootlichnik.ru