<figure><img src="https://res.cloudinary.com/dcsny9dt4/image/upload/v1779305806/Slide_4_3_-_2_usuik5.png"></figure>
<p>Команда OpenMOSS выпустила <b>MOSS-VL</b> — открытое семейство визуально-языковых моделей, которое работает не с готовым видеофайлом, а с живым потоком кадров. Модель анализирует изображение по мере его поступления и формирует ответ параллельно, не дожидаясь окончания записи.</p>
<video><source src="https://rss.neurootlichnik.ru/images/3e4d6a37-7162-4bab-bd4d-80ca2c425de0/video_0.mp4" type="video/mp4"/></video>
<p>Обычно системы видеоанализа либо ждут полного ролика, либо опрашивают кадры через внешний планировщик с фиксированным интервалом, например раз в секунду. MOSS-VL устроена иначе: реалтайм-обработка встроена прямо в архитектуру, и модель сама решает, когда пора реагировать, а когда — нет.</p>
<p>Разработчики описывают три встроенных поведения модели:</p>
<ul><li>ответ в любой момент — реакция формируется, как только в кадре появляется достаточно информации для вывода</li><li>проактивное молчание — если ситуация в кадре ещё не прояснилась, модель не спешит с ответом</li><li>своевременная коррекция — когда новые кадры меняют картину, модель уточняет или исправляет уже данный ответ</li></ul>
<p>По характеристикам модель насчитывает <b>11 миллиардов параметров</b> и работает с контекстом до <b>256K</b> токенов, что позволяет удерживать в памяти достаточно длинные видеопотоки без потери контекста. Для более лёгкого запуска доступны квантованные версии <b>FP8</b> и <b>NF4</b> — они снижают требования к памяти при инференсе.</p>
<p>Код, веса модели и демо-версия опубликованы в открытом доступе, так что MOSS-VL можно протестировать самостоятельно, без обращения к закрытому API.</p>
Нейро Отличник
www.neurootlichnik.ru