<figure><img src="https://res.cloudinary.com/dcsny9dt4/image/upload/v1779305806/Slide_4_3_-_5_ptdnib.png"></figure>

<p><b>4DAnyone</b> строит 4D-модель человека в движении по монокулярному видео — без рига, калибровки камеры и штатива. Инструмент достраивает ракурсы, которых физически не было в кадре, и собирает их в 4D гауссианы, то есть объёмную сцену, которую можно смотреть с любой точки во времени.</p>

<p>Работает система на живых, неподготовленных кадрах: танцы, спортивные съёмки, сценические выступления, речь, модные показы. Не нужно ставить маркеры на актёра, синхронизировать несколько камер или снимать в специальном павильоне — достаточно одного видеопотока.</p>

<h2>Как удерживается геометрия</h2>

<p>Главная проблема генерации недостающих ракурсов — накопление ошибок и дрейф формы при удалении от исходного кадра. В 4DAnyone эту задачу решают два механизма. <b>Reference Context Packing</b> сжимает постоянно растущий референсный контекст в фиксированный вычислительный бюджет, не давая модели захлебнуться в объёме данных на длинных видео. <b>Target Context Routing</b> обменивается информацией между группами генерируемых ракурсов, за счёт чего разные части сцены не расходятся между собой — структурного дрейфа не возникает.</p>

<p>Отдельное решение — отказ от depth-карт как основы для 3D-условия. Вместо них используется <b>скелетная 3D-разметка</b>, которая ведёт себя устойчивее: depth-карты легко ломаются на сложных позах и самоперекрытиях, а скелет держит геометрию тела даже при резких движениях.</p>

<h2>Из чего собрано</h2>

<p>В основе пайплайна — <b>Wan2.2 VAE</b> и текстовый энкодер umt5-xxl, а детекция человека и позы построена на связке YOLO, ViTPose и GVHMR. Для ускорения инференса поддерживаются FlashAttention-3 и SageAttention.</p>

<p>Такой набор задач закрывает сразу несколько сценариев:</p>

<ul><li>восстановление объёмной записи танца или перформанса по одной камере</li><li>анализ движения в спорте без размеченного зала</li><li>работа со сценическими и модными съёмками без штатива и калибровки</li><li>получение недостающих ракурсов речи или сцены для последующей обработки</li></ul>

<p>Код проекта опубликован на Github.</p>

Нейро Отличник

www.neurootlichnik.ru