<figure><img src="https://rss.neurootlichnik.ru/images/34e0812e-297d-43d6-8920-4cf3831d4759/0.jpg"></figure>

<p>TimeLens2 — это модель, которая умеет находить нужные моменты в видеороликах по обычному текстовому запросу. Она превращает видеопоток в нечто вроде визуальной памяти, где каждый фрагмент связан с конкретными сущностями и событиями. Если задать вопрос на естественном языке, TimeLens2 покажет интервалы на временной шкале, где происходит искомое.</p>

<figure><img src="https://rss.neurootlichnik.ru/images/34e0812e-297d-43d6-8920-4cf3831d4759/1.jpg"></figure>
<h2>Как работает TimeLens2</h2>
<p>Модель справляется как с разовыми, так и с повторяющимися событиями. Она одинаково хорошо анализирует видео от третьего лица и эгоцентричные записи (например, с камер на голове). В ответ на запрос TimeLens2 может выдать один или несколько временных отрезков, где найдено соответствие.</p>
<p>В основе лежат <b>мультимодальные LLM</b> — крупные языковые модели, обученные работать сразу с текстом и изображениями. Это позволяет системе понимать сложные запросы и точно находить нужные моменты даже в длинных роликах.</p>

<h3>Варианты модели</h3>
<p>TimeLens2 доступна в двух версиях: <b>TimeLens2-4B</b> и <b>TimeLens2-8B</b>. Они отличаются размером и возможностями, что позволяет подобрать подходящий вариант под разные задачи и ресурсы.</p>
<h3>Где посмотреть</h3>
<ul>
<li>Исходный код доступен на GitHub</li>
<li>Модель можно найти на HF (Hugging Face)</li>
<li>Для быстрой пробы есть демо-версия</li>
</ul>
<p>TimeLens2 — инструмент для тех, кому важно быстро находить нужные эпизоды в больших массивах видео, не просматривая всё вручную.</p>

Нейро Отличник

www.neurootlichnik.ru