<figure><img src="https://rss.neurootlichnik.ru/images/05f6b634-f5a6-4c81-b171-ca1df5248582/2.jpg"></figure>

<p>В мире мультимодальных агентов появилось решение, которое заставляет модель не просто искать текстовые ответы, а внимательно анализировать <b>видео</b>. <b>Video-DeepResearch</b> обучает ИИ сначала разбирать происходящее в кадре по времени и месту, а уже потом обращаться к интернету за дополнительной информацией. Такой подход помогает избежать двух типичных ошибок: игнорирования видеоматериала и выдачи заученных фактов вместо реального анализа.</p>

<figure><img src="https://rss.neurootlichnik.ru/images/05f6b634-f5a6-4c81-b171-ca1df5248582/0.jpg"></figure>

<figure><img src="https://rss.neurootlichnik.ru/images/05f6b634-f5a6-4c81-b171-ca1df5248582/1.jpg"></figure>
<h2>Как работает Video-DeepResearch</h2>
<p>В основе метода — строгая последовательность действий. Сначала агент должен точно определить нужный момент в видео, и только после этого ему открывается доступ к инструментам поиска. Это не только дисциплинирует модель, но и делает её работу более прозрачной для пользователя.</p>

<p>Инструменты для поиска информации подключаются поэтапно — модель не может сразу перескочить к интернету, минуя анализ видео. Такой подход позволяет повысить качество ответов и снизить количество ошибок, связанных с поверхностной обработкой данных.</p>
<h3>Результаты и сравнение</h3>
<p>На тестах <b>Video-DeepResearch</b> показал точность 68% (версия 35B-A3B) — это выше, чем у таких моделей, как Claude-4.5-Sonnet (63%), Gemini 2.5 Pro (62%) и GPT-5 (57%). Более компактная версия 30B-A3B достигает 62% точности — столько же, сколько Gemini 2.5 Pro, но при меньшем числе параметров.</p>

<p>Исследование доступно на GitHub для тех, кто хочет глубже разобраться в архитектуре и возможностях модели.</p>

Нейро Отличник

www.neurootlichnik.ru