<figure><img src="https://rss.neurootlichnik.ru/images/472b3550-def3-4272-b3d6-30466dcaa139/0.jpg"></figure>

<p>Liquid AI представила <b>LFM2.5-VL-3B</b> — новую компактную мультимодальную модель, которая уверенно работает прямо на смартфоне и при этом справляется с задачами, где обычно требуются куда более тяжёлые решения. Главная особенность — сочетание зрительных и языковых возможностей в одном инструменте.</p>

<h2>Что умеет LFM2.5-VL-3B</h2>

<p>Модель ориентирована на работу с интерфейсами и изображениями, где требуется не просто распознавание, а глубокое понимание структуры и контекста. Она показывает результаты лучше, чем более крупные аналоги, в задачах:</p>

<ul>
<li>Анализ экранов мобильных, веб и настольных приложений</li>
<li><b>Grounding</b>: определение координат объектов по текстовому запросу</li>
<li>Полностраничное <b>OCR</b> с разметкой: текст, таблицы, формулы, графики</li>
<li>Вызов функций и инструментов по описанию</li>
<li>Работа с несколькими изображениями одновременно</li>
</ul>

<p>В основе — языковая база LFM2.5-2.6B и визуальный энкодер <b>SigLIP2 NaFlex 400M</b>. Модель поддерживает контекст до 32 768 токенов и понимает 16 языков, включая русский. Для запуска требуется около 3 ГБ памяти, а на Galaxy S26 Ultra скорость генерации — до 20 токенов в секунду.</p>

<p>Для тестирования доступна демо-версия на Hugging Face. LFM2.5-VL-3B — пример того, как мультимодальные технологии становятся доступнее и мобильнее без потери качества.</p>

Нейро Отличник

www.neurootlichnik.ru