<figure><img src="https://rss.neurootlichnik.ru/images/609b2c84-170b-43dc-8fb7-8cad294a21b2/0.jpg"></figure>

<p>Deepseek выпустила <b>deepseek-v4-flash-vision-exp</b> — версию своей модели V4-Flash, которая теперь работает с изображениями наравне с текстом. Модель умеет описывать картинки, читать скриншоты и разбирать графики, при этом сохраняя базовый уровень обычного V4-Flash в тексте: рассуждениях, знаниях и агентских задачах.</p>

<p>Самое заметное изменение — на мультимодальных агентских бенчмарках модель показывает большой скачок и подходит близко к уровню <b>Opus 4.8</b>. Разрыв между текстовыми и визуальными задачами у Deepseek заметно сократился.</p>

<h2>Как считаются токены за картинки</h2>

<p>Тут у модели своя логика: одно изображение стоит максимум 384 токена. Всё, что крупнее примерно 800×800 пикселей, сжимается до этого размера перед обработкой. Из-за этого картинка 2000×2000 и картинка 5000×5000 обойдутся одинаково — модель просто уменьшит обе до одного и того же разрешения.</p>

<p>Тарификация осталась той же, что у обычного V4-Flash — $0.14 за 1 миллион входных токенов. При таком расчёте на доллар выходит порядка 18 тысяч изображений, а в непиковые часы — вдвое дешевле.</p>

<h2>Что можно загружать</h2>

<ul><li>До 600 изображений в одном запросе</li><li>Форматы JPEG, PNG, GIF, WebP</li><li>Files API для повторного использования картинок без загрузки заново</li></ul>

<p>Модель доступна сразу через три интерфейса — OpenAI Chat Completions, Responses API и Anthropic-совместимый эндпоинт /messages. Это упрощает переключение для тех, кто уже работает с другими провайдерами через эти форматы.</p>

<p>По цене всё осталось на уровне обычного V4-Flash, то есть недорого за запрос. Судя по описанию, модель должна неплохо справляться и с документами, и с графикой — кроме, возможно, изображений с очень плотным текстом, где сжатие до 384 токенов может съесть детали.</p>

Нейро Отличник

www.neurootlichnik.ru