<figure><img src="https://rss.neurootlichnik.ru/images/d8cdbdfc-b317-416d-aa54-0b8ba5462ebf/2.jpg"></figure>
<p>SenseNova показала превью новой мультимодальной модели <b>SenseNova-U1.5-8B-MoT</b>. Понимание и генерация картинок собраны в одном трансформере — без отдельного VAE, текстового энкодера и DiT, как это обычно устроено в диффузионных генераторах.</p>
<figure><img src="https://rss.neurootlichnik.ru/images/d8cdbdfc-b317-416d-aa54-0b8ba5462ebf/1.jpg"></figure>
<figure><img src="https://rss.neurootlichnik.ru/images/d8cdbdfc-b317-416d-aa54-0b8ba5462ebf/2.jpg"></figure>
<figure><img src="https://rss.neurootlichnik.ru/images/d8cdbdfc-b317-416d-aa54-0b8ba5462ebf/3.jpg"></figure>
<video><source src="https://rss.neurootlichnik.ru/images/d8cdbdfc-b317-416d-aa54-0b8ba5462ebf/video_0.mp4" type="video/mp4"/></video>
<p>Архитектура построена как смесь трансформеров (<b>MoT</b>): текст и изображение обрабатываются разными весами, но при этом полноценно аттендят друг на друга внутри одной модели. Это отличает подход от привычной схемы, где генерация и понимание картинки — это две разные системы, склеенные пайплайном.</p>
<p>Из заявленных возможностей:</p>
<ul><li>нативная генерация в 4K без даунскейла и последующего апскейла</li><li>уверенный рендер текста как на китайском, так и на английском языке</li><li>точное локальное редактирование изображений без искажения остальной сцены</li><li>понимание структурированных длинных промптов без дополнительного обучения на такой формат</li></ul>
<p>По заявленным бенчмаркам модель выходит на уровень <b>Nano Banana 2</b> в тесте Qwen-Image Bench, а на ImgEdit-Bench и GEdit-Bench превосходит Nano-Banana и Qwen-Image-2.</p>
<p>Код и веса опубликованы на Гитхабе и Hugging Face, доступна облегчённая 8-шаговая лора для быстрой генерации, есть демо для проверки и нода для ComfyUI. Разработчики пока называют это превью — полную версию модели обещают позже.</p>
Нейро Отличник
www.neurootlichnik.ru