<figure><img src="https://res.cloudinary.com/dcsny9dt4/image/upload/v1779305806/Slide_4_3_-_6_u25dha.png"></figure>

<p>Сервис <b>FreeToken</b> предлагает способ запускать крупные MoE-модели на железе, которое для этого обычно не хватает по мощности. Суть в том, что вычисления не упираются только в видеокарту, а распределяются между GPU, CPU и оперативной памятью.</p>

<video><source src="https://rss.neurootlichnik.ru/images/73d161e2-2822-45d0-8ca5-4ae860b3c2fe/video_0.mp4" type="video/mp4"/></video>

<p>На практике это выглядит так: модель <b>Qwen3.6 35B</b> запускается на обычном игровом ноутбуке с RTX 4060 и всего 8 ГБ видеопамяти. При этом скорость генерации держится на уровне около 39 токенов в секунду — для модели такого размера это заметно выше, чем можно ожидать от карты этого класса.</p>

<p>С более тяжёлой моделью схема работает по тому же принципу, но с другими цифрами. <b>DeepSeek-V4-Flash 284B</b> — модель с 284 миллиардами параметров — запускается на RTX 5090 и выдаёт до 25 токенов в секунду. Падение скорости по сравнению с Qwen3.6 35B объяснимо: чем больше параметров, тем большую часть вычислений приходится перекладывать с GPU на CPU и память.</p>

<p>Здесь имеет значение сама архитектура <b>MoE</b>: в такой модели одновременно активна лишь часть параметров, а не вся сеть целиком. Именно на этом строится оптимизация FreeToken — часть нагрузки уходит с видеокарты на процессор и оперативную память без резкой потери скорости отклика.</p>

<p>По заявлению разработчиков, сервис полностью бесплатный.</p>

Нейро Отличник

www.neurootlichnik.ru