<figure><img src="https://res.cloudinary.com/dcsny9dt4/image/upload/v1779305806/Slide_4_3_-_7_vrgpdx.png"></figure>
<p>Авторы <b>Scenema Audio</b> интегрировали свою говорилку прямо в <b>ComfyUI</b>. Теперь в визуальном интерфейсе можно быстро создавать синтетическую речь с интонациями и эмоциями — и всё это без отдельного этапа обучения на голосе.</p>
<p>Система поддерживает работу с подсказками в квадратных скобках: можно добавить эффекты или задать настроение прямо в тексте. Например, указать [шёпотом] или [радостно], чтобы голос менялся по ходу фразы.</p>
<p>Для запуска потребуется минимум 8 ГБ VRAM, а при первом старте автоматически загрузится около 30 ГБ весов. Скорость генерации — до двух раз быстрее реального времени, что позволяет использовать инструмент не только для экспериментов, но и для задач, где важна оперативность.</p>
<h3>Где работает</h3>
<ul><li>В составе <b>ComfyUI</b> — визуального конструктора для генерации медиа</li><li>Через отдельный Docker-контейнер или API</li><li>На платформе Hugging Face</li></ul>
<p>Клонирование голоса происходит без сложных настроек: достаточно выбрать нужный голос, и система сразу готова к работе. Это заметно упрощает процесс для тех, кто не хочет разбираться в тонкостях обучения моделей.</p>
Нейро Отличник
www.neurootlichnik.ru