<figure><img src="https://res.cloudinary.com/dcsny9dt4/image/upload/v1779305806/Slide_4_3_-_6_u25dha.png"></figure>
<p>ByteDance неожиданно выкатили <b>SeedRealtime</b> — нативную аудиовизуальную full-duplex-модель, которая работает совсем не так, как привычные голосовые ассистенты. Это не просто ответ на Wan Streamer от Alibaba, а попытка сделать ассистента, который действительно реагирует на происходящее в реальном времени, а не ждёт, пока пользователь закончит говорить.</p>
<h2>Что умеет SeedRealtime</h2>
<p>Главная особенность — <b>единая архитектура</b> для аудио, видео и текста. Модель анализирует не только отдельные кадры, но и всю последовательность событий, связывает услышанное с тем, что происходит в кадре, и даже понимает, обращаются ли к ней вообще. Например, если в поле зрения появляется новый объект или звучит двусмысленная фраза, SeedRealtime может среагировать, учитывая визуальный контекст.</p>
<p>В отличие от классических ассистентов, здесь нет привычной схемы «сначала вы, потом я». SeedRealtime может слушать, смотреть и отвечать одновременно, не теряя нить разговора и не путая фоновые шумы с обращением к себе.</p>
<h3>Ассистент с инициативой</h3>
<p>ByteDance отдельно подчёркивают, что модель способна проявлять инициативу: сама сообщает об изменениях в кадре, подключает нужные инструменты прямо во время диалога, корректно реагирует на перебивания и не срывается на каждый посторонний звук. Это заметно отличает SeedRealtime от большинства конкурентов, которые часто теряются при сложных сценариях общения.</p>
<p>Пока что <b>открытых весов</b> нет — модель доступна только в виде демо и описания. Но уже сейчас видно, что борьба идёт не за то, кто быстрее или точнее отвечает на вопросы, а за то, кто меньше всего напоминает бота с задержкой.</p>
<p>Подробнее: Официальный анонс ByteDance Seed, страница SeedRealtime.</p>
<p><i>@cgevent</i></p>
Нейро Отличник
www.neurootlichnik.ru