<figure><img src="https://rss.neurootlichnik.ru/images/9affca09-8d2a-4bbb-85d9-28a631baabb0/2.jpg"></figure>
<p>Tencent Hunyuan и Fudan University показали <b>WithEveryone</b> — фреймворк для генерации групповых портретов, где в одном кадре может быть до десяти человек, и у каждого свой персональный референс лица. Это одна из самых заметных проблем в генеративке: чем больше людей на фото, тем быстрее модель путает лица, тела и позы между собой.</p>
<figure><img src="https://rss.neurootlichnik.ru/images/9affca09-8d2a-4bbb-85d9-28a631baabb0/1.jpg"></figure>
<figure><img src="https://rss.neurootlichnik.ru/images/9affca09-8d2a-4bbb-85d9-28a631baabb0/2.jpg"></figure>
<p>Разработчики решили эту задачу через разделение процесса на два этапа. Сначала модель занимается планированием: определяет, кто из референсных персон войдёт в кадр, где именно будет стоять каждый человек и как в целом выстроена композиция группы. Только после этого готовый <b>layout</b> используется как условие для финального рендера изображения.</p>
<p>Ключевая часть системы — механизм <b>Layout CoT</b>, цепочка рассуждений, которая жёстко привязывает конкретную личность к конкретному лицу, телу и ключевым точкам позы. Именно этот шаг должен убирать типичную для мультиперсонажных генераций путаницу, когда лицо одного человека случайно оказывается пришито к телу другого.</p>
<p>По сути, модель сначала строит структурный план сцены, а потом заполняет его деталями — а не пытается угадать расстановку и сходство лиц одновременно, как это часто происходит в существующих генераторах.</p>
<p>WithEveryone пока находится на стадии обучения. Авторы не обещают открытый релиз: команда указывает, что весами и кодом могут поделиться позже, а могут и не поделиться вовсе.</p>
Нейро Отличник
www.neurootlichnik.ru