K² · Искусственный интеллект
Хотите, чтобы персонаж взял чашку именно так? Покажите картинку
Авторы разработали IMAGIN-4D — генератор взаимодействия человека с объектом на основе диффузии, который использует опорное изображение как визуальное описание желаемого снимка взаимодействия.
SD
FB
Sai Kumar Dwivedi, Federica Bogo, Buğra Tekin и др.
9 авторов · cs.CV
Суть за 30 секунд
Скажите ИИ: «человек берёт коробку и несёт вон туда».
- IMAGIN-4D решает проблему неоднозначности в существующих методах взаимодействия человека с объектом, когда одна и та же текстовая подсказка и траектория могут привести к разным захватам, направлениям подхода, позам тела, позам объекта, точкам контакта и расположению человека относительно объекта.
- Метод разлагает визуальное кондиционирование пространственно-временным образом: извлекает размеченные токены состояния взаимодействия для пространственного кондиционирования и вычисляет токены, зависящие от кадра, для временного кондиционирования.
- IMAGIN-4D использует ролевое кондиционирование, при котором текст, контрольные точки и токены состояния взаимодействия используют отдельные потоки AdaLN, а токены зависящего от кадра визуального содержимого перекрёстно взаимодействуют с токенами движения.