K2

K² · Искусственный интеллект

Хотите, чтобы персонаж взял чашку именно так? Покажите картинку

Авторы разработали IMAGIN-4D — генератор взаимодействия человека с объектом на основе диффузии, который использует опорное изображение как визуальное описание желаемого снимка взаимодействия.

SD
FB

Sai Kumar Dwivedi, Federica Bogo, Buğra Tekin и др.

9 авторов · cs.CV

Препринт arXivИскусственный интеллектиюнь 2026 г. · ~65 с чтения

Суть за 30 секунд

Скажите ИИ: «человек берёт коробку и несёт вон туда».

  1. IMAGIN-4D решает проблему неоднозначности в существующих методах взаимодействия человека с объектом, когда одна и та же текстовая подсказка и траектория могут привести к разным захватам, направлениям подхода, позам тела, позам объекта, точкам контакта и расположению человека относительно объекта.
  2. Метод разлагает визуальное кондиционирование пространственно-временным образом: извлекает размеченные токены состояния взаимодействия для пространственного кондиционирования и вычисляет токены, зависящие от кадра, для временного кондиционирования.
  3. IMAGIN-4D использует ролевое кондиционирование, при котором текст, контрольные точки и токены состояния взаимодействия используют отдельные потоки AdaLN, а токены зависящего от кадра визуального содержимого перекрёстно взаимодействуют с токенами движения.