K² · Искусственный интеллект
Выбросьте половину картинки — и генерация ускорится вчетверо
Авторы разработали метод Sparse Context, который создаёт разреженные представления эталонных изображений для диффузионных моделей, основанных на эталонах, сохраняя только подмножество токенов эталона.
RP
AR
Rishubh Parihar, Ayush Raina, R. Venkatesh Babu и др.
4 автора · cs.CV
Суть за 30 секунд
ИИ, который рисует картинки по вашему описанию, часто использует ещё и картинку-образец: «сделай новое фото, но сохрани вот эту куртку».
- Они обнаружили, что удаление значительной части токенов эталона на этапе генерации в основном сохраняет способность модели генерировать результаты даже без её переобучения.
- Метод дообучает модель с помощью случайного удаления токенов при разных соотношениях, чтобы сделать её устойчивой к неполным представлениям эталонов.
- Стратегия обучения отделяет модель от какого-либо конкретного правила отбора токенов, обеспечивая гибкое управление на этапе генерации.
4x increase in inference speed for multi-reference generation2x increase in inference speed for single reference generation