K² · Искусственный интеллект
Заставьте нейросеть делать одно дело за раз — и она учится лучше
Авторы выдвигают гипотезу о разделении состояния и предсказания, согласно которой отделение функции предсказания следующего токена от функции сохранения состояния в Трансформере повышает качество языкового моделирования.
GM
NG
Giovanni Monea, Nathan Godey, Kianté Brantley и др.
4 автора · cs.CL, cs.AI, cs.LG
Суть за 30 секунд
Языковая модель вроде ChatGPT в каждый момент делает две работы разом.
- Они разработали вариант Трансформера, использующий два отдельных потока вычислений для разделения функции предсказания и функции сохранения состояния.
- Они провели эксперименты предварительного обучения в различных масштабах для проверки гипотезы.
- Эксперименты показывают, что разделение состояния и предсказания последовательно дает лучшую эффективность по данным и вычислительным ресурсам.
Outperforms standard Transformers by 2 to 3 percentage points on average on downstream tasksTwo computation streams used to separate the prediction and state-storage functions